Best Open Source Models — 2026 Rankings

Open Source LLM Leaderboard

The definitive ranking of every major open source model — compared across reasoning, coding, math, software engineering, and instruction following benchmarks.

Roshan Desai

Roshan Desai · Last updated: 2026-07-20

S

Kimi K3

2.8T

GLM-5.2

753B

DeepSeek-V4-Pro

1.6T

Kimi K2.6

1T

A

MiniMax M3

428B

DeepSeek-V4-Flash

284B

Hunyuan Hy3

295B

Step-3.7-Flash

198B

Qwen3.6-27B

27B

Qwen3.6-35B-A3B

35B

Nemotron 3 Ultra

550B

GLM-4.7

355B

MiMo-V2-Flash

309B

DeepSeek R1

671B

B

MiniMax M2.7

230B

Gemma 4 31B

31B

Mistral Medium 3.5

128B

Command A+

218B

Ling-2.6-1T

1T

Nemotron 3 Super

120B

MiMo-V2.5-Pro

1.02T

Mistral Small 4

119B

GPT-oss 120B

117B

Nemotron Ultra 253B

253B

Nemotron Super 49B

49B

Step3

316B

C

Llama 4 Maverick

400B

Gemma 3 27B

27B

Nemotron Nano 30B

30B

D

Best Open Source Models by Task — Benchmark Rankings

Which open source LLM is best for coding, reasoning, or math? See how every model stacks up across key benchmarks — hover any bar for details.

Best Overall (MMLU)

General knowledge across 57 subjects (MMLU)

Best Overall Knowledge

Advanced knowledge across subjects (MMLU-Pro)

Open Source Model Benchmark Scores

Complete benchmark results for every open source LLM. Click any column header to sort and rank. Scores sourced from official tech reports.

Filter:

Command A+

Cohere

218B

128K

N/A

76.1

N/A

N/A

N/A

N/A

N/A

N/A

N/A

75.1

DeepSeek R1

DeepSeek

671B

128K

84.0

71.5

83.3

1398

49.2

90.2

65.9

87.5

97.3

90.8

DeepSeek V3.2

DeepSeek

685B

130K

85.0

79.9

N/A

1423

67.8

N/A

74.1

89.3

N/A

88.5

DeepSeek-V4-Flash

DeepSeek

284B

1M

86.2

88.1

N/A

N/A

79.0

N/A

91.6

N/A

N/A

N/A

DeepSeek-V4-Pro

DeepSeek

1.6T

1M

87.5

90.1

N/A

N/A

80.6

N/A

93.5

N/A

N/A

N/A

Gemma 3 27B

Google

27B

128K

67.5

42.4

N/A

1366

N/A

N/A

29.7

N/A

89.0

N/A

Gemma 4 31B

Google

31B

262K

85.2

84.3

N/A

1451

N/A

N/A

80.0

N/A

N/A

N/A

GLM-4.7

Zhipu AI

355B

200K

84.3

85.7

88.0

1441

73.8

94.2

84.9

95.7

N/A

90.1

GLM-5.2

Zhipu AI

753B

1M

N/A

91.2

N/A

1468

N/A

N/A

N/A

N/A

N/A

N/A

GPT-oss 120B

OpenAI

117B

128K

90.0

80.9

N/A

1355

62.4

88.3

60.0

97.9

N/A

90.0

Hunyuan Hy3

Tencent

295B

262K

N/A

90.4

N/A

1412

78.0

N/A

N/A

N/A

N/A

N/A

Kimi K2.6

Moonshot

1T

262K

N/A

90.5

N/A

N/A

80.2

N/A

89.6

N/A

N/A

N/A

Kimi K3

Moonshot

2.8T

1M

N/A

93.5

N/A

1486

N/A

N/A

N/A

N/A

N/A

N/A

Ling-2.6-1T

Ant Group

1T

262K

N/A

76.2

N/A

N/A

72.2

N/A

65.6

N/A

N/A

N/A

Llama 4 Maverick

Meta

400B

1M

80.5

69.8

N/A

1328

N/A

62.0

43.4

N/A

N/A

85.5

MiMo-V2-Flash

Xiaomi

309B

262K

84.9

83.7

N/A

1393

73.4

84.8

80.6

94.1

N/A

86.7

MiMo-V2.5-Pro

Xiaomi

1.02T

1M

68.5

66.7

N/A

N/A

N/A

N/A

39.6

N/A

N/A

89.4

MiniMax M2.7

MiniMax

230B

205K

N/A

N/A

N/A

1417

N/A

N/A

N/A

N/A

N/A

N/A

MiniMax M3

MiniMax

428B

1M

N/A

N/A

N/A

1445

80.5

N/A

N/A

N/A

N/A

N/A

Mistral Medium 3.5

Mistral

128B

256K

N/A

74.8

N/A

1427

77.6

N/A

N/A

N/A

N/A

N/A

Mistral Small 4

Mistral

119B

262K

N/A

71.2

N/A

N/A

N/A

N/A

N/A

N/A

N/A

N/A

Nemotron 3 Super

Nvidia

120B

1M

83.7

79.2

N/A

N/A

60.5

N/A

81.2

90.2

N/A

N/A

Nemotron 3 Ultra

Nvidia

550B

1M

86.8

87.0

81.7

N/A

70.7

N/A

89.0

N/A

N/A

N/A

Nemotron Nano 30B

Nvidia

30B

1M

78.1

78.1

N/A

1318

N/A

N/A

N/A

N/A

N/A

N/A

Nemotron Super 49B

Nvidia

49B

128K

79.5

72.0

88.6

1342

N/A

N/A

73.6

82.7

97.4

N/A

Nemotron Ultra 253B

Nvidia

253B

128K

N/A

76.0

89.5

1348

N/A

N/A

66.3

72.5

97.0

N/A

Qwen 3.5

Qwen

397B

262K

87.8

88.4

92.6

1450

76.4

N/A

83.6

N/A

N/A

88.5

Qwen3.6-27B

Qwen

27B

262K

86.2

87.8

N/A

N/A

77.2

N/A

83.9

N/A

N/A

N/A

Qwen3.6-35B-A3B

Qwen

35B

262K

85.2

86.0

N/A

N/A

73.4

N/A

80.4

N/A

N/A

N/A

Step-3.5-Flash

Stepfun

196B

262K

85.8

N/A

N/A

1389

74.4

81.1

86.4

99.8

N/A

N/A

Step-3.7-Flash

Stepfun

198B

262K

N/A

N/A

N/A

N/A

76.5

N/A

N/A

N/A

N/A

N/A

Step3

Stepfun

316B

66K

N/A

73.0

N/A

1348

N/A

N/A

67.1

82.9

N/A

N/A

Compare Open Source LLMs Head-to-Head

Select two open source models to see how they stack up across all benchmarks.

Model A

Model B

Gemma 4 31B

Mistral Small 4

GPQA Diamond

84.3

vs

71.2

Benchmarks won

1

vs

0

Try These Open Source Models in Onyx

Onyx is the open-source AI platform that lets you connect any of these open source LLMs to your team's docs, apps, and people.

Best Open Source LLM Leaderboard 2026 | Open Source Model Rankings and Tier List | Onyx AI