Knowledge benchmark

MMLU-Pro leaderboard

As of October 2026, Gemini 3 Pro has the highest published MMLU-Pro score on Noometry at 90.3%, out of 58 models with results.

Last verified

About MMLU-Pro

Harder, reasoning-heavy successor to MMLU across 14 subjects, with ten answer options instead of four. HELM Capabilities run.

Category
Knowledge
Introduced
2024
Size
12,032 questions
Format
10-option multiple choice
Unit
Percent (random guessing ≈ 10%)
Official site
crfm.stanford.edu

Top 15 models

Top models on MMLU-Pro
  1. Gemini 3 Pro 90.3%
  2. Claude Opus 4 87.5%
  3. Claude Sonnet 4.5 86.9%
  4. Gemini 2.5 Pro 86.3%
  5. GPT-5 86.3%
  6. o3 85.9%
  7. Grok 4 85.1%
  8. Qwen3 235B-A22B 84.4%
  9. Claude Sonnet 4 84.3%
  10. Claude Sonnet 4 84.3%
  11. GPT-5 Mini 83.5%
  12. o4-mini 82%
  13. Kimi K2 (Jul 2025) 81.9%
  14. GPT-4.1 81.1%
  15. Llama 4 Maverick 81%

Sponsored placements are available on pages like this one. Advertise on Noometry

All results

MMLU-Pro results by model
#ModelProviderScoreSettingSourceDate
1Gemini 3 Pro Google90.3%HELM Capabilities
2Claude Opus 4 Anthropic87.5%HELM Capabilities
3Claude Sonnet 4.5 Anthropic86.9%HELM Capabilities
4Gemini 2.5 Pro Google86.3%HELM Capabilities
5GPT-5 OpenAI86.3%HELM Capabilities
6o3 OpenAI85.9%HELM Capabilities
7Grok 4 xAI85.1%HELM Capabilities
8Qwen3 235B-A22B Alibaba (Qwen)84.4%HELM Capabilities
9Claude Sonnet 4 Anthropic84.3%HELM Capabilities
10Claude Sonnet 4 Anthropic84.3%HELM Capabilities
11GPT-5 Mini OpenAI83.5%HELM Capabilities
12o4-mini OpenAI82%HELM Capabilities
13Kimi K2 (Jul 2025) Moonshot AI81.9%HELM Capabilities
14GPT-4.1 OpenAI81.1%HELM Capabilities
15Llama 4 Maverick Meta81%HELM Capabilities
16Grok-3 mini xAI79.9%HELM Capabilities
17gpt-oss-120b OpenAI79.5%HELM Capabilities
18DeepSeek-R1 DeepSeek79.3%HELM Capabilities
19Grok 3 xAI78.8%HELM Capabilities
20Qwen3-Next 80B-A3B Instruct Alibaba (Qwen)78.6%HELM Capabilities
21Claude 3.7 Sonnet Anthropic78.4%HELM Capabilities
22GPT-4.1 mini OpenAI78.3%HELM Capabilities
23GPT-5 Nano OpenAI77.8%HELM Capabilities
24Claude 3.5 Sonnet Anthropic77.7%HELM Capabilities
25Claude Haiku 4.5 Anthropic77.7%HELM Capabilities
26GLM-4.5-Air Z.ai (Zhipu)76.2%HELM Capabilities
27Llama 4 Scout Meta74.2%HELM Capabilities
28gpt-oss-20b OpenAI74%HELM Capabilities
29Gemini 1.5 Pro (May 2024) Google73.7%HELM Capabilities
30Gemini 2.0 Flash (Feb 2025) Google73.7%HELM Capabilities
31Nova Premier 1.0 Amazon72.6%HELM Capabilities
32DeepSeek-V3 DeepSeek72.3%HELM Capabilities
33Llama 3.1-405B Meta72.3%HELM Capabilities
34Gemini 2.0 Flash-Lite Google72%HELM Capabilities
35GPT-4o OpenAI71.3%HELM Capabilities
36Gemini 1.5 Flash (May 2024) Google67.8%HELM Capabilities
37Amazon Nova Pro Amazon67.3%HELM Capabilities
38Llama 3.1-70B Meta65.3%HELM Capabilities
39Gemini 2.5 Flash Google63.9%HELM Capabilities
40Qwen2.5 72B Instruct Alibaba (Qwen)63.1%HELM Capabilities
41Mistral Small 3.1 Mistral AI61%HELM Capabilities
42Claude 3.5 Haiku Anthropic60.5%HELM Capabilities
43GPT-4o mini OpenAI60.3%HELM Capabilities
44Amazon Nova Lite Amazon60%HELM Capabilities
45Mistral Large Mistral AI59.9%HELM Capabilities
46GPT-5.1 OpenAI57.9%HELM Capabilities
47Granite 4.0 H Small IBM56.9%HELM Capabilities
48GPT-4.1 nano OpenAI55%HELM Capabilities
49Qwen2.5 7B Instruct Alibaba (Qwen)53.9%HELM Capabilities
50Gemini 2.5 Flash-Lite Google53.7%HELM Capabilities
51Amazon Nova Micro Amazon51.1%HELM Capabilities
52Mixtral 8x22B Mistral AI46%HELM Capabilities
53Olmo 2 0325 32b Instruct Allen Institute for AI (Ai2)41.4%HELM Capabilities
54Llama 3.1-8B Meta40.6%HELM Capabilities
55Granite 4.0 Micro IBM39.5%HELM Capabilities
56Mixtral 8x7B Mistral AI33.5%HELM Capabilities
57OLMo 2 Furious 13B Allen Institute for AI (Ai2)31%HELM Capabilities
58Mistral Mistral AI27.7%HELM Capabilities

Compare the leaders

Other knowledge benchmarks

Frequently asked questions

What does MMLU-Pro measure?

Harder, reasoning-heavy successor to MMLU across 14 subjects, with ten answer options instead of four. HELM Capabilities run.

Which model has the highest MMLU-Pro score?

As of October 2026, Gemini 3 Pro has the highest published MMLU-Pro score on Noometry at 90.3%, out of 58 models with results.

What is the best open-weight model on MMLU-Pro?

Qwen3 235B-A22B has the highest MMLU-Pro accuracy among open-weight models at 84.4%, ranking 8 of 58 overall.