Knowledge benchmark

MMLU leaderboard

As of October 2026, GPT-4o has the highest published MMLU score on Noometry at 88.1%, out of 81 models with results.

Last verified

About MMLU

57-subject multiple-choice exam covering STEM, humanities and professional topics.

Category
Knowledge
Introduced
2020
Size
About 14,000 questions
Format
Multiple choice (4 options)
Unit
Percent (random guessing ≈ 25%)
Official site
arxiv.org

Top 15 models

Top models on MMLU
  1. GPT-4o 88.1%
  2. Claude 3.5 Sonnet 87.3%
  3. DeepSeek-V3 87.2%
  4. Gemini 1.5 Pro (May 2024) 86.9%
  5. GPT-4 86.4%
  6. Llama-3.3-70B-Instruct 86.3%
  7. Qwen2.5 72B Instruct 85.3%
  8. Phi-4 84.8%
  9. Claude 3 Opus 84.6%
  10. Llama 3.1-405B 84.5%
  11. Qwen2-72B 82.4%
  12. Amazon Nova Pro 82%
  13. GPT-4o mini 81.8%
  14. GPT-4 Turbo 81.3%
  15. Llama 3.2 90B 80.3%

Sponsored placements are available on pages like this one. Advertise on Noometry

All results

MMLU results by model
#ModelProviderScoreSettingSourceDate
1GPT-4o OpenAI88.1%Epoch AI
2Claude 3.5 Sonnet Anthropic87.3%Epoch AI
3DeepSeek-V3 DeepSeek87.2%Epoch AI
4Gemini 1.5 Pro (May 2024) Google86.9%Epoch AI
5GPT-4 OpenAI86.4%Epoch AI
6Llama-3.3-70B-Instruct Meta86.3%Epoch AI
7Qwen2.5 72B Instruct Alibaba (Qwen)85.3%Epoch AI
8Phi-4 Microsoft84.8%Epoch AI
9Claude 3 Opus Anthropic84.6%Epoch AI
10Llama 3.1-405B Meta84.5%Epoch AI
11Qwen2-72B Alibaba (Qwen)82.4%Epoch AI
12Amazon Nova Pro Amazon82%Epoch AI
13GPT-4o mini OpenAI81.8%Epoch AI
14GPT-4 Turbo OpenAI81.3%Epoch AI
15Llama 3.2 90B Meta80.3%Epoch AI
16Llama 3.1-70B Meta80.1%Epoch AI
17Mistral Large Mistral AI80%Epoch AI
18Qwen2.5 14B Instruct Alibaba (Qwen)79.9%Epoch AI
19Gemini 2.0 Flash (Feb 2025) Google79.7%Epoch AI
20Llama 3-70B Meta79.3%Epoch AI
21Yi-Large 01.AI79.3%Epoch AI
22Qwen2.5-Coder-32B Alibaba (Qwen)79.1%Epoch AI
23Claude 2 Anthropic78.5%Epoch AI
24DeepSeek-V2 (MoE-236B, May 2024) DeepSeek78.4%Epoch AI
25phi-3-medium 14B Microsoft78%Epoch AI
26Gemini 1.5 Flash (May 2024) Google77.9%Epoch AI
27Mixtral 8x22B Mistral AI77.8%Epoch AI
28Amazon Nova Lite Amazon77%Epoch AI
29Claude 1.3 Anthropic77%Epoch AI
30Yi-34B 01.AI76.3%Epoch AI
31Claude 3 Sonnet Anthropic75.9%Epoch AI
32Gemma 2 27B Google75.7%Epoch AI
33Phi 3 Small 8k Instruct Microsoft75.7%Epoch AI
34Qwen1.5-32B Alibaba (Qwen)74.4%Epoch AI
35Claude 3.5 Haiku Anthropic74.3%Epoch AI
36Claude 3 Haiku Anthropic73.8%Epoch AI
37Claude 2.1 Anthropic73.5%Epoch AI
38Claude Instant Anthropic73.4%Epoch AI
39Qwen2.5 7B Instruct Alibaba (Qwen)72.9%Epoch AI
40Gemma 2 9B Google72.1%Epoch AI
41GPT-3.5-turbo OpenAI71.4%Epoch AI
42Amazon Nova Micro Amazon70.8%Epoch AI
43Falcon-180B Technology Innovation Institute70.6%Epoch AI
44Mixtral 8x7B Mistral AI70.6%Epoch AI
45Gemini 1.0 Pro Google70%Epoch AI
46Llama 2-70B Meta69.9%Epoch AI
47Command R+ Cohere69.4%Epoch AI
48Llama 3-8B Meta68.8%Epoch AI
49Phi 3 Mini 4k Instruct Microsoft68.8%Epoch AI
50Mistral Small Mistral AI68.7%Epoch AI
51Qwen1.5-14B Alibaba (Qwen)68.6%Epoch AI
52Qwen2.5-Coder (1.5B) Alibaba (Qwen)68%Epoch AI
53Qwen-14B Alibaba (Qwen)66.3%Epoch AI
54Gemma 7B Google66.1%Epoch AI
55Command R Cohere65.2%Epoch AI
56StarCoder 2 15B NVIDIA64.1%Epoch AI
57Yi 6B 01.AI64%Epoch AI
58Llama 2-34B Meta62.6%Epoch AI
59Qwen1.5-7B Alibaba (Qwen)62.6%Epoch AI
60Mistral 7B Mistral AI62.5%Epoch AI
61Mistral 7B Mistral AI62.5%Epoch AI
62Nemotron-4 15B NVIDIA58.7%Epoch AI
63Falcon 2 11B Technology Innovation Institute58.4%Epoch AI
64Phi-2 Microsoft58.4%Epoch AI
65Falcon-40B Technology Innovation Institute56.9%Epoch AI
66Llama 3.2 11B Meta56.5%Epoch AI
67Llama 3.1-8B Meta56.1%Epoch AI
68Llama 2-13B Meta55.6%Epoch AI
69INTELLECT-1 Hugging Face49.9%Epoch AI
70Llama 13b Meta47.7%Epoch AI
71Llama 2-7B Meta45.8%Epoch AI
72Qwen-7B Alibaba (Qwen)45%Epoch AI
73Gemma 2B Google42.3%Epoch AI
74DeepSeek Coder 33B DeepSeek39.4%Epoch AI
75StarCoder 2 7B NVIDIA38.8%Epoch AI
76Phi-1.5 Microsoft37.6%5Epoch AI
77StarCoder 2 3B NVIDIA36.6%Epoch AI
78DeepSeek Coder 6.7B DeepSeek36.4%Epoch AI
79Falcon-7B Technology Innovation Institute35%Epoch AI
80Dolly 2.0-12b Databricks26.2%Epoch AI
81DeepSeek Coder 1.3B DeepSeek25.8%Epoch AI

Compare the leaders

Other knowledge benchmarks

Frequently asked questions

What does MMLU measure?

57-subject multiple-choice exam covering STEM, humanities and professional topics.

Which model has the highest MMLU score?

As of October 2026, GPT-4o has the highest published MMLU score on Noometry at 88.1%, out of 81 models with results.

What is the best open-weight model on MMLU?

DeepSeek-V3 has the highest MMLU accuracy among open-weight models at 87.2%, ranking 3 of 81 overall.