Math benchmark

Omni-MATH leaderboard

As of October 2026, GPT-5 Mini has the highest published Omni-MATH score on Noometry at 72.2%, out of 57 models with results.

Last verified

About Omni-MATH

Olympiad-level problems across 33 sub-domains and ten difficulty levels. HELM Capabilities run.

Category
Math
Introduced
2024
Size
4,428 problems
Format
Final answer
Unit
Percent (random guessing ≈ 0%)
Official site
crfm.stanford.edu

Top 15 models

Top models on Omni-MATH
  1. GPT-5 Mini 72.2%
  2. o4-mini 72%
  3. Qwen3 235B-A22B 71.8%
  4. o3 71.4%
  5. gpt-oss-120b 68.8%
  6. Kimi K2 (Jul 2025) 65.4%
  7. GPT-5 64.7%
  8. Claude Opus 4 61.6%
  9. Grok 4 60.3%
  10. Claude Sonnet 4 60.2%
  11. gpt-oss-20b 56.5%
  12. Claude Haiku 4.5 56.1%
  13. Gemini 3 Pro 55.5%
  14. Claude Sonnet 4.5 55.3%
  15. GPT-5 Nano 54.6%

Sponsored placements are available on pages like this one. Advertise on Noometry

All results

Omni-MATH results by model
#ModelProviderScoreSettingSourceDate
1GPT-5 Mini OpenAI72.2%HELM Capabilities
2o4-mini OpenAI72%HELM Capabilities
3Qwen3 235B-A22B Alibaba (Qwen)71.8%HELM Capabilities
4o3 OpenAI71.4%HELM Capabilities
5gpt-oss-120b OpenAI68.8%HELM Capabilities
6Kimi K2 (Jul 2025) Moonshot AI65.4%HELM Capabilities
7GPT-5 OpenAI64.7%HELM Capabilities
8Claude Opus 4 Anthropic61.6%HELM Capabilities
9Grok 4 xAI60.3%HELM Capabilities
10Claude Sonnet 4 Anthropic60.2%HELM Capabilities
11gpt-oss-20b OpenAI56.5%HELM Capabilities
12Claude Haiku 4.5 Anthropic56.1%HELM Capabilities
13Gemini 3 Pro Google55.5%HELM Capabilities
14Claude Sonnet 4.5 Anthropic55.3%HELM Capabilities
15GPT-5 Nano OpenAI54.6%HELM Capabilities
16GPT-4.1 mini OpenAI49.1%HELM Capabilities
17Gemini 2.5 Flash-Lite Google48%HELM Capabilities
18GPT-4.1 OpenAI47.1%HELM Capabilities
19Qwen3-Next 80B-A3B Instruct Alibaba (Qwen)46.7%HELM Capabilities
20Grok 3 xAI46.4%HELM Capabilities
21GPT-5.1 OpenAI46.4%HELM Capabilities
22Gemini 2.0 Flash (Feb 2025) Google45.9%HELM Capabilities
23DeepSeek-R1 DeepSeek42.4%HELM Capabilities
24Llama 4 Maverick Meta42.2%HELM Capabilities
25Gemini 2.5 Pro Google41.6%HELM Capabilities
26DeepSeek-V3 DeepSeek40.3%HELM Capabilities
27GLM-4.5-Air Z.ai (Zhipu)39.1%HELM Capabilities
28Gemini 2.5 Flash Google38.5%HELM Capabilities
29Gemini 2.0 Flash-Lite Google37.4%HELM Capabilities
30Llama 4 Scout Meta37.3%HELM Capabilities
31GPT-4.1 nano OpenAI36.7%HELM Capabilities
32Gemini 1.5 Pro (May 2024) Google36.4%HELM Capabilities
33Nova Premier 1.0 Amazon35%HELM Capabilities
34Claude 3.7 Sonnet Anthropic33%HELM Capabilities
35Qwen2.5 72B Instruct Alibaba (Qwen)33%HELM Capabilities
36Grok-3 mini xAI31.8%HELM Capabilities
37Gemini 1.5 Flash (May 2024) Google30.4%HELM Capabilities
38Granite 4.0 H Small IBM29.6%HELM Capabilities
39Qwen2.5 7B Instruct Alibaba (Qwen)29.4%HELM Capabilities
40GPT-4o OpenAI29.3%HELM Capabilities
41Mistral Large Mistral AI28.1%HELM Capabilities
42GPT-4o mini OpenAI28%HELM Capabilities
43Claude 3.5 Sonnet Anthropic27.6%HELM Capabilities
44Llama 3.1-405B Meta24.9%HELM Capabilities
45Mistral Small 3.1 Mistral AI24.8%HELM Capabilities
46Amazon Nova Pro Amazon24.2%HELM Capabilities
47Amazon Nova Lite Amazon23.3%HELM Capabilities
48Claude 3.5 Haiku Anthropic22.4%HELM Capabilities
49Amazon Nova Micro Amazon21.4%HELM Capabilities
50Llama 3.1-70B Meta21%HELM Capabilities
51Granite 4.0 Micro IBM20.9%HELM Capabilities
52Mixtral 8x22B Mistral AI16.3%HELM Capabilities
53Olmo 2 0325 32b Instruct Allen Institute for AI (Ai2)16.1%HELM Capabilities
54OLMo 2 Furious 13B Allen Institute for AI (Ai2)15.6%HELM Capabilities
55Llama 3.1-8B Meta13.7%HELM Capabilities
56Mixtral 8x7B Mistral AI10.5%HELM Capabilities
57Mistral Mistral AI7.2%HELM Capabilities

Compare the leaders

Other math benchmarks

Frequently asked questions

What does Omni-MATH measure?

Olympiad-level problems across 33 sub-domains and ten difficulty levels. HELM Capabilities run.

Which model has the highest Omni-MATH score?

As of October 2026, GPT-5 Mini has the highest published Omni-MATH score on Noometry at 72.2%, out of 57 models with results.

What is the best open-weight model on Omni-MATH?

Qwen3 235B-A22B has the highest Omni-MATH accuracy among open-weight models at 71.8%, ranking 3 of 57 overall.