Math benchmark

OTIS Mock AIME 2024-2025 leaderboard

As of October 2026, Claude Fable 5 has the highest published OTIS Mock AIME 2024-2025 score on Noometry at 100%, out of 173 models with results.

Last verified

About OTIS Mock AIME 2024-2025

Competition math problems in the style of the AIME, drawn from OTIS mock exams, with integer answers.

Category
Math
Introduced
2024
Format
Integer answer
Unit
Percent (random guessing ≈ 0.1%)
Official site
epoch.ai

Top 15 models

Top models on OTIS Mock AIME 2024-2025
  1. Claude Fable 5 100%
  2. Claude Fable 5.1 100%
  3. Claude Opus 5.5 100%
  4. Claude Sonnet 5.5 100%
  5. GPT-5.5 100%
  6. GPT-5.5 Pro 100%
  7. GPT-5.6 Sol 100%
  8. GPT-6.1 Sol 100%
  9. GPT-6 Astra 100%
  10. GPT-6 Sol 100%
  11. Qwen3.8 Max 100%
  12. GPT-5.6 Terra 99.7%
  13. Grok 4.6 99.2%
  14. Muse Spark 1.3 99.2%
  15. Claude Haiku 5.5 98.9%

Sponsored placements are available on pages like this one. Advertise on Noometry

All results

OTIS Mock AIME 2024-2025 results by model
#ModelProviderScoreSettingSourceDate
1Claude Fable 5 Anthropic100%highEpoch AI2026-08-06
2Claude Fable 5.1 Anthropic100%maxEpoch AI2026-09-01
3Claude Opus 5.5 Anthropic100%maxEpoch AI2026-09-22
4Claude Sonnet 5.5 Anthropic100%maxEpoch AI2026-09-29
5GPT-5.5 OpenAI100%xhighEpoch AI2026-04-24
6GPT-5.5 Pro OpenAI100%xhighEpoch AI2026-04-24
7GPT-5.6 Sol OpenAI100%maxEpoch AI2026-07-09
8GPT-6.1 Sol OpenAI100%maxEpoch AI2026-09-29
9GPT-6 Astra OpenAI100%maxEpoch AI2026-08-30
10GPT-6 Sol OpenAI100%maxEpoch AI2026-09-22
11Qwen3.8 Max Alibaba (Qwen)100%xhighEpoch AI2026-09-02
12GPT-5.6 Terra OpenAI99.7%maxEpoch AI2026-07-09
13Grok 4.6 xAI99.2%xhighEpoch AI2026-08-14
14Muse Spark 1.3 Meta99.2%xhighEpoch AI2026-09-17
15Claude Haiku 5.5 Anthropic98.9%xhighEpoch AI2026-10-07
16Claude Opus 5 Anthropic98.9%maxEpoch AI2026-07-24
17Gemini 3.8 Flash Google98.9%highEpoch AI2026-09-02
18GPT-6 Luna OpenAI98.9%maxEpoch AI2026-09-22
19DeepSeek V4 Pro DeepSeek98.6%maxEpoch AI2026-08-18
20Claude Opus 4.8 Anthropic98.3%maxEpoch AI2026-06-07
21DeepSeek V4.1 Flash DeepSeek98.3%maxEpoch AI2026-10-08
22GPT-5.6 Luna OpenAI98.3%maxEpoch AI2026-07-09
23Grok 4.7 xAI98.1%xhighEpoch AI2026-09-22
24Claude Opus 4.7 Anthropic97.8%xhighEpoch AI2026-04-17
25GPT-5.4 OpenAI97.8%highEpoch AI2026-07-15
26Grok 4.5 xAI97.8%highEpoch AI2026-07-08
27Gemini 3.7 Flash Google97.2%highEpoch AI2026-08-14
28Kimi K3 Moonshot AI97.2%maxEpoch AI2026-07-16
29GPT-5.2 OpenAI96.1%highEpoch AI2025-12-11
30Kimi K2.6 Moonshot AI96.1%Epoch AI2026-05-02
31Gemini 3.1 Pro Preview Google95.6%Epoch AI2026-02-20
32Gemini 3.5 Flash Google95.6%highEpoch AI2026-05-25
33Gemini 3 Flash Preview Google95.6%highEpoch AI2026-08-06
34Kimi K2.7 Code Moonshot AI95.6%Epoch AI2026-08-07
35Qwen3.7 Max Alibaba (Qwen)95.6%Epoch AI2026-08-07
36Claude Sonnet 5 Anthropic94.7%xhighEpoch AI2026-07-01
37Claude Opus 4.6 Anthropic94.4%64KEpoch AI2026-02-06
38DeepSeek V4 Flash DeepSeek94.4%maxEpoch AI2026-08-02
39Gemini 3.6 Flash Google94.2%highEpoch AI2026-08-02
40GLM-5.3-Flash Z.ai (Zhipu)93.9%maxEpoch AI2026-08-26
41GLM-5.1 Z.ai (Zhipu)93.3%Epoch AI2026-08-10
42Grok 4.3 xAI93.3%highEpoch AI2026-06-17
43Qwen3.6 Plus Alibaba (Qwen)93.3%Epoch AI2026-08-07
44Qwen3.7 Plus Alibaba (Qwen)93.3%Epoch AI2026-08-07
45Grok 4.20 (Non-Reasoning) xAI92.2%Epoch AI2026-07-13
46Kimi K2.5 Moonshot AI92.2%Epoch AI2026-02-02
47Gemini 3 Pro Google91.4%Epoch AI2025-11-19
48GPT-5 OpenAI91.4%highEpoch AI2025-10-29
49GLM-5.3 Z.ai (Zhipu)91.1%maxEpoch AI2026-08-24
50Qwen3.6 27B Alibaba (Qwen)91.1%Epoch AI2026-08-07
51Qwen3.6 Max Preview Alibaba (Qwen)91.1%Epoch AI2026-08-07
52Inkling-Small Thinking Machines Lab90%xhighEpoch AI2026-08-14
53Muse Spark Meta88.9%Epoch AI2026-04-08
54GPT-5.4 mini OpenAI88.9%xhighEpoch AI2026-08-07
55gpt-oss-120b OpenAI88.9%highEpoch AI2025-12-11
56Inkling Thinking Machines Lab88.9%xhighEpoch AI2026-08-05
57Qwen3.5 397B-A17B Alibaba (Qwen)88.9%Epoch AI2026-08-07
58GPT-5.1 OpenAI88.6%highEpoch AI2025-11-13
59DeepSeek-V3.2-Exp DeepSeek87.8%Epoch AI2025-12-16
60GPT-5.4 nano OpenAI87.8%highEpoch AI2026-04-14
61GPT-5 Mini OpenAI86.7%highEpoch AI2025-10-30
62Nemotron 3 Ultra NVIDIA86.7%Epoch AI2026-08-10
63Qwen3 235B-A22B Alibaba (Qwen)86.7%Epoch AI2025-12-10
64Qwen3.5 Plus Alibaba (Qwen)86.7%Epoch AI2026-08-07
65Qwen3.6 35B-A3B Alibaba (Qwen)86.7%Epoch AI2026-08-07
66Qwen3.7 Flash Alibaba (Qwen)86.7%Epoch AI2026-08-07
67GLM-5.2 Z.ai (Zhipu)86.4%maxEpoch AI2026-06-25
68Claude Opus 4.5 Anthropic86.1%32KEpoch AI2025-11-24
69Claude Sonnet 4.6 Anthropic85.8%32KEpoch AI2026-02-20
70Gemini 2.5 Pro Google84.7%Epoch AI2025-11-16
71o3 OpenAI84.4%mediumEpoch AI2026-08-07
72Qwen3.5-Flash Alibaba (Qwen)84.4%Epoch AI2026-08-07
73Qwen3.6 Flash Alibaba (Qwen)84.4%Epoch AI2026-08-07
74Grok 4 xAI84%Epoch AI
75GLM-4.7 Z.ai (Zhipu)83.3%Epoch AI2026-01-29
76Kimi K2 Thinking Turbo Moonshot AI83.1%Epoch AI2025-11-13
77Gemma 4 26B A4B IT Google82.2%minimalEpoch AI2026-08-28
78o4-mini OpenAI81.7%highEpoch AI2025-04-16
79GPT-5 Nano OpenAI81.1%highEpoch AI2025-10-31
80Gemini 3.1 Flash Lite Google80%highEpoch AI2026-08-06
81GLM-5 Z.ai (Zhipu)80%Epoch AI2026-02-12
82Claude Sonnet 4.5 Anthropic77.8%32KEpoch AI2025-10-21
83Grok-3 mini xAI77.8%highEpoch AI2025-04-10
84o3-mini OpenAI76.9%highEpoch AI2025-02-27
85Gemma 4 31B IT Google73.3%minimalEpoch AI2026-08-06
86o1 OpenAI73.3%highEpoch AI2026-07-15
87Qwen3 Max Alibaba (Qwen)73.3%Epoch AI2025-10-06
88Gemini 2.5 Flash Google73.1%Epoch AI2025-04-22
89Claude Sonnet 4 Anthropic71.1%32KEpoch AI2025-05-22
90Gemini 3.5 Flash Lite Google71.1%highEpoch AI2026-08-06
91MiniMax-M3 MiniMax71.1%Epoch AI2026-08-10
92Qwen3-30B-A3B Alibaba (Qwen)70.3%Epoch AI2026-08-30
93Qwen3.5 35B-A3B Alibaba (Qwen)70%noneEpoch AI2026-08-30
94Claude Opus 4.1 Anthropic68.9%27KEpoch AI2025-08-05
95GPT-5.5 Instant OpenAI68.1%Epoch AI2026-08-02
96Qwen3 32B Alibaba (Qwen)66.9%Epoch AI2026-08-30
97Claude Haiku 4.5 Anthropic66.7%32KEpoch AI2025-10-22
98DeepSeek-R1 DeepSeek66.4%Epoch AI2025-05-29
99Qwen3 14B Alibaba (Qwen)66.4%Epoch AI2026-08-28
100gpt-oss-20b OpenAI65.3%mediumEpoch AI2026-08-27
101Claude Opus 4 Anthropic64.4%27KEpoch AI2025-05-28
102Qwen3.5-9B Alibaba (Qwen)61.7%noneEpoch AI2026-08-27
103QwQ-32B Alibaba (Qwen)59.2%Epoch AI2026-08-28
104GLM-4.7-Flash Z.ai (Zhipu)58.3%Epoch AI2026-08-30
105Claude 3.7 Sonnet Anthropic57.8%64KEpoch AI2025-03-13
106Gemini 2.0 Flash (Feb 2025) Google57.8%Epoch AI2025-03-07
107Qwen3 8B Alibaba (Qwen)56.1%Epoch AI2026-08-27
108Qwen3.5-4B Alibaba (Qwen)55.8%noneEpoch AI2026-08-28
109DeepSeek-R1-Distill-Qwen-32B DeepSeek55.6%Epoch AI2026-08-28
110Grok 3 xAI55.6%Epoch AI2025-04-10
111Qwen3-4B Alibaba (Qwen)52.2%Epoch AI2026-08-28
112DeepSeek-R1-Distill-Llama-70B DeepSeek51.4%Epoch AI2025-03-07
113DeepSeek-R1-Distill-Qwen-14B DeepSeek50.6%Epoch AI2026-08-28
114o1-mini OpenAI46.9%highEpoch AI2025-03-06
115GPT-4.1 mini OpenAI44.7%Epoch AI2025-04-14
116GPT-4.1 OpenAI38.3%Epoch AI2025-04-14
117DeepSeek-V3 DeepSeek37.8%Epoch AI2025-04-01
118GPT-4.5 OpenAI37.8%Epoch AI2025-02-28
119Mistral Medium Mistral AI32.2%Epoch AI2025-05-07
120Mistral Small 3.2 Mistral AI30.3%Epoch AI2026-08-30
121Magistral Small Mistral AI30%Epoch AI2026-08-06
122GPT-4.1 nano OpenAI28.9%Epoch AI2025-04-14
123Gemini 1.5 Pro (May 2024) Google23.1%Epoch AI2025-02-25
124Gemma 3 27B Google22.5%Epoch AI2026-08-27
125DeepSeek-R1-Distill-Qwen-1.5B DeepSeek21.4%Epoch AI2026-08-28
126Llama 4 Maverick Meta20.6%Epoch AI2025-04-08
127Qwen Plus Alibaba (Qwen)17.8%Epoch AI2025-04-07
128Gemma 3 12B Google16.7%Epoch AI2026-08-28
129Gemini 1.5 Flash (May 2024) Google16.3%Epoch AI2025-02-25
130Qwen Max Alibaba (Qwen)16.1%Epoch AI2025-04-01
131Phi-4 Microsoft13.8%Epoch AI2025-02-25
132Grok-2 (Dec 2024) xAI11.5%Epoch AI2025-02-25
133Llama 3.1-405B Meta9.7%Epoch AI2025-02-25
134Claude 3.5 Sonnet Anthropic8.5%Epoch AI2025-02-25
135Mistral Large Mistral AI8.5%Epoch AI2025-02-25
136Qwen2.5 72B Instruct Alibaba (Qwen)8.1%Epoch AI2025-02-25
137Qwen3-1.7B Alibaba (Qwen)8.1%noneEpoch AI2026-08-28
138Llama 4 Scout Meta7.8%Epoch AI2025-04-08
139Gemma 3 4B Google7.5%Epoch AI2026-08-28
140Qwen2.5 32B Instruct Alibaba (Qwen)7.4%Epoch AI2025-02-25
141GPT-4o mini OpenAI6.9%Epoch AI2025-07-30
142GPT-4 Turbo OpenAI6.7%Epoch AI2025-02-27
143Mistral Small 3 Mistral AI6.7%Epoch AI2026-08-30
144GPT-4o OpenAI6.4%Epoch AI2025-02-25
145Qwen Turbo Alibaba (Qwen)6.1%Epoch AI2025-04-07
146Mistral Small Mistral AI5.8%Epoch AI2025-03-18
147Llama-3.3-70B-Instruct Meta5.1%Epoch AI2025-02-25
148Claude 3 Opus Anthropic4.7%Epoch AI2025-02-25
149Gemini 1.5 Flash 8B Google4.6%Epoch AI2025-02-25
150Tulu 3 (Tülu 3) 70B Allen Institute for AI (Ai2)4.4%Epoch AI2025-03-07
151Claude 3.5 Haiku Anthropic4.3%Epoch AI2025-02-25
152Llama 3-70B Meta4.3%Epoch AI2025-02-25
153Mistral Small 3.1 Mistral AI3.9%Epoch AI2026-08-30
154Llama 3.1-70B Meta3.6%Epoch AI2025-02-25
155Granite 4.0 Micro IBM2.8%Epoch AI2026-08-30
156Llama 3.2 90B Meta2.6%Epoch AI2025-02-25
157Claude 2 Anthropic2.5%Epoch AI2025-03-07
158Claude 3 Sonnet Anthropic2.5%Epoch AI2025-02-25
159Qwen2.5 7B Instruct Alibaba (Qwen)2.5%Epoch AI2026-08-30
160GPT-3.5-turbo OpenAI2.2%Epoch AI2026-08-07
161Claude 2.1 Anthropic1.9%Epoch AI2025-03-07
162Llama 3-8B Meta1.9%Epoch AI2026-08-30
163Claude 3 Haiku Anthropic1.8%Epoch AI2025-02-25
164Llama 3.1-8B Meta1.7%Epoch AI2026-08-27
165Gemma 2 27B Google1.4%Epoch AI2025-03-07
166Gemini 1.0 Pro Google1.1%Epoch AI2025-02-25
167Gemma 3 1B Google1.1%Epoch AI2026-08-28
168GPT-4 OpenAI1.1%Epoch AI2025-10-23
169DeepSeek LLM 67B DeepSeek0.8%Epoch AI2026-08-28
170Gemma 2 9B Google0.6%Epoch AI2025-03-07
171Llama 3.2 1B Meta0.6%Epoch AI2026-08-30
172Mistral 7B Mistral AI0.3%Epoch AI2026-08-30
173Llama 2-70B Meta0%Epoch AI2025-02-25

Compare the leaders

Other math benchmarks

Frequently asked questions

What does OTIS Mock AIME 2024-2025 measure?

Competition math problems in the style of the AIME, drawn from OTIS mock exams, with integer answers.

Which model has the highest OTIS Mock AIME 2024-2025 score?

As of October 2026, Claude Fable 5 has the highest published OTIS Mock AIME 2024-2025 score on Noometry at 100%, out of 173 models with results.

What is the best open-weight model on OTIS Mock AIME 2024-2025?

DeepSeek V4 Pro has the highest OTIS Mock AIME 2024-2025 accuracy among open-weight models at 98.6%, ranking 19 of 173 overall.