Knowledge benchmark

GPQA (HELM) leaderboard

As of October 2026, Gemini 3 Pro has the highest published GPQA (HELM) score on Noometry at 80.3%, out of 57 models with results.

Last verified

About GPQA (HELM)

Graduate-level biology, physics and chemistry questions written to be hard to look up, run by HELM Capabilities with chain-of-thought.

Category
Knowledge
Introduced
2023
Format
4-option multiple choice
Unit
Percent (random guessing ≈ 25%)
Official site
crfm.stanford.edu

Top 15 models

Top models on GPQA (HELM)
  1. Gemini 3 Pro 80.3%
  2. GPT-5 79.2%
  3. GPT-5 Mini 75.6%
  4. o3 75.3%
  5. Gemini 2.5 Pro 74.9%
  6. o4-mini 73.5%
  7. Grok 4 72.7%
  8. Qwen3 235B-A22B 72.7%
  9. Claude Opus 4 70.8%
  10. Claude Sonnet 4 70.6%
  11. Claude Sonnet 4.5 68.6%
  12. gpt-oss-120b 68.4%
  13. GPT-5 Nano 67.9%
  14. Grok-3 mini 67.5%
  15. DeepSeek-R1 66.6%

Sponsored placements are available on pages like this one. Advertise on Noometry

All results

GPQA (HELM) results by model
#ModelProviderScoreSettingSourceDate
1Gemini 3 Pro Google80.3%HELM Capabilities
2GPT-5 OpenAI79.2%HELM Capabilities
3GPT-5 Mini OpenAI75.6%HELM Capabilities
4o3 OpenAI75.3%HELM Capabilities
5Gemini 2.5 Pro Google74.9%HELM Capabilities
6o4-mini OpenAI73.5%HELM Capabilities
7Grok 4 xAI72.7%HELM Capabilities
8Qwen3 235B-A22B Alibaba (Qwen)72.7%HELM Capabilities
9Claude Opus 4 Anthropic70.8%HELM Capabilities
10Claude Sonnet 4 Anthropic70.6%HELM Capabilities
11Claude Sonnet 4.5 Anthropic68.6%HELM Capabilities
12gpt-oss-120b OpenAI68.4%HELM Capabilities
13GPT-5 Nano OpenAI67.9%HELM Capabilities
14Grok-3 mini xAI67.5%HELM Capabilities
15DeepSeek-R1 DeepSeek66.6%HELM Capabilities
16GPT-4.1 OpenAI65.9%HELM Capabilities
17Kimi K2 (Jul 2025) Moonshot AI65.3%HELM Capabilities
18Grok 3 xAI65%HELM Capabilities
19Llama 4 Maverick Meta65%HELM Capabilities
20Qwen3-Next 80B-A3B Instruct Alibaba (Qwen)63%HELM Capabilities
21GPT-4.1 mini OpenAI61.4%HELM Capabilities
22Claude 3.7 Sonnet Anthropic60.8%HELM Capabilities
23Claude Haiku 4.5 Anthropic60.5%HELM Capabilities
24GLM-4.5-Air Z.ai (Zhipu)59.4%HELM Capabilities
25gpt-oss-20b OpenAI59.4%HELM Capabilities
26Claude 3.5 Sonnet Anthropic56.5%HELM Capabilities
27Gemini 2.0 Flash (Feb 2025) Google55.6%HELM Capabilities
28DeepSeek-V3 DeepSeek53.8%HELM Capabilities
29Gemini 1.5 Pro (May 2024) Google53.4%HELM Capabilities
30Llama 3.1-405B Meta52.2%HELM Capabilities
31GPT-4o OpenAI52%HELM Capabilities
32Nova Premier 1.0 Amazon51.8%HELM Capabilities
33GPT-4.1 nano OpenAI50.7%HELM Capabilities
34Llama 4 Scout Meta50.7%HELM Capabilities
35Gemini 2.0 Flash-Lite Google50%HELM Capabilities
36Amazon Nova Pro Amazon44.6%HELM Capabilities
37GPT-5.1 OpenAI44.2%HELM Capabilities
38Gemini 1.5 Flash (May 2024) Google43.7%HELM Capabilities
39Mistral Large Mistral AI43.5%HELM Capabilities
40Llama 3.1-70B Meta42.6%HELM Capabilities
41Qwen2.5 72B Instruct Alibaba (Qwen)42.6%HELM Capabilities
42Amazon Nova Lite Amazon39.7%HELM Capabilities
43Mistral Small 3.1 Mistral AI39.2%HELM Capabilities
44Gemini 2.5 Flash Google39%HELM Capabilities
45Amazon Nova Micro Amazon38.3%HELM Capabilities
46Granite 4.0 H Small IBM38.3%HELM Capabilities
47GPT-4o mini OpenAI36.8%HELM Capabilities
48Claude 3.5 Haiku Anthropic36.3%HELM Capabilities
49Qwen2.5 7B Instruct Alibaba (Qwen)34.1%HELM Capabilities
50Mixtral 8x22B Mistral AI33.4%HELM Capabilities
51OLMo 2 Furious 13B Allen Institute for AI (Ai2)31.6%HELM Capabilities
52Gemini 2.5 Flash-Lite Google30.9%HELM Capabilities
53Granite 4.0 Micro IBM30.7%HELM Capabilities
54Mistral Mistral AI30.3%HELM Capabilities
55Mixtral 8x7B Mistral AI29.6%HELM Capabilities
56Olmo 2 0325 32b Instruct Allen Institute for AI (Ai2)28.7%HELM Capabilities
57Llama 3.1-8B Meta24.7%HELM Capabilities

Compare the leaders

Other knowledge benchmarks

Frequently asked questions

What does GPQA (HELM) measure?

Graduate-level biology, physics and chemistry questions written to be hard to look up, run by HELM Capabilities with chain-of-thought.

Which model has the highest GPQA (HELM) score?

As of October 2026, Gemini 3 Pro has the highest published GPQA (HELM) score on Noometry at 80.3%, out of 57 models with results.

What is the best open-weight model on GPQA (HELM)?

Qwen3 235B-A22B has the highest GPQA (HELM) accuracy among open-weight models at 72.7%, ranking 8 of 57 overall.