Model comparison

Claude Sonnet 4.5 vs Gemini 3 Pro

Gemini 3 Pro is the stronger model overall, scoring 54.8 to 44.1 on the Noometry Index.

Last verified . 62 shared benchmarks.

Claude Sonnet 4.5 Anthropic

44.1

Rank #81 Confirmed

Gemini 3 Pro Google

54.8

Rank #28 Confirmed

Summary

  • They share 62 benchmarks with published results for both. Claude Sonnet 4.5 scores higher in 2 categories and Gemini 3 Pro in 8 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Gemini 3 Pro leads 52.5 to 26.9.
  • The biggest single-benchmark swing is NYT Connections (extended): 37.3% for Claude Sonnet 4.5 and 94.4% for Gemini 3 Pro.

Side by side

Claude Sonnet 4.5 and Gemini 3 Pro specifications
Claude Sonnet 4.5Gemini 3 Pro
ProviderAnthropicGoogle
Noometry Index44.154.8
Released2025-09-292025-11-18
WeightsProprietaryProprietary
Context window200K—
Max output64K—
Input $ / M tokens$3—
Output $ / M tokens$15—
Results tracked7367

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemini 3 Pro leads

Claude Sonnet 4.5: 47.3 (#61), Gemini 3 Pro: 51.6 (#39)

Coding benchmarks
BenchmarkClaude Sonnet 4.5Gemini 3 Pro
SWE-bench Verified71.3%72.9%
SWE-bench Verified (bash only)71.4%74.2%
LMArena WebDev13931440
SWE-bench Multilingual67%68.7%
GSO14.7%18.6%
WeirdML47.7%69.9%
LMArena Coding14891481
ALE-Bench796.151,177
AlgoTune1.521.83
SciCode44.7%—

Agentic & Tool Use Gemini 3 Pro leads

Claude Sonnet 4.5: 38.3 (#32), Gemini 3 Pro: 40.6 (#23)

Agentic & Tool Use benchmarks
BenchmarkClaude Sonnet 4.5Gemini 3 Pro
Terminal-Bench46.5%69.4%
Berkeley Function Calling Leaderboard73.2%72.5%
GDPval42.5%40.3%
Remote Labor Index2.1%1.3%
τ²-bench Airline72%80.5%
τ²-bench Banking25.3%18%
τ²-bench Retail72.4%75.9%
τ²-bench Telecom84.9%91%
DeepResearch Bench52.6%46.3%
LMArena Search11591207
METR Time Horizons67.4%71%
Vending-Bench 23,8395,478
Cybench60%—
OSWorld62.9%—
BALROG—58.1%

Reasoning Gemini 3 Pro leads

Claude Sonnet 4.5: 26.9 (#125), Gemini 3 Pro: 52.5 (#31)

Reasoning benchmarks
BenchmarkClaude Sonnet 4.5Gemini 3 Pro
ARC-AGI-213.6%31.1%
SimpleBench54.3%76.4%
Kagi LLM Benchmark57.9%80.1%
NYT Connections (extended)37.3%94.4%
ARC-AGI-163.7%75%
CritPt1.1%6.9%
Chess Puzzles12%31%
EnigmaEval6%18.2%
LMArena Hard Prompts14621480
Epoch Capabilities Index146.84152.92
ForecastBench61.961.2
EBR-Bench2.4%—
Mystery Game Puzzles17%—
DTBench83.2%—
LMCA38.8%—

Math Gemini 3 Pro leads

Claude Sonnet 4.5: 32.3 (#216), Gemini 3 Pro: 49.9 (#59)

Math benchmarks
BenchmarkClaude Sonnet 4.5Gemini 3 Pro
OTIS Mock AIME 2024-202577.8%91.4%
ProofBench19%20%
Omni-MATH55.3%55.5%
LMArena Math14491476
FrontierMath (Feb 2025 set)15.2%37.6%
FrontierMath Tier 4 (v1)4.2%18.8%
FrontierMath (Tiers 1-3)23.9%—
FrontierMath Tier 42.4%—
MathArena Final-Answer Competitions—67%
MATH Level 597.7%—

Knowledge Gemini 3 Pro leads

Claude Sonnet 4.5: 48.4 (#76), Gemini 3 Pro: 64.4 (#16)

Knowledge benchmarks
BenchmarkClaude Sonnet 4.5Gemini 3 Pro
GPQA Diamond82.3%92.6%
Humanity's Last Exam13.7%37.5%
MMLU-Pro86.9%90.3%
Vectara Hallucination Rate12%13.6%
GPQA (HELM)68.6%80.3%
LMArena Expert14821475
SimpleQA Verified30.7%—

Multimodal Gemini 3 Pro leads

Claude Sonnet 4.5: 34.8 (#89), Gemini 3 Pro: 57.6 (#2)

Multimodal benchmarks
BenchmarkClaude Sonnet 4.5Gemini 3 Pro
VPCT39.8%91%
LMArena Document14501434
LMArena Vision—1305
GeoBench—84%

Multilingual Gemini 3 Pro leads

Claude Sonnet 4.5: 53.4 (#69), Gemini 3 Pro: 56.9 (#16)

Multilingual benchmarks
BenchmarkClaude Sonnet 4.5Gemini 3 Pro
LMArena Non-English14251474
LMArena Chinese14591523
LMArena French14581492
LMArena German14271515
LMArena Japanese13901510
LMArena Korean14031448
LMArena Russian14371493
LMArena Spanish14571470

Instruction Following Gemini 3 Pro leads

Claude Sonnet 4.5: 75.0 (#78), Gemini 3 Pro: 76.3 (#45)

Instruction Following benchmarks
BenchmarkClaude Sonnet 4.5Gemini 3 Pro
IFEval85%87.7%
LMArena Instruction Following14591458

Long Context Claude Sonnet 4.5 leads

Claude Sonnet 4.5: 45.2 (#46), Gemini 3 Pro: 44.0 (#79)

Long Context benchmarks
BenchmarkClaude Sonnet 4.5Gemini 3 Pro
LMArena Longer Query14761471
CL-bench—15.8%

Writing & Preference Too close to call

Claude Sonnet 4.5: 66.5 (#34), Gemini 3 Pro: 66.4 (#35)

Writing & Preference benchmarks
BenchmarkClaude Sonnet 4.5Gemini 3 Pro
LMArena Text14391479
LMArena Creative Writing14421482
EQ-Bench Creative Writing16781525
WildBench85.4%85.9%
LMArena Multi-Turn14651484

Frequently asked questions

Is Claude Sonnet 4.5 better than Gemini 3 Pro?

Gemini 3 Pro is the stronger model overall, scoring 54.8 to 44.1 on the Noometry Index.

Is Claude Sonnet 4.5 or Gemini 3 Pro better for coding?

Gemini 3 Pro scores higher on coding benchmarks: 51.6 versus 47.3 in the Noometry coding category.

How many benchmarks do Claude Sonnet 4.5 and Gemini 3 Pro share?

62 benchmarks have published results for both models. Claude Sonnet 4.5 has 73 scored results on Noometry and Gemini 3 Pro has 67.

Related comparisons

Go deeper