Model comparison

Claude Sonnet 4.6 vs Gemini 3.1 Pro Preview

Gemini 3.1 Pro Preview is the stronger model overall, scoring 56.7 to 50.3 on the Noometry Index.

Last verified . 54 shared benchmarks.

Claude Sonnet 4.6 Anthropic

50.3

Rank #50 Confirmed

Gemini 3.1 Pro Preview Google

56.7

Rank #23 Confirmed

Summary

  • They share 54 benchmarks with published results for both. Claude Sonnet 4.6 scores higher in 5 categories and Gemini 3.1 Pro Preview in 5 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Gemini 3.1 Pro Preview leads 71.7 to 46.1.
  • The biggest single-benchmark swing is GBAEval: 48.8% for Claude Sonnet 4.6 and 0.8% for Gemini 3.1 Pro Preview.
  • Gemini 3.1 Pro Preview is cheaper at $2 / $12 per million input/output tokens, against $3 / $15 for Claude Sonnet 4.6.
  • Gemini 3.1 Pro Preview accepts more context: 1.05M tokens versus 1M.

Side by side

Claude Sonnet 4.6 and Gemini 3.1 Pro Preview specifications
Claude Sonnet 4.6Gemini 3.1 Pro Preview
ProviderAnthropicGoogle
Noometry Index50.356.7
Released2026-02-172026-02-19
WeightsProprietaryProprietary
Context window1M1.05M
Max output128K66K
Input $ / M tokens$3$2
Output $ / M tokens$15$12
Results tracked5771

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 46.3 (#67), Gemini 3.1 Pro Preview: 42.5 (#99)

Coding benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3.1 Pro Preview
SWE-bench Verified75.2%75.6%
DeepSWE29.9%11.7%
LMArena WebDev15221447
SciCode46.8%58.9%
WeirdML66.1%72.1%
LMArena Coding15041484
ALE-Bench1,3271,161
FrontierCode24.3%—
GSO—22.6%
MirrorCode—8.9%
AlgoTune—2.02

Agentic & Tool Use Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 39.1 (#28), Gemini 3.1 Pro Preview: 37.7 (#34)

Agentic & Tool Use benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3.1 Pro Preview
Terminal-Bench53.4%80.2%
APEX-Agents43%35.3%
DeepResearch Bench54.9%47.8%
ExploitBench23.6%26.1%
GBAEval48.8%0.8%
GDP.pdf18%17%
LMArena Search12211211
Vending-Bench 27,2043,774
OSWorld 2.09.3%—
τ²-bench Banking—26%
OSWorld72.1%—
PostTrainBench—22%
BALROG—57%
METR Time Horizons—77%

Reasoning Gemini 3.1 Pro Preview leads

Claude Sonnet 4.6: 46.1 (#45), Gemini 3.1 Pro Preview: 71.7 (#12)

Reasoning benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3.1 Pro Preview
ARC-AGI-260.4%77.1%
NYT Connections (extended)80.9%97.4%
ARC-AGI-186.5%98%
CritPt3.1%17.7%
Chess Puzzles13%55%
Thematic Generalization76.3%79.4%
LMArena Hard Prompts14841485
Mystery Game Puzzles16%34%
DTBench89.9%97.1%
LMCA46.5%53.8%
Epoch Capabilities Index152.24154.77
ForecastBench6259
SimpleBench—79.6%
EnigmaEval—36.8%
EBR-Bench—14.3%

Math Gemini 3.1 Pro Preview leads

Claude Sonnet 4.6: 52.9 (#49), Gemini 3.1 Pro Preview: 62.1 (#34)

Math benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3.1 Pro Preview
OTIS Mock AIME 2024-202585.8%95.6%
ProofBench45%26%
LMArena Math14621485
FrontierMath (Feb 2025 set)32.4%36.9%
FrontierMath Tier 4 (v1)8.3%16.7%
FrontierMath (Tiers 1-3)—59.6%
FrontierMath Tier 4—26.8%
MathArena Final-Answer Competitions—86.5%

Knowledge Gemini 3.1 Pro Preview leads

Claude Sonnet 4.6: 51.7 (#65), Gemini 3.1 Pro Preview: 71.8 (#3)

Knowledge benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3.1 Pro Preview
GPQA Diamond87.4%94.4%
SimpleQA Verified35.5%73.5%
Vectara Hallucination Rate10.6%10.4%
LMArena Expert15001485
Humanity's Last Exam—46.4%

Multimodal Too close to call

Claude Sonnet 4.6: 38.0 (#68), Gemini 3.1 Pro Preview: 37.9 (#69)

Multimodal benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3.1 Pro Preview
LMArena Vision12831296
Blueprint-Bench 26.7%26.5%
LMArena Document14821444
Furniture Assembly—26.7%

Multilingual Gemini 3.1 Pro Preview leads

Claude Sonnet 4.6: 54.4 (#41), Gemini 3.1 Pro Preview: 57.0 (#12)

Multilingual benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3.1 Pro Preview
LMArena Non-English14401477
LMArena Chinese14911529
LMArena French14651487
LMArena German14281491
LMArena Japanese14201493
LMArena Korean14111455
LMArena Russian14401498
LMArena Spanish14641479

Instruction Following Too close to call

Claude Sonnet 4.6: 77.4 (#25), Gemini 3.1 Pro Preview: 77.0 (#32)

Instruction Following benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3.1 Pro Preview
LMArena Instruction Following14751466

Long Context Gemini 3.1 Pro Preview leads

Claude Sonnet 4.6: 45.3 (#44), Gemini 3.1 Pro Preview: 47.4 (#18)

Long Context benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3.1 Pro Preview
LMArena Longer Query14791483
CL-bench—20.8%
CL-bench Life—16.9%

Writing & Preference Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 70.2 (#22), Gemini 3.1 Pro Preview: 66.1 (#37)

Writing & Preference benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3.1 Pro Preview
LMArena Text14581481
LMArena Creative Writing14351482
EQ-Bench Creative Writing18101491
EQ-Bench 412071142
LMArena Multi-Turn14641488

Frequently asked questions

Is Claude Sonnet 4.6 better than Gemini 3.1 Pro Preview?

Gemini 3.1 Pro Preview is the stronger model overall, scoring 56.7 to 50.3 on the Noometry Index.

Which is cheaper, Claude Sonnet 4.6 or Gemini 3.1 Pro Preview?

Gemini 3.1 Pro Preview is cheaper. It lists at $2 per million input tokens and $12 per million output tokens; Claude Sonnet 4.6 lists at $3 and $15.

Is Claude Sonnet 4.6 or Gemini 3.1 Pro Preview better for coding?

Claude Sonnet 4.6 scores higher on coding benchmarks: 46.3 versus 42.5 in the Noometry coding category.

Which has the bigger context window?

Gemini 3.1 Pro Preview does, with 1.05M tokens against 1M.

How many benchmarks do Claude Sonnet 4.6 and Gemini 3.1 Pro Preview share?

54 benchmarks have published results for both models. Claude Sonnet 4.6 has 57 scored results on Noometry and Gemini 3.1 Pro Preview has 71.

Related comparisons

Go deeper