Model comparison

Claude Sonnet 4.6 vs Gemini 3 Flash Preview

Gemini 3 Flash Preview is the stronger model overall, scoring 52.3 to 50.3 on the Noometry Index.

Last verified . 45 shared benchmarks.

Claude Sonnet 4.6 Anthropic

50.3

Rank #50 Confirmed

Gemini 3 Flash Preview Google

52.3

Rank #40 Confirmed

Summary

  • They share 45 benchmarks with published results for both. Claude Sonnet 4.6 scores higher in 5 categories and Gemini 3 Flash Preview in 5 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in multimodal, where Gemini 3 Flash Preview leads 45.5 to 38.0.
  • The biggest single-benchmark swing is SimpleQA Verified: 35.5% for Claude Sonnet 4.6 and 66.8% for Gemini 3 Flash Preview.
  • Gemini 3 Flash Preview is cheaper at $0.50 / $3 per million input/output tokens, against $3 / $15 for Claude Sonnet 4.6.
  • Gemini 3 Flash Preview accepts more context: 1.05M tokens versus 1M.

Side by side

Claude Sonnet 4.6 and Gemini 3 Flash Preview specifications
Claude Sonnet 4.6Gemini 3 Flash Preview
ProviderAnthropicGoogle
Noometry Index50.352.3
Released2026-02-172025-12-17
WeightsProprietaryProprietary
Context window1M1.05M
Max output128K66K
Input $ / M tokens$3$0.50
Output $ / M tokens$15$3
Results tracked5759

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemini 3 Flash Preview leads

Claude Sonnet 4.6: 46.3 (#67), Gemini 3 Flash Preview: 50.9 (#42)

Coding benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3 Flash Preview
SWE-bench Verified75.2%75.4%
LMArena WebDev15221439
WeirdML66.1%61.6%
LMArena Coding15041460
ALE-Bench1,3271,367
DeepSWE29.9%—
FrontierCode24.3%—
SWE-bench Verified (bash only)—75.8%
SWE-bench Multilingual—72.7%
SciCode46.8%—
GSO—9.8%

Agentic & Tool Use Too close to call

Claude Sonnet 4.6: 39.1 (#28), Gemini 3 Flash Preview: 38.7 (#29)

Agentic & Tool Use benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3 Flash Preview
Terminal-Bench53.4%64.3%
DeepResearch Bench54.9%49.8%
GDP.pdf18%10%
LMArena Search12211198
Vending-Bench 27,2043,635
APEX-Agents43%—
OSWorld 2.09.3%—
τ²-bench Airline—82.5%
τ²-bench Banking—27.3%
τ²-bench Retail—76.8%
τ²-bench Telecom—91.2%
OSWorld72.1%—
BALROG—48.1%
ExploitBench23.6%—
GBAEval48.8%—

Reasoning Gemini 3 Flash Preview leads

Claude Sonnet 4.6: 46.1 (#45), Gemini 3 Flash Preview: 49.2 (#37)

Reasoning benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3 Flash Preview
ARC-AGI-260.4%33.6%
NYT Connections (extended)80.9%83.1%
ARC-AGI-186.5%84.7%
Chess Puzzles13%40%
LMArena Hard Prompts14841465
Mystery Game Puzzles16%26%
DTBench89.9%89.1%
LMCA46.5%43.1%
Epoch Capabilities Index152.24151.8
ForecastBench6258.5
SimpleBench—61.1%
CritPt3.1%—
Thematic Generalization76.3%—

Math Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 52.9 (#49), Gemini 3 Flash Preview: 51.7 (#55)

Math benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3 Flash Preview
OTIS Mock AIME 2024-202585.8%95.6%
ProofBench45%15%
LMArena Math14621473
FrontierMath (Feb 2025 set)32.4%35.6%
FrontierMath Tier 4 (v1)8.3%4.2%
FrontierMath (Tiers 1-3)—51.2%
FrontierMath Tier 4—17.1%
MathArena Final-Answer Competitions—67.6%

Knowledge Gemini 3 Flash Preview leads

Claude Sonnet 4.6: 51.7 (#65), Gemini 3 Flash Preview: 58.8 (#33)

Knowledge benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3 Flash Preview
GPQA Diamond87.4%89.4%
SimpleQA Verified35.5%66.8%
Vectara Hallucination Rate10.6%13.5%
LMArena Expert15001462

Multimodal Gemini 3 Flash Preview leads

Claude Sonnet 4.6: 38.0 (#68), Gemini 3 Flash Preview: 45.5 (#16)

Multimodal benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3 Flash Preview
LMArena Vision12831285
Blueprint-Bench 26.7%0%
LMArena Document14821413
GeoBench—88%
VPCT—72.6%

Multilingual Gemini 3 Flash Preview leads

Claude Sonnet 4.6: 54.4 (#41), Gemini 3 Flash Preview: 55.7 (#27)

Multilingual benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3 Flash Preview
LMArena Non-English14401458
LMArena Chinese14911511
LMArena French14651477
LMArena German14281497
LMArena Japanese14201489
LMArena Korean14111443
LMArena Russian14401480
LMArena Spanish14641469

Instruction Following Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 77.4 (#25), Gemini 3 Flash Preview: 75.7 (#56)

Instruction Following benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3 Flash Preview
LMArena Instruction Following14751437

Long Context Too close to call

Claude Sonnet 4.6: 45.3 (#44), Gemini 3 Flash Preview: 44.4 (#67)

Long Context benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3 Flash Preview
LMArena Longer Query14791452

Writing & Preference Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 70.2 (#22), Gemini 3 Flash Preview: 65.5 (#45)

Writing & Preference benchmarks
BenchmarkClaude Sonnet 4.6Gemini 3 Flash Preview
LMArena Text14581466
LMArena Creative Writing14351457
LMArena Multi-Turn14641471
EQ-Bench Creative Writing1810—
EQ-Bench 41207—

Frequently asked questions

Is Claude Sonnet 4.6 better than Gemini 3 Flash Preview?

Gemini 3 Flash Preview is the stronger model overall, scoring 52.3 to 50.3 on the Noometry Index.

Which is cheaper, Claude Sonnet 4.6 or Gemini 3 Flash Preview?

Gemini 3 Flash Preview is cheaper. It lists at $0.50 per million input tokens and $3 per million output tokens; Claude Sonnet 4.6 lists at $3 and $15.

Is Claude Sonnet 4.6 or Gemini 3 Flash Preview better for coding?

Gemini 3 Flash Preview scores higher on coding benchmarks: 50.9 versus 46.3 in the Noometry coding category.

Which has the bigger context window?

Gemini 3 Flash Preview does, with 1.05M tokens against 1M.

How many benchmarks do Claude Sonnet 4.6 and Gemini 3 Flash Preview share?

45 benchmarks have published results for both models. Claude Sonnet 4.6 has 57 scored results on Noometry and Gemini 3 Flash Preview has 59.

Related comparisons

Go deeper