Model comparison

Claude 3.7 Sonnet vs Gemini 3.1 Flash Lite

Gemini 3.1 Flash Lite is the stronger model overall, scoring 40.8 to 39.5 on the Noometry Index.

Last verified . 25 shared benchmarks.

Claude 3.7 Sonnet Anthropic

39.5

Rank #164 Confirmed

Gemini 3.1 Flash Lite Google

40.8

Rank #144 Confirmed

Summary

  • They share 25 benchmarks with published results for both. Claude 3.7 Sonnet scores higher in 4 categories and Gemini 3.1 Flash Lite in 6 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in multilingual, where Gemini 3.1 Flash Lite leads 52.3 to 44.1.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 57.8% for Claude 3.7 Sonnet and 80% for Gemini 3.1 Flash Lite.

Side by side

Claude 3.7 Sonnet and Gemini 3.1 Flash Lite specifications
Claude 3.7 SonnetGemini 3.1 Flash Lite
ProviderAnthropicGoogle
Noometry Index39.540.8
Released2025-02-242026-03-03
WeightsProprietaryProprietary
Context window—1.05M
Max output—66K
Input $ / M tokens—$0.25
Output $ / M tokens—$1.50
Results tracked5838

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 40.6 (#136), Gemini 3.1 Flash Lite: 37.8 (#188)

Coding benchmarks
BenchmarkClaude 3.7 SonnetGemini 3.1 Flash Lite
LMArena Coding13611400
SWE-bench Verified61%—
SWE-bench Verified (bash only)52.8%—
Aider Polyglot64.9%—
LMArena WebDev—1256
SciCode—41.9%
GSO3.8%—
WeirdML—52.2%
LiveBench Coding74.5%—
CadEval54%—
ALE-Bench—797.73

Agentic & Tool Use Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 34.1 (#50), Gemini 3.1 Flash Lite: 30.2 (#79)

Agentic & Tool Use benchmarks
BenchmarkClaude 3.7 SonnetGemini 3.1 Flash Lite
DeepResearch Bench43.6%37.3%
TheAgentCompany30.9%—
Cybench20%—
OSWorld35.8%—
METR Time Horizons60%—

Reasoning Gemini 3.1 Flash Lite leads

Claude 3.7 Sonnet: 18.6 (#277), Gemini 3.1 Flash Lite: 22.9 (#186)

Reasoning benchmarks
BenchmarkClaude 3.7 SonnetGemini 3.1 Flash Lite
EnigmaEval4.2%3%
LMArena Hard Prompts13331407
Epoch Capabilities Index141.16144.47
ForecastBench61.854.4
ARC-AGI-20.9%—
SimpleBench46.4%—
Kagi LLM Benchmark—67.2%
NYT Connections (extended)—8.2%
ARC-AGI-128.6%—
CritPt—1.1%
Chess Puzzles—25%
Thematic Generalization—63.3%
LiveBench Reasoning87.8%—
DTBench—76.8%
LiveBench Data Analysis74%—
LMCA—35%
LiveBench76.1%—

Math Gemini 3.1 Flash Lite leads

Claude 3.7 Sonnet: 37.5 (#153), Gemini 3.1 Flash Lite: 40.7 (#90)

Math benchmarks
BenchmarkClaude 3.7 SonnetGemini 3.1 Flash Lite
OTIS Mock AIME 2024-202557.8%80%
LMArena Math13371428
FrontierMath (Tiers 1-3)—27.7%
Omni-MATH33%—
LiveBench Math79%—
MATH Level 591.2%—
FrontierMath (Feb 2025 set)4.1%—

Knowledge Gemini 3.1 Flash Lite leads

Claude 3.7 Sonnet: 39.8 (#130), Gemini 3.1 Flash Lite: 41.9 (#104)

Knowledge benchmarks
BenchmarkClaude 3.7 SonnetGemini 3.1 Flash Lite
GPQA Diamond79.7%81.8%
Humanity's Last Exam8%8.6%
LMArena Expert13211398
MMLU-Pro78.4%—
Confabulations14.7%—
Vectara Hallucination Rate—8.2%
GPQA (HELM)60.8%—

Multimodal Gemini 3.1 Flash Lite leads

Claude 3.7 Sonnet: 33.7 (#95), Gemini 3.1 Flash Lite: 39.4 (#60)

Multimodal benchmarks
BenchmarkClaude 3.7 SonnetGemini 3.1 Flash Lite
LMArena Vision11691240
GeoBench68%—
VPCT39%—
SpatialViz-Bench33.9%—

Multilingual Gemini 3.1 Flash Lite leads

Claude 3.7 Sonnet: 44.1 (#179), Gemini 3.1 Flash Lite: 52.3 (#86)

Multilingual benchmarks
BenchmarkClaude 3.7 SonnetGemini 3.1 Flash Lite
LMArena Non-English12961411
LMArena Chinese12991461
LMArena French13031424
LMArena German13011429
LMArena Japanese12671413
LMArena Korean12491392
LMArena Russian13111420
LMArena Spanish12981421

Instruction Following Too close to call

Claude 3.7 Sonnet: 72.9 (#125), Gemini 3.1 Flash Lite: 72.7 (#131)

Instruction Following benchmarks
BenchmarkClaude 3.7 SonnetGemini 3.1 Flash Lite
LMArena Instruction Following13521377
LiveBench Instruction Following81.3%—
IFEval83.4%—

Long Context Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 50.3 (#10), Gemini 3.1 Flash Lite: 42.5 (#122)

Long Context benchmarks
BenchmarkClaude 3.7 SonnetGemini 3.1 Flash Lite
LMArena Longer Query13731394
Fiction.LiveBench83.3%—

Writing & Preference Gemini 3.1 Flash Lite leads

Claude 3.7 Sonnet: 54.4 (#150), Gemini 3.1 Flash Lite: 60.9 (#94)

Writing & Preference benchmarks
BenchmarkClaude 3.7 SonnetGemini 3.1 Flash Lite
LMArena Text13141416
LMArena Creative Writing13321401
LMArena Multi-Turn13391417
Short-Story Creative Writing81.1%—
EQ-Bench Creative Writing1412—
WildBench81.4%—
LiveBench Language59.9%—

Frequently asked questions

Is Claude 3.7 Sonnet better than Gemini 3.1 Flash Lite?

Gemini 3.1 Flash Lite is the stronger model overall, scoring 40.8 to 39.5 on the Noometry Index.

Is Claude 3.7 Sonnet or Gemini 3.1 Flash Lite better for coding?

Claude 3.7 Sonnet scores higher on coding benchmarks: 40.6 versus 37.8 in the Noometry coding category.

How many benchmarks do Claude 3.7 Sonnet and Gemini 3.1 Flash Lite share?

25 benchmarks have published results for both models. Claude 3.7 Sonnet has 58 scored results on Noometry and Gemini 3.1 Flash Lite has 38.

Related comparisons

Go deeper