Model comparison

Claude 3.5 Sonnet vs Claude 3.7 Sonnet

Claude 3.7 Sonnet is the stronger model overall, scoring 39.5 to 34.6 on the Noometry Index.

Last verified . 50 shared benchmarks.

Claude 3.5 Sonnet Anthropic

34.6

Rank #231 Confirmed

Claude 3.7 Sonnet Anthropic

39.5

Rank #164 Confirmed

Summary

  • They share 50 benchmarks with published results for both. Claude 3.5 Sonnet scores higher in 1 category and Claude 3.7 Sonnet in 9 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in math, where Claude 3.7 Sonnet leads 37.5 to 19.2.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 8.5% for Claude 3.5 Sonnet and 57.8% for Claude 3.7 Sonnet.

Side by side

Claude 3.5 Sonnet and Claude 3.7 Sonnet specifications
Claude 3.5 SonnetClaude 3.7 Sonnet
ProviderAnthropicAnthropic
Noometry Index34.639.5
Released2024-06-202025-02-24
WeightsProprietaryProprietary
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked6058

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude 3.7 Sonnet leads

Claude 3.5 Sonnet: 39.0 (#165), Claude 3.7 Sonnet: 40.6 (#136)

Coding benchmarks
BenchmarkClaude 3.5 SonnetClaude 3.7 Sonnet
Aider Polyglot51.6%64.9%
GSO4.6%3.8%
LiveBench Coding67.1%74.5%
LMArena Coding13421361
CadEval48%54%
SWE-bench Verified—61%
SWE-bench Verified (bash only)—52.8%
WeirdML40%—
BigCodeBench Instruct46.8%—
BigCodeBench Complete58.6%—
HumanEval+81.7%—
MBPP+74.3%—

Agentic & Tool Use Claude 3.7 Sonnet leads

Claude 3.5 Sonnet: 32.3 (#67), Claude 3.7 Sonnet: 34.1 (#50)

Agentic & Tool Use benchmarks
BenchmarkClaude 3.5 SonnetClaude 3.7 Sonnet
TheAgentCompany24%30.9%
Cybench17.5%20%
METR Time Horizons45.2%60%
DeepResearch Bench—43.6%
OSWorld—35.8%
BALROG32.6%—

Reasoning Claude 3.5 Sonnet leads

Claude 3.5 Sonnet: 23.1 (#183), Claude 3.7 Sonnet: 18.6 (#277)

Reasoning benchmarks
BenchmarkClaude 3.5 SonnetClaude 3.7 Sonnet
SimpleBench41.4%46.4%
EnigmaEval0.9%4.2%
LiveBench Reasoning56.7%87.8%
LMArena Hard Prompts13051333
LiveBench Data Analysis55%74%
Epoch Capabilities Index133.55141.16
ForecastBench60.761.8
LiveBench59%76.1%
ARC-AGI-2—0.9%
ARC-AGI-1—28.6%
DTBench67.8%—

Math Claude 3.7 Sonnet leads

Claude 3.5 Sonnet: 19.2 (#288), Claude 3.7 Sonnet: 37.5 (#153)

Math benchmarks
BenchmarkClaude 3.5 SonnetClaude 3.7 Sonnet
OTIS Mock AIME 2024-20258.5%57.8%
Omni-MATH27.6%33%
LiveBench Math52.3%79%
LMArena Math13071337
MATH Level 556.9%91.2%
FrontierMath (Feb 2025 set)2.1%4.1%
FrontierMath Tier 4 (v1)0%—

Knowledge Claude 3.7 Sonnet leads

Claude 3.5 Sonnet: 28.6 (#245), Claude 3.7 Sonnet: 39.8 (#130)

Knowledge benchmarks
BenchmarkClaude 3.5 SonnetClaude 3.7 Sonnet
GPQA Diamond55.3%79.7%
Humanity's Last Exam4.1%8%
MMLU-Pro77.7%78.4%
Confabulations19.9%14.7%
GPQA (HELM)56.5%60.8%
LMArena Expert12651321
MMLU87.3%—

Multimodal Claude 3.7 Sonnet leads

Claude 3.5 Sonnet: 26.5 (#120), Claude 3.7 Sonnet: 33.7 (#95)

Multimodal benchmarks
BenchmarkClaude 3.5 SonnetClaude 3.7 Sonnet
LMArena Vision11251169
GeoBench62%68%
VPCT33%39%
Video-MME60%—
SpatialViz-Bench—33.9%

Multilingual Too close to call

Claude 3.5 Sonnet: 43.2 (#185), Claude 3.7 Sonnet: 44.1 (#179)

Multilingual benchmarks
BenchmarkClaude 3.5 SonnetClaude 3.7 Sonnet
LMArena Non-English12831296
LMArena Chinese12721299
LMArena French13051303
LMArena German12971301
LMArena Japanese12341267
LMArena Korean12001249
LMArena Russian13061311
LMArena Spanish12901298

Instruction Following Claude 3.7 Sonnet leads

Claude 3.5 Sonnet: 68.8 (#182), Claude 3.7 Sonnet: 72.9 (#125)

Instruction Following benchmarks
BenchmarkClaude 3.5 SonnetClaude 3.7 Sonnet
LiveBench Instruction Following69.3%81.3%
IFEval85.5%83.4%
LMArena Instruction Following12971352

Long Context Claude 3.7 Sonnet leads

Claude 3.5 Sonnet: 39.9 (#167), Claude 3.7 Sonnet: 50.3 (#10)

Long Context benchmarks
BenchmarkClaude 3.5 SonnetClaude 3.7 Sonnet
LMArena Longer Query13111373
Fiction.LiveBench—83.3%

Writing & Preference Claude 3.7 Sonnet leads

Claude 3.5 Sonnet: 52.9 (#164), Claude 3.7 Sonnet: 54.4 (#150)

Writing & Preference benchmarks
BenchmarkClaude 3.5 SonnetClaude 3.7 Sonnet
LMArena Text12981314
LMArena Creative Writing12921332
Short-Story Creative Writing80.3%81.1%
EQ-Bench Creative Writing14511412
WildBench79.2%81.4%
LMArena Multi-Turn13261339
LiveBench Language53.8%59.9%

Frequently asked questions

Is Claude 3.5 Sonnet better than Claude 3.7 Sonnet?

Claude 3.7 Sonnet is the stronger model overall, scoring 39.5 to 34.6 on the Noometry Index.

Is Claude 3.5 Sonnet or Claude 3.7 Sonnet better for coding?

Claude 3.7 Sonnet scores higher on coding benchmarks: 40.6 versus 39.0 in the Noometry coding category.

How many benchmarks do Claude 3.5 Sonnet and Claude 3.7 Sonnet share?

50 benchmarks have published results for both models. Claude 3.5 Sonnet has 60 scored results on Noometry and Claude 3.7 Sonnet has 58.

Related comparisons

Go deeper