Model comparison

Claude 2 vs Claude 3.5 Haiku

Claude 3.5 Haiku is the stronger model overall, scoring 29.2 to 25.0 on the Noometry Index.

Last verified . 6 shared benchmarks.

Claude 2 Anthropic

25.0

Rank #346 Reported

Claude 3.5 Haiku Anthropic

29.2

Rank #315 Confirmed

Summary

  • They share 6 benchmarks with published results for both. Claude 2 scores higher in 1 category and Claude 3.5 Haiku in 2 categories; 3 gaps are clear of the uncertainty.
  • The widest gap is in math, where Claude 3.5 Haiku leads 14.7 to 9.3.
  • The biggest single-benchmark swing is MATH Level 5: 11.7% for Claude 2 and 46.4% for Claude 3.5 Haiku.

Side by side

Claude 2 and Claude 3.5 Haiku specifications
Claude 2Claude 3.5 Haiku
ProviderAnthropicAnthropic
Noometry Index25.029.2
Released2023-07-112024-10-22
WeightsProprietaryProprietary
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked849

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Not comparable

Claude 2: —, Claude 3.5 Haiku: 32.9 (#265)

Coding benchmarks
BenchmarkClaude 2Claude 3.5 Haiku
Aider Polyglot—28%
SciCode—27.4%
WeirdML—30.7%
BigCodeBench Instruct—46.1%
LiveBench Coding—51.4%
LMArena Coding—1286
BigCodeBench Complete—59%
CadEval—32%
HumanEval+61.6%—

Agentic & Tool Use Not comparable

Claude 2: —, Claude 3.5 Haiku: 28.0 (#95)

Agentic & Tool Use benchmarks
BenchmarkClaude 2Claude 3.5 Haiku
BALROG—19.3%

Reasoning Claude 2 leads

Claude 2: 21.7 (#216), Claude 3.5 Haiku: 17.7 (#290)

Reasoning benchmarks
BenchmarkClaude 2Claude 3.5 Haiku
DTBench51.9%56.7%
Epoch Capabilities Index120.13127.15
CritPt—0%
LiveBench Reasoning—28.1%
LMArena Hard Prompts—1251
LiveBench Data Analysis—48.5%
LiveBench—43.5%

Math Claude 3.5 Haiku leads

Claude 2: 9.3 (#320), Claude 3.5 Haiku: 14.7 (#300)

Math benchmarks
BenchmarkClaude 2Claude 3.5 Haiku
OTIS Mock AIME 2024-20252.5%4.3%
MATH Level 511.7%46.4%
Omni-MATH—22.4%
LiveBench Math—35.5%
LMArena Math—1244
FrontierMath (Feb 2025 set)—0.3%

Knowledge Claude 3.5 Haiku leads

Claude 2: 16.9 (#287), Claude 3.5 Haiku: 18.7 (#281)

Knowledge benchmarks
BenchmarkClaude 2Claude 3.5 Haiku
GPQA Diamond34.7%38.1%
MMLU78.5%74.3%
MMLU-Pro—60.5%
Confabulations—36.7%
GPQA (HELM)—36.3%
LMArena Expert—1208
TriviaQA87.5%—

Multimodal Not comparable

Claude 2: —, Claude 3.5 Haiku: 26.8 (#117)

Multimodal benchmarks
BenchmarkClaude 2Claude 3.5 Haiku
LMArena Vision—1092
GeoBench—34%

Multilingual Not comparable

Claude 2: —, Claude 3.5 Haiku: 40.0 (#218)

Multilingual benchmarks
BenchmarkClaude 2Claude 3.5 Haiku
LMArena Non-English—1238
LMArena Chinese—1229
LMArena French—1264
LMArena German—1237
LMArena Japanese—1175
LMArena Korean—1173
LMArena Russian—1253
LMArena Spanish—1261

Instruction Following Not comparable

Claude 2: —, Claude 3.5 Haiku: 62.9 (#234)

Instruction Following benchmarks
BenchmarkClaude 2Claude 3.5 Haiku
LiveBench Instruction Following—61.9%
IFEval—79.2%
LMArena Instruction Following—1241

Long Context Not comparable

Claude 2: —, Claude 3.5 Haiku: 38.3 (#200)

Long Context benchmarks
BenchmarkClaude 2Claude 3.5 Haiku
LMArena Longer Query—1261

Writing & Preference Not comparable

Claude 2: —, Claude 3.5 Haiku: 42.7 (#234)

Writing & Preference benchmarks
BenchmarkClaude 2Claude 3.5 Haiku
LMArena Text—1255
LMArena Creative Writing—1233
Short-Story Creative Writing—73.5%
EQ-Bench Creative Writing—1146
WildBench—76%
LMArena Multi-Turn—1265
LiveBench Language—35.4%

Frequently asked questions

Is Claude 2 better than Claude 3.5 Haiku?

Claude 3.5 Haiku is the stronger model overall, scoring 29.2 to 25.0 on the Noometry Index.

How many benchmarks do Claude 2 and Claude 3.5 Haiku share?

6 benchmarks have published results for both models. Claude 2 has 8 scored results on Noometry and Claude 3.5 Haiku has 49.

Related comparisons

Go deeper