Model comparison

Claude 3.5 Haiku vs Muse Spark 1.3

Muse Spark 1.3 is the stronger model overall, scoring 54.8 to 29.2 on the Noometry Index.

Last verified . 24 shared benchmarks.

Claude 3.5 Haiku Anthropic

29.2

Rank #315 Confirmed

Muse Spark 1.3 Meta

54.8

Rank #27 Confirmed

Summary

  • They share 24 benchmarks with published results for both. Claude 3.5 Haiku scores higher in 0 categories and Muse Spark 1.3 in 10 categories; 10 gaps are clear of the uncertainty.
  • The widest gap is in math, where Muse Spark 1.3 leads 73.1 to 14.7.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 4.3% for Claude 3.5 Haiku and 99.2% for Muse Spark 1.3.

Side by side

Claude 3.5 Haiku and Muse Spark 1.3 specifications
Claude 3.5 HaikuMuse Spark 1.3
ProviderAnthropicMeta
Noometry Index29.254.8
Released2024-10-222026-09-02
WeightsProprietaryProprietary
Context window—1.05M
Max output—131K
Input $ / M tokens—$1.25
Output $ / M tokens—$4.25
Results tracked4937

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Muse Spark 1.3 leads

Claude 3.5 Haiku: 32.9 (#265), Muse Spark 1.3: 56.6 (#21)

Coding benchmarks
BenchmarkClaude 3.5 HaikuMuse Spark 1.3
SciCode27.4%59.7%
LMArena Coding12861514
Aider Polyglot28%—
CursorBench—41.6%
LMArena WebDev—1657
WeirdML30.7%—
BigCodeBench Instruct46.1%—
LiveBench Coding51.4%—
BigCodeBench Complete59%—
CadEval32%—

Agentic & Tool Use Muse Spark 1.3 leads

Claude 3.5 Haiku: 28.0 (#95), Muse Spark 1.3: 38.6 (#30)

Agentic & Tool Use benchmarks
BenchmarkClaude 3.5 HaikuMuse Spark 1.3
APEX-Agents—57.8%
BALROG19.3%—
GDP.pdf—27.6%

Reasoning Muse Spark 1.3 leads

Claude 3.5 Haiku: 17.7 (#290), Muse Spark 1.3: 54.0 (#27)

Reasoning benchmarks
BenchmarkClaude 3.5 HaikuMuse Spark 1.3
CritPt0%26%
LMArena Hard Prompts12511503
DTBench56.7%96.5%
Epoch Capabilities Index127.15156.75
NYT Connections (extended)—85.1%
Chess Puzzles—38%
LiveBench Reasoning28.1%—
Mystery Game Puzzles—25%
LiveBench Data Analysis48.5%—
LMCA—53.9%
Bench to the Future 3—0.14
LiveBench43.5%—

Math Muse Spark 1.3 leads

Claude 3.5 Haiku: 14.7 (#300), Muse Spark 1.3: 73.1 (#21)

Math benchmarks
BenchmarkClaude 3.5 HaikuMuse Spark 1.3
OTIS Mock AIME 2024-20254.3%99.2%
LMArena Math12441494
FrontierMath (Tiers 1-3)—74.4%
FrontierMath Tier 4—46.3%
ProofBench—58%
Omni-MATH22.4%—
LiveBench Math35.5%—
MATH Level 546.4%—
FrontierMath (Feb 2025 set)0.3%—

Knowledge Muse Spark 1.3 leads

Claude 3.5 Haiku: 18.7 (#281), Muse Spark 1.3: 42.6 (#95)

Knowledge benchmarks
BenchmarkClaude 3.5 HaikuMuse Spark 1.3
LMArena Expert12081516
GPQA Diamond38.1%—
MMLU-Pro60.5%—
Confabulations36.7%—
GPQA (HELM)36.3%—
MMLU74.3%—

Multimodal Muse Spark 1.3 leads

Claude 3.5 Haiku: 26.8 (#117), Muse Spark 1.3: 43.7 (#22)

Multimodal benchmarks
BenchmarkClaude 3.5 HaikuMuse Spark 1.3
LMArena Vision10921309
GeoBench34%—
LMArena Document—1471

Multilingual Muse Spark 1.3 leads

Claude 3.5 Haiku: 40.0 (#218), Muse Spark 1.3: 57.4 (#8)

Multilingual benchmarks
BenchmarkClaude 3.5 HaikuMuse Spark 1.3
LMArena Non-English12381481
LMArena Chinese12291529
LMArena French12641524
LMArena German12371515
LMArena Japanese11751474
LMArena Korean11731501
LMArena Russian12531490
LMArena Spanish12611490

Instruction Following Muse Spark 1.3 leads

Claude 3.5 Haiku: 62.9 (#234), Muse Spark 1.3: 77.5 (#22)

Instruction Following benchmarks
BenchmarkClaude 3.5 HaikuMuse Spark 1.3
LMArena Instruction Following12411477
LiveBench Instruction Following61.9%—
IFEval79.2%—

Long Context Muse Spark 1.3 leads

Claude 3.5 Haiku: 38.3 (#200), Muse Spark 1.3: 45.6 (#32)

Long Context benchmarks
BenchmarkClaude 3.5 HaikuMuse Spark 1.3
LMArena Longer Query12611488

Writing & Preference Muse Spark 1.3 leads

Claude 3.5 Haiku: 42.7 (#234), Muse Spark 1.3: 73.6 (#9)

Writing & Preference benchmarks
BenchmarkClaude 3.5 HaikuMuse Spark 1.3
LMArena Text12551490
LMArena Creative Writing12331455
EQ-Bench Creative Writing11461906
LMArena Multi-Turn12651482
Short-Story Creative Writing73.5%—
WildBench76%—
LiveBench Language35.4%—

Frequently asked questions

Is Claude 3.5 Haiku better than Muse Spark 1.3?

Muse Spark 1.3 is the stronger model overall, scoring 54.8 to 29.2 on the Noometry Index.

Is Claude 3.5 Haiku or Muse Spark 1.3 better for coding?

Muse Spark 1.3 scores higher on coding benchmarks: 56.6 versus 32.9 in the Noometry coding category.

How many benchmarks do Claude 3.5 Haiku and Muse Spark 1.3 share?

24 benchmarks have published results for both models. Claude 3.5 Haiku has 49 scored results on Noometry and Muse Spark 1.3 has 37.

Related comparisons

Go deeper