Model comparison

Claude Haiku 4.5 vs Muse Spark 1.1

Muse Spark 1.1 is the stronger model overall, scoring 49.9 to 39.5 on the Noometry Index.

Last verified . 28 shared benchmarks.

Claude Haiku 4.5 Anthropic

39.5

Rank #165 Confirmed

Muse Spark 1.1 Meta

49.9

Rank #51 Confirmed

Summary

  • They share 28 benchmarks with published results for both. Claude Haiku 4.5 scores higher in 1 category and Muse Spark 1.1 in 9 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Muse Spark 1.1 leads 47.1 to 15.1.
  • The biggest single-benchmark swing is NYT Connections (extended): 14.3% for Claude Haiku 4.5 and 84.9% for Muse Spark 1.1.
  • Both cost about the same: $1 input and $5 output per million tokens.
  • Muse Spark 1.1 accepts more context: 1.05M tokens versus 200K.

Side by side

Claude Haiku 4.5 and Muse Spark 1.1 specifications
Claude Haiku 4.5Muse Spark 1.1
ProviderAnthropicMeta
Noometry Index39.549.9
Released2025-10-152026-04-08
WeightsProprietaryProprietary
Context window200K1.05M
Max output64K131K
Input $ / M tokens$1$1.25
Output $ / M tokens$5$4.25
Results tracked5337

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Muse Spark 1.1 leads

Claude Haiku 4.5: 44.0 (#78), Muse Spark 1.1: 51.3 (#40)

Coding benchmarks
BenchmarkClaude Haiku 4.5Muse Spark 1.1
LMArena WebDev13301542
SciCode43.3%58.8%
LMArena Coding14531498
DeepSWE—53.3%
SWE-bench Verified (bash only)66.6%—
SWE-bench Multilingual64.7%—
WeirdML45.4%—
ALE-Bench653.48—

Agentic & Tool Use Claude Haiku 4.5 leads

Claude Haiku 4.5: 33.6 (#52), Muse Spark 1.1: 30.8 (#73)

Agentic & Tool Use benchmarks
BenchmarkClaude Haiku 4.5Muse Spark 1.1
Vending-Bench 2458.896,520
Terminal-Bench35.5%—
APEX-Agents—31.8%
Berkeley Function Calling Leaderboard68.7%—
τ²-bench Banking—40.5%
DeepResearch Bench45.5%—
BALROG31.2%—
ExploitBench13.7%—
GBAEval—7.9%
GDP.pdf—15%

Reasoning Muse Spark 1.1 leads

Claude Haiku 4.5: 15.1 (#320), Muse Spark 1.1: 47.1 (#44)

Reasoning benchmarks
BenchmarkClaude Haiku 4.5Muse Spark 1.1
NYT Connections (extended)14.3%84.9%
CritPt0%15.1%
LMArena Hard Prompts14201486
DTBench73.6%94.4%
LMCA30.9%49.9%
Epoch Capabilities Index142.41154.21
ARC-AGI-24%—
ARC-AGI-147.7%—
Chess Puzzles8%—
Surface Evolver Bench—52.5%
ForecastBench61.4—

Math Too close to call

Claude Haiku 4.5: 44.9 (#78), Muse Spark 1.1: 45.5 (#76)

Math benchmarks
BenchmarkClaude Haiku 4.5Muse Spark 1.1
LMArena Math13961483
OTIS Mock AIME 2024-202566.7%—
ProofBench—39%
Omni-MATH56.1%—
MATH Level 596.4%—
FrontierMath (Feb 2025 set)5.9%—
FrontierMath Tier 4 (v1)2.1%—

Knowledge Muse Spark 1.1 leads

Claude Haiku 4.5: 37.7 (#153), Muse Spark 1.1: 53.1 (#59)

Knowledge benchmarks
BenchmarkClaude Haiku 4.5Muse Spark 1.1
SimpleQA Verified13.2%57.8%
LMArena Expert14421478
GPQA Diamond71.2%—
MMLU-Pro77.7%—
Vectara Hallucination Rate9.8%—
GPQA (HELM)60.5%—

Multimodal Muse Spark 1.1 leads

Claude Haiku 4.5: 26.8 (#118), Muse Spark 1.1: 42.6 (#29)

Multimodal benchmarks
BenchmarkClaude Haiku 4.5Muse Spark 1.1
LMArena Document14201465
LMArena Vision—1293
Blueprint-Bench 20%—

Multilingual Muse Spark 1.1 leads

Claude Haiku 4.5: 49.9 (#129), Muse Spark 1.1: 56.7 (#17)

Multilingual benchmarks
BenchmarkClaude Haiku 4.5Muse Spark 1.1
LMArena Non-English13771472
LMArena Chinese14171518
LMArena French14081494
LMArena German13751466
LMArena Japanese13391451
LMArena Korean13471458
LMArena Russian13811483
LMArena Spanish14201464

Instruction Following Muse Spark 1.1 leads

Claude Haiku 4.5: 71.4 (#149), Muse Spark 1.1: 76.5 (#39)

Instruction Following benchmarks
BenchmarkClaude Haiku 4.5Muse Spark 1.1
LMArena Instruction Following14141457
IFEval80.1%—

Long Context Muse Spark 1.1 leads

Claude Haiku 4.5: 43.6 (#92), Muse Spark 1.1: 44.8 (#58)

Long Context benchmarks
BenchmarkClaude Haiku 4.5Muse Spark 1.1
LMArena Longer Query14271462

Writing & Preference Muse Spark 1.1 leads

Claude Haiku 4.5: 57.9 (#123), Muse Spark 1.1: 73.4 (#11)

Writing & Preference benchmarks
BenchmarkClaude Haiku 4.5Muse Spark 1.1
LMArena Text13961479
LMArena Creative Writing13721437
EQ-Bench 410641260
LMArena Multi-Turn14091485
EQ-Bench Creative Writing—1927
WildBench83.9%—

Frequently asked questions

Is Claude Haiku 4.5 better than Muse Spark 1.1?

Muse Spark 1.1 is the stronger model overall, scoring 49.9 to 39.5 on the Noometry Index.

Which is cheaper, Claude Haiku 4.5 or Muse Spark 1.1?

Muse Spark 1.1 is cheaper. It lists at $1.25 per million input tokens and $4.25 per million output tokens; Claude Haiku 4.5 lists at $1 and $5.

Is Claude Haiku 4.5 or Muse Spark 1.1 better for coding?

Muse Spark 1.1 scores higher on coding benchmarks: 51.3 versus 44.0 in the Noometry coding category.

Which has the bigger context window?

Muse Spark 1.1 does, with 1.05M tokens against 200K.

How many benchmarks do Claude Haiku 4.5 and Muse Spark 1.1 share?

28 benchmarks have published results for both models. Claude Haiku 4.5 has 53 scored results on Noometry and Muse Spark 1.1 has 37.

Related comparisons

Go deeper