Model comparison

Claude Sonnet 5.5 vs Muse Spark 1.3

Claude Sonnet 5.5 is the stronger model overall, scoring 61.9 to 54.8 on the Noometry Index. Muse Spark 1.3 costs 2.0× less per token, which makes it the better buy when Claude Sonnet 5.5's lead doesn't matter for your workload.

Last verified . 25 shared benchmarks.

Claude Sonnet 5.5 Anthropic

61.9

Rank #10 Confirmed

Muse Spark 1.3 Meta

54.8

Rank #27 Confirmed

Summary

  • They share 25 benchmarks with published results for both. Claude Sonnet 5.5 scores higher in 7 categories and Muse Spark 1.3 in 3 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Claude Sonnet 5.5 leads 66.0 to 42.6.
  • The biggest single-benchmark swing is ProofBench: 100% for Claude Sonnet 5.5 and 58% for Muse Spark 1.3.
  • Muse Spark 1.3 is cheaper at $1.25 / $4.25 per million input/output tokens, against $2 / $10 for Claude Sonnet 5.5.
  • Muse Spark 1.3 accepts more context: 1.05M tokens versus 1M.

Side by side

Claude Sonnet 5.5 and Muse Spark 1.3 specifications
Claude Sonnet 5.5Muse Spark 1.3
ProviderAnthropicMeta
Noometry Index61.954.8
Released2026-09-282026-09-02
WeightsProprietaryProprietary
Context window1M1.05M
Max output128K131K
Input $ / M tokens$2$1.25
Output $ / M tokens$10$4.25
Results tracked3237

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 67.3 (#6), Muse Spark 1.3: 56.6 (#21)

Coding benchmarks
BenchmarkClaude Sonnet 5.5Muse Spark 1.3
CursorBench55.5%41.6%
LMArena WebDev17741657
SciCode61%59.7%
LMArena Coding15131514
FrontierCode52.1%—
FrontierSWE61.9%—
ALE-Bench1,819—

Agentic & Tool Use Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 45.0 (#16), Muse Spark 1.3: 38.6 (#30)

Agentic & Tool Use benchmarks
BenchmarkClaude Sonnet 5.5Muse Spark 1.3
APEX-Agents75.5%57.8%
GDP.pdf—27.6%

Reasoning Too close to call

Claude Sonnet 5.5: 54.0 (#28), Muse Spark 1.3: 54.0 (#27)

Reasoning benchmarks
BenchmarkClaude Sonnet 5.5Muse Spark 1.3
NYT Connections (extended)80.5%85.1%
CritPt31.4%26%
LMArena Hard Prompts14951503
Mystery Game Puzzles65%25%
Epoch Capabilities Index165.03156.75
Chess Puzzles—38%
DTBench—96.5%
LMCA—53.9%
Bench to the Future 3—0.14

Math Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 87.9 (#6), Muse Spark 1.3: 73.1 (#21)

Math benchmarks
BenchmarkClaude Sonnet 5.5Muse Spark 1.3
FrontierMath (Tiers 1-3)88.8%74.4%
FrontierMath Tier 480.5%46.3%
OTIS Mock AIME 2024-2025100%99.2%
ProofBench100%58%
LMArena Math15101494
FrontierMath Erdős2.9%—

Knowledge Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 66.0 (#12), Muse Spark 1.3: 42.6 (#95)

Knowledge benchmarks
BenchmarkClaude Sonnet 5.5Muse Spark 1.3
LMArena Expert15401516
GPQA Diamond95.6%—
SimpleQA Verified46.5%—

Multimodal Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 51.5 (#6), Muse Spark 1.3: 43.7 (#22)

Multimodal benchmarks
BenchmarkClaude Sonnet 5.5Muse Spark 1.3
LMArena Vision12891309
Furniture Assembly75%—
LMArena Document—1471

Multilingual Muse Spark 1.3 leads

Claude Sonnet 5.5: 55.3 (#30), Muse Spark 1.3: 57.4 (#8)

Multilingual benchmarks
BenchmarkClaude Sonnet 5.5Muse Spark 1.3
LMArena Non-English14521481
LMArena Chinese15221529
LMArena Russian14511490
LMArena French—1524
LMArena German—1515
LMArena Japanese—1474
LMArena Korean—1501
LMArena Spanish—1490

Instruction Following Too close to call

Claude Sonnet 5.5: 78.3 (#11), Muse Spark 1.3: 77.5 (#22)

Instruction Following benchmarks
BenchmarkClaude Sonnet 5.5Muse Spark 1.3
LMArena Instruction Following14951477

Long Context Too close to call

Claude Sonnet 5.5: 45.9 (#28), Muse Spark 1.3: 45.6 (#32)

Long Context benchmarks
BenchmarkClaude Sonnet 5.5Muse Spark 1.3
LMArena Longer Query14981488

Writing & Preference Muse Spark 1.3 leads

Claude Sonnet 5.5: 66.0 (#40), Muse Spark 1.3: 73.6 (#9)

Writing & Preference benchmarks
BenchmarkClaude Sonnet 5.5Muse Spark 1.3
LMArena Text14711490
LMArena Creative Writing14651455
LMArena Multi-Turn14741482
EQ-Bench Creative Writing—1906

Frequently asked questions

Is Claude Sonnet 5.5 better than Muse Spark 1.3?

Claude Sonnet 5.5 is the stronger model overall, scoring 61.9 to 54.8 on the Noometry Index. Muse Spark 1.3 costs 2.0× less per token, which makes it the better buy when Claude Sonnet 5.5's lead doesn't matter for your workload.

Which is cheaper, Claude Sonnet 5.5 or Muse Spark 1.3?

Muse Spark 1.3 is cheaper. It lists at $1.25 per million input tokens and $4.25 per million output tokens; Claude Sonnet 5.5 lists at $2 and $10.

Is Claude Sonnet 5.5 or Muse Spark 1.3 better for coding?

Claude Sonnet 5.5 scores higher on coding benchmarks: 67.3 versus 56.6 in the Noometry coding category.

Which has the bigger context window?

Muse Spark 1.3 does, with 1.05M tokens against 1M.

How many benchmarks do Claude Sonnet 5.5 and Muse Spark 1.3 share?

25 benchmarks have published results for both models. Claude Sonnet 5.5 has 32 scored results on Noometry and Muse Spark 1.3 has 37.

Related comparisons

Go deeper