Model comparison

Chatgpt 4o Latest 20250326 vs Muse Spark 1.3

Muse Spark 1.3 is the stronger model overall, scoring 54.8 to 43.8 on the Noometry Index.

Last verified . 19 shared benchmarks.

Chatgpt 4o Latest 20250326 OpenAI

43.8

Rank #82 Confirmed

Muse Spark 1.3 Meta

54.8

Rank #27 Confirmed

Summary

  • They share 19 benchmarks with published results for both. Chatgpt 4o Latest 20250326 scores higher in 0 categories and Muse Spark 1.3 in 9 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in math, where Muse Spark 1.3 leads 73.1 to 38.6.

Side by side

Chatgpt 4o Latest 20250326 and Muse Spark 1.3 specifications
Chatgpt 4o Latest 20250326Muse Spark 1.3
ProviderOpenAIMeta
Noometry Index43.854.8
Released—2026-09-02
WeightsProprietaryProprietary
Context window—1.05M
Max output—131K
Input $ / M tokens—$1.25
Output $ / M tokens—$4.25
Results tracked2137

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Muse Spark 1.3 leads

Chatgpt 4o Latest 20250326: 41.6 (#122), Muse Spark 1.3: 56.6 (#21)

Coding benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.3
LMArena Coding14131514
CursorBench—41.6%
LMArena WebDev—1657
SciCode—59.7%

Agentic & Tool Use Not comparable

Chatgpt 4o Latest 20250326: —, Muse Spark 1.3: 38.6 (#30)

Agentic & Tool Use benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.3
APEX-Agents—57.8%
GDP.pdf—27.6%

Reasoning Muse Spark 1.3 leads

Chatgpt 4o Latest 20250326: 33.8 (#71), Muse Spark 1.3: 54.0 (#27)

Reasoning benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.3
LMArena Hard Prompts14241503
Kagi LLM Benchmark75%—
NYT Connections (extended)—85.1%
CritPt—26%
Chess Puzzles—38%
Mystery Game Puzzles—25%
DTBench—96.5%
LMCA—53.9%
Bench to the Future 3—0.14
Epoch Capabilities Index—156.75

Math Muse Spark 1.3 leads

Chatgpt 4o Latest 20250326: 38.6 (#134), Muse Spark 1.3: 73.1 (#21)

Math benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.3
LMArena Math14071494
FrontierMath (Tiers 1-3)—74.4%
FrontierMath Tier 4—46.3%
OTIS Mock AIME 2024-2025—99.2%
ProofBench—58%

Knowledge Muse Spark 1.3 leads

Chatgpt 4o Latest 20250326: 39.2 (#137), Muse Spark 1.3: 42.6 (#95)

Knowledge benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.3
LMArena Expert14011516
Confabulations16.6%—

Multimodal Muse Spark 1.3 leads

Chatgpt 4o Latest 20250326: 39.6 (#58), Muse Spark 1.3: 43.7 (#22)

Multimodal benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.3
LMArena Vision12431309
LMArena Document—1471

Multilingual Muse Spark 1.3 leads

Chatgpt 4o Latest 20250326: 52.9 (#76), Muse Spark 1.3: 57.4 (#8)

Multilingual benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.3
LMArena Non-English14191481
LMArena Chinese14571529
LMArena French14461524
LMArena German14231515
LMArena Japanese14051474
LMArena Korean13961501
LMArena Russian14291490
LMArena Spanish14341490

Instruction Following Muse Spark 1.3 leads

Chatgpt 4o Latest 20250326: 74.0 (#107), Muse Spark 1.3: 77.5 (#22)

Instruction Following benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.3
LMArena Instruction Following14031477

Long Context Muse Spark 1.3 leads

Chatgpt 4o Latest 20250326: 43.1 (#107), Muse Spark 1.3: 45.6 (#32)

Long Context benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.3
LMArena Longer Query14131488

Writing & Preference Muse Spark 1.3 leads

Chatgpt 4o Latest 20250326: 62.6 (#72), Muse Spark 1.3: 73.6 (#9)

Writing & Preference benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.3
LMArena Text14291490
LMArena Creative Writing14051455
EQ-Bench Creative Writing15011906
LMArena Multi-Turn14541482

Frequently asked questions

Is Chatgpt 4o Latest 20250326 better than Muse Spark 1.3?

Muse Spark 1.3 is the stronger model overall, scoring 54.8 to 43.8 on the Noometry Index.

Is Chatgpt 4o Latest 20250326 or Muse Spark 1.3 better for coding?

Muse Spark 1.3 scores higher on coding benchmarks: 56.6 versus 41.6 in the Noometry coding category.

How many benchmarks do Chatgpt 4o Latest 20250326 and Muse Spark 1.3 share?

19 benchmarks have published results for both models. Chatgpt 4o Latest 20250326 has 21 scored results on Noometry and Muse Spark 1.3 has 37.

Related comparisons

Go deeper