Model comparison

Amazon Nova Experimental Chat 10 20 vs Claude Opus 4.7

Claude Opus 4.7 is the stronger model overall, scoring 58.3 to 42.1 on the Noometry Index.

Last verified . 17 shared benchmarks.

Claude Opus 4.7 Anthropic

58.3

Rank #19 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Amazon Nova Experimental Chat 10 20 scores higher in 0 categories and Claude Opus 4.7 in 8 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Claude Opus 4.7 leads 66.7 to 39.0.

Side by side

Amazon Nova Experimental Chat 10 20 and Claude Opus 4.7 specifications
Amazon Nova Experimental Chat 10 20Claude Opus 4.7
ProviderAmazonAnthropic
Noometry Index42.158.3
Released—2026-04-14
WeightsProprietaryProprietary
Context window—1M
Max output—128K
Input $ / M tokens—$5
Output $ / M tokens—$25
Results tracked1766

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Opus 4.7 leads

Amazon Nova Experimental Chat 10 20: 41.6 (#123), Claude Opus 4.7: 59.6 (#13)

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.7
LMArena Coding14121518
SWE-bench Verified—83.5%
FrontierCode—38.5%
LMArena WebDev—1558
SciCode—54.5%
GSO—44.1%
WeirdML—76.4%
MirrorCode—31.1%
ALE-Bench—1,323

Agentic & Tool Use Not comparable

Amazon Nova Experimental Chat 10 20: —, Claude Opus 4.7: 47.9 (#10)

Agentic & Tool Use benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.7
Terminal-Bench—80.2%
APEX-Agents—49.2%
OSWorld 2.0—18.2%
τ²-bench Banking—40.2%
PostTrainBench—28.6%
ExploitBench—26.5%
GBAEval—43.8%
GDP.pdf—21%
LMArena Search—1233
Vending-Bench 2—10,937

Reasoning Claude Opus 4.7 leads

Amazon Nova Experimental Chat 10 20: 28.4 (#106), Claude Opus 4.7: 53.8 (#29)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.7
LMArena Hard Prompts13961506
ARC-AGI-2—75.8%
SimpleBench—61.7%
Kagi LLM Benchmark—80.7%
NYT Connections (extended)—39%
ARC-AGI-1—93.5%
CritPt—12%
Chess Puzzles—30%
Thematic Generalization—72.8%
EBR-Bench—19%
Mystery Game Puzzles—28%
DTBench—94.7%
LMCA—52.2%
Epoch Capabilities Index—156.25
ForecastBench—60.3

Math Claude Opus 4.7 leads

Amazon Nova Experimental Chat 10 20: 39.0 (#119), Claude Opus 4.7: 66.7 (#26)

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.7
LMArena Math14251499
FrontierMath (Tiers 1-3)—70.2%
FrontierMath Tier 4—31.7%
MathArena Final-Answer Competitions—73.6%
OTIS Mock AIME 2024-2025—97.8%
ProofBench—54%
FrontierMath (Feb 2025 set)—43.8%
FrontierMath Tier 4 (v1)—22.9%

Knowledge Claude Opus 4.7 leads

Amazon Nova Experimental Chat 10 20: 38.5 (#144), Claude Opus 4.7: 62.6 (#23)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.7
LMArena Expert13861521
GPQA Diamond—90.2%
Humanity's Last Exam—36.2%
SimpleQA Verified—51.7%
Vectara Hallucination Rate—12%

Multimodal Not comparable

Amazon Nova Experimental Chat 10 20: —, Claude Opus 4.7: 41.2 (#38)

Multimodal benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.7
LMArena Vision—1316
Blueprint-Bench 2—24.5%
Furniture Assembly—33.3%
LMArena Document—1495

Multilingual Claude Opus 4.7 leads

Amazon Nova Experimental Chat 10 20: 49.5 (#131), Claude Opus 4.7: 57.3 (#10)

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.7
LMArena Non-English13721480
LMArena Chinese14041531
LMArena French14251503
LMArena German13911495
LMArena Japanese13601472
LMArena Korean13241464
LMArena Russian13711494
LMArena Spanish13821495

Instruction Following Claude Opus 4.7 leads

Amazon Nova Experimental Chat 10 20: 72.1 (#141), Claude Opus 4.7: 78.4 (#10)

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.7
LMArena Instruction Following13651498

Long Context Claude Opus 4.7 leads

Amazon Nova Experimental Chat 10 20: 41.7 (#133), Claude Opus 4.7: 46.2 (#25)

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.7
LMArena Longer Query13701505

Writing & Preference Claude Opus 4.7 leads

Amazon Nova Experimental Chat 10 20: 56.6 (#136), Claude Opus 4.7: 75.1 (#8)

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.7
LMArena Text13941490
LMArena Creative Writing13181486
LMArena Multi-Turn13641505
EQ-Bench Creative Writing—1914
EQ-Bench 4—1311

Frequently asked questions

Is Amazon Nova Experimental Chat 10 20 better than Claude Opus 4.7?

Claude Opus 4.7 is the stronger model overall, scoring 58.3 to 42.1 on the Noometry Index.

Is Amazon Nova Experimental Chat 10 20 or Claude Opus 4.7 better for coding?

Claude Opus 4.7 scores higher on coding benchmarks: 59.6 versus 41.6 in the Noometry coding category.

How many benchmarks do Amazon Nova Experimental Chat 10 20 and Claude Opus 4.7 share?

17 benchmarks have published results for both models. Amazon Nova Experimental Chat 10 20 has 17 scored results on Noometry and Claude Opus 4.7 has 66.

Related comparisons

Go deeper