Model comparison

Amazon Nova Experimental Chat 12 10 vs DeepSeek-V3.1

Amazon Nova Experimental Chat 12 10 and DeepSeek-V3.1 score almost the same on the Noometry Index (42.9 vs 42.8), so choose on price, context window or the category you care about most.

Last verified . 12 shared benchmarks.

DeepSeek-V3.1 DeepSeek

42.8

Rank #108 Confirmed

Summary

  • They share 12 benchmarks with published results for both. Amazon Nova Experimental Chat 12 10 scores higher in 3 categories and DeepSeek-V3.1 in 5 categories; 4 gaps are clear of the uncertainty.
  • The widest gap is in long context, where Amazon Nova Experimental Chat 12 10 leads 42.4 to 36.3.
  • DeepSeek-V3.1 has downloadable open weights; the other is API-only.

Side by side

Amazon Nova Experimental Chat 12 10 and DeepSeek-V3.1 specifications
Amazon Nova Experimental Chat 12 10DeepSeek-V3.1
ProviderAmazonDeepSeek
Noometry Index42.942.8
Released—2025-08-21
WeightsProprietaryOpen
Context window—164K
Max output—8K
Input $ / M tokens—$0.25
Output $ / M tokens—$0.95
Results tracked1227

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Amazon Nova Experimental Chat 12 10 leads

Amazon Nova Experimental Chat 12 10: 42.2 (#110), DeepSeek-V3.1: 40.3 (#144)

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10DeepSeek-V3.1
LMArena Coding14301417
WeirdML—38.4%

Reasoning Amazon Nova Experimental Chat 12 10 leads

Amazon Nova Experimental Chat 12 10: 29.3 (#94), DeepSeek-V3.1: 27.9 (#110)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10DeepSeek-V3.1
LMArena Hard Prompts14271417
SimpleBench—40%
Kagi LLM Benchmark—53.2%
DTBench—82.7%
LMCA—24.3%
Epoch Capabilities Index—139.92
ForecastBench—58

Math Too close to call

Amazon Nova Experimental Chat 12 10: 38.9 (#124), DeepSeek-V3.1: 38.9 (#122)

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10DeepSeek-V3.1
LMArena Math14191420

Knowledge DeepSeek-V3.1 leads

Amazon Nova Experimental Chat 12 10: 39.2 (#136), DeepSeek-V3.1: 43.7 (#90)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10DeepSeek-V3.1
LMArena Expert14081405
Vectara Hallucination Rate—5.5%

Multilingual Too close to call

Amazon Nova Experimental Chat 12 10: 51.4 (#108), DeepSeek-V3.1: 51.6 (#106)

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10DeepSeek-V3.1
LMArena Non-English13981400
LMArena Chinese14401469
LMArena Russian13951405
LMArena French—1447
LMArena German—1411
LMArena Japanese—1378
LMArena Korean—1337
LMArena Spanish—1431

Instruction Following Too close to call

Amazon Nova Experimental Chat 12 10: 73.2 (#123), DeepSeek-V3.1: 73.9 (#110)

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10DeepSeek-V3.1
LMArena Instruction Following13871400

Long Context Amazon Nova Experimental Chat 12 10 leads

Amazon Nova Experimental Chat 12 10: 42.4 (#125), DeepSeek-V3.1: 36.3 (#232)

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10DeepSeek-V3.1
LMArena Longer Query13911422
Fiction.LiveBench—52.8%

Writing & Preference Too close to call

Amazon Nova Experimental Chat 12 10: 59.5 (#110), DeepSeek-V3.1: 60.3 (#98)

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10DeepSeek-V3.1
LMArena Text14201420
LMArena Creative Writing13501401
LMArena Multi-Turn14091408
EQ-Bench Creative Writing—1436

Frequently asked questions

Is Amazon Nova Experimental Chat 12 10 better than DeepSeek-V3.1?

Amazon Nova Experimental Chat 12 10 and DeepSeek-V3.1 score almost the same on the Noometry Index (42.9 vs 42.8), so choose on price, context window or the category you care about most.

Is Amazon Nova Experimental Chat 12 10 or DeepSeek-V3.1 better for coding?

Amazon Nova Experimental Chat 12 10 scores higher on coding benchmarks: 42.2 versus 40.3 in the Noometry coding category.

How many benchmarks do Amazon Nova Experimental Chat 12 10 and DeepSeek-V3.1 share?

12 benchmarks have published results for both models. Amazon Nova Experimental Chat 12 10 has 12 scored results on Noometry and DeepSeek-V3.1 has 27.

Related comparisons

Go deeper