Model comparison

Deepseek Coder v2 vs Qwen Max

Deepseek Coder v2 is the stronger model overall, scoring 35.9 to 34.7 on the Noometry Index.

Last verified . 17 shared benchmarks.

Deepseek Coder v2 DeepSeek

35.9

Rank #220 Confirmed

Qwen Max Alibaba (Qwen)

34.7

Rank #230 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Deepseek Coder v2 scores higher in 3 categories and Qwen Max in 5 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Deepseek Coder v2 leads 34.9 to 22.3.
  • Deepseek Coder v2 has downloadable open weights; the other is API-only.

Side by side

Deepseek Coder v2 and Qwen Max specifications
Deepseek Coder v2Qwen Max
ProviderDeepSeekAlibaba (Qwen)
Noometry Index35.934.7
Released2024-06-172024-04-03
WeightsOpenProprietary
Context window—33K
Max output—8K
Input $ / M tokens—$1.60
Output $ / M tokens—$6.40
Results tracked2423

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Deepseek Coder v2 leads

Deepseek Coder v2: 38.1 (#183), Qwen Max: 30.7 (#292)

Coding benchmarks
BenchmarkDeepseek Coder v2Qwen Max
LMArena Coding12511288
Aider Polyglot—21.8%
BigCodeBench Instruct48.2%—
BigCodeBench Complete59.7%—
HumanEval+82.3%—
MBPP+75.1%—

Reasoning Qwen Max leads

Deepseek Coder v2: 23.6 (#176), Qwen Max: 25.1 (#151)

Reasoning benchmarks
BenchmarkDeepseek Coder v2Qwen Max
LMArena Hard Prompts12071269
WinoGrande83.7%—

Math Deepseek Coder v2 leads

Deepseek Coder v2: 34.9 (#190), Qwen Max: 22.3 (#276)

Math benchmarks
BenchmarkDeepseek Coder v2Qwen Max
LMArena Math12411275
OTIS Mock AIME 2024-2025—16.1%
MATH Level 5—67.2%
FrontierMath (Feb 2025 set)—1%
GSM8K94.5%—

Knowledge Deepseek Coder v2 leads

Deepseek Coder v2: 32.3 (#212), Qwen Max: 30.3 (#228)

Knowledge benchmarks
BenchmarkDeepseek Coder v2Qwen Max
LMArena Expert11811248
GPQA Diamond—56.1%
ARC (AI2) Challenge64.3%—

Multilingual Qwen Max leads

Deepseek Coder v2: 36.3 (#240), Qwen Max: 41.8 (#202)

Multilingual benchmarks
BenchmarkDeepseek Coder v2Qwen Max
LMArena Non-English11821263
LMArena Chinese12011254
LMArena French11851330
LMArena German11641254
LMArena Japanese11261205
LMArena Korean11041142
LMArena Russian11881274
LMArena Spanish11531290

Instruction Following Qwen Max leads

Deepseek Coder v2: 61.7 (#242), Qwen Max: 66.5 (#208)

Instruction Following benchmarks
BenchmarkDeepseek Coder v2Qwen Max
LMArena Instruction Following11801262

Long Context Qwen Max leads

Deepseek Coder v2: 37.0 (#224), Qwen Max: 39.4 (#180)

Long Context benchmarks
BenchmarkDeepseek Coder v2Qwen Max
LMArena Longer Query12191288
Fiction.LiveBench—66.7%

Writing & Preference Qwen Max leads

Deepseek Coder v2: 38.2 (#253), Qwen Max: 47.8 (#205)

Writing & Preference benchmarks
BenchmarkDeepseek Coder v2Qwen Max
LMArena Text11911282
LMArena Creative Writing11201248
LMArena Multi-Turn11771277

Frequently asked questions

Is Deepseek Coder v2 better than Qwen Max?

Deepseek Coder v2 is the stronger model overall, scoring 35.9 to 34.7 on the Noometry Index.

Is Deepseek Coder v2 or Qwen Max better for coding?

Deepseek Coder v2 scores higher on coding benchmarks: 38.1 versus 30.7 in the Noometry coding category.

How many benchmarks do Deepseek Coder v2 and Qwen Max share?

17 benchmarks have published results for both models. Deepseek Coder v2 has 24 scored results on Noometry and Qwen Max has 23.

Related comparisons

Go deeper