Model comparison

Deepseek Coder v2 vs Qwen1.5-110B

Deepseek Coder v2 is the stronger model overall, scoring 35.9 to 34.2 on the Noometry Index.

Last verified . 19 shared benchmarks.

Deepseek Coder v2 DeepSeek

35.9

Rank #220 Confirmed

Qwen1.5-110B Alibaba (Qwen)

34.2

Rank #234 Confirmed

Summary

  • They share 19 benchmarks with published results for both. Deepseek Coder v2 scores higher in 8 categories and Qwen1.5-110B in 0 categories; 6 gaps are clear of the uncertainty.
  • The widest gap is in coding, where Deepseek Coder v2 leads 38.1 to 33.0.
  • The biggest single-benchmark swing is BigCodeBench Complete: 59.7% for Deepseek Coder v2 and 44.4% for Qwen1.5-110B.

Side by side

Deepseek Coder v2 and Qwen1.5-110B specifications
Deepseek Coder v2Qwen1.5-110B
ProviderDeepSeekAlibaba (Qwen)
Noometry Index35.934.2
Released2024-06-172024-04-25
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked2420

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Deepseek Coder v2 leads

Deepseek Coder v2: 38.1 (#183), Qwen1.5-110B: 33.0 (#264)

Coding benchmarks
BenchmarkDeepseek Coder v2Qwen1.5-110B
BigCodeBench Instruct48.2%35%
LMArena Coding12511184
BigCodeBench Complete59.7%44.4%
HumanEval+82.3%—
MBPP+75.1%—

Reasoning Too close to call

Deepseek Coder v2: 23.6 (#176), Qwen1.5-110B: 22.7 (#189)

Reasoning benchmarks
BenchmarkDeepseek Coder v2Qwen1.5-110B
LMArena Hard Prompts12071168
ForecastBench—57.7
WinoGrande83.7%—

Math Deepseek Coder v2 leads

Deepseek Coder v2: 34.9 (#190), Qwen1.5-110B: 33.7 (#201)

Math benchmarks
BenchmarkDeepseek Coder v2Qwen1.5-110B
LMArena Math12411185
GSM8K94.5%—

Knowledge Deepseek Coder v2 leads

Deepseek Coder v2: 32.3 (#212), Qwen1.5-110B: 31.2 (#219)

Knowledge benchmarks
BenchmarkDeepseek Coder v2Qwen1.5-110B
LMArena Expert11811144
ARC (AI2) Challenge64.3%—

Multilingual Deepseek Coder v2 leads

Deepseek Coder v2: 36.3 (#240), Qwen1.5-110B: 33.6 (#250)

Multilingual benchmarks
BenchmarkDeepseek Coder v2Qwen1.5-110B
LMArena Non-English11821142
LMArena Chinese12011206
LMArena French11851151
LMArena German11641123
LMArena Japanese11261074
LMArena Korean11041044
LMArena Russian11881118
LMArena Spanish11531142

Instruction Following Deepseek Coder v2 leads

Deepseek Coder v2: 61.7 (#242), Qwen1.5-110B: 60.3 (#252)

Instruction Following benchmarks
BenchmarkDeepseek Coder v2Qwen1.5-110B
LMArena Instruction Following11801158

Long Context Deepseek Coder v2 leads

Deepseek Coder v2: 37.0 (#224), Qwen1.5-110B: 35.1 (#242)

Long Context benchmarks
BenchmarkDeepseek Coder v2Qwen1.5-110B
LMArena Longer Query12191157

Writing & Preference Too close to call

Deepseek Coder v2: 38.2 (#253), Qwen1.5-110B: 38.0 (#255)

Writing & Preference benchmarks
BenchmarkDeepseek Coder v2Qwen1.5-110B
LMArena Text11911175
LMArena Creative Writing11201148
LMArena Multi-Turn11771160

Frequently asked questions

Is Deepseek Coder v2 better than Qwen1.5-110B?

Deepseek Coder v2 is the stronger model overall, scoring 35.9 to 34.2 on the Noometry Index.

Is Deepseek Coder v2 or Qwen1.5-110B better for coding?

Deepseek Coder v2 scores higher on coding benchmarks: 38.1 versus 33.0 in the Noometry coding category.

How many benchmarks do Deepseek Coder v2 and Qwen1.5-110B share?

19 benchmarks have published results for both models. Deepseek Coder v2 has 24 scored results on Noometry and Qwen1.5-110B has 20.

Related comparisons

Go deeper