Model comparison

Claude 2.1 vs Deepseek Coder v2

Deepseek Coder v2 is the stronger model overall, scoring 35.9 to 25.2 on the Noometry Index.

Last verified . 0 shared benchmarks.

Claude 2.1 Anthropic

25.2

Rank #345 Reported

Deepseek Coder v2 DeepSeek

35.9

Rank #220 Confirmed

Summary

  • The widest gap is in math, where Deepseek Coder v2 leads 34.9 to 10.2.
  • Deepseek Coder v2 has downloadable open weights; the other is API-only.

Side by side

Claude 2.1 and Deepseek Coder v2 specifications
Claude 2.1Deepseek Coder v2
ProviderAnthropicDeepSeek
Noometry Index25.235.9
Released2023-11-212024-06-17
WeightsProprietaryOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked724

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Deepseek Coder v2 leads

Claude 2.1: 26.2 (#327), Deepseek Coder v2: 38.1 (#183)

Coding benchmarks
BenchmarkClaude 2.1Deepseek Coder v2
WeirdML7.1%—
BigCodeBench Instruct—48.2%
LMArena Coding—1251
BigCodeBench Complete—59.7%
HumanEval+—82.3%
MBPP+—75.1%

Reasoning Deepseek Coder v2 leads

Claude 2.1: 21.4 (#221), Deepseek Coder v2: 23.6 (#176)

Reasoning benchmarks
BenchmarkClaude 2.1Deepseek Coder v2
LMArena Hard Prompts—1207
DTBench51%—
Epoch Capabilities Index119.27—
ForecastBench54.2—
WinoGrande—83.7%

Math Deepseek Coder v2 leads

Claude 2.1: 10.2 (#315), Deepseek Coder v2: 34.9 (#190)

Math benchmarks
BenchmarkClaude 2.1Deepseek Coder v2
OTIS Mock AIME 2024-20251.9%—
LMArena Math—1241
GSM8K—94.5%

Knowledge Deepseek Coder v2 leads

Claude 2.1: 15.4 (#292), Deepseek Coder v2: 32.3 (#212)

Knowledge benchmarks
BenchmarkClaude 2.1Deepseek Coder v2
GPQA Diamond33%—
LMArena Expert—1181
ARC (AI2) Challenge—64.3%
MMLU73.5%—

Multilingual Not comparable

Claude 2.1: —, Deepseek Coder v2: 36.3 (#240)

Multilingual benchmarks
BenchmarkClaude 2.1Deepseek Coder v2
LMArena Non-English—1182
LMArena Chinese—1201
LMArena French—1185
LMArena German—1164
LMArena Japanese—1126
LMArena Korean—1104
LMArena Russian—1188
LMArena Spanish—1153

Instruction Following Not comparable

Claude 2.1: —, Deepseek Coder v2: 61.7 (#242)

Instruction Following benchmarks
BenchmarkClaude 2.1Deepseek Coder v2
LMArena Instruction Following—1180

Long Context Not comparable

Claude 2.1: —, Deepseek Coder v2: 37.0 (#224)

Long Context benchmarks
BenchmarkClaude 2.1Deepseek Coder v2
LMArena Longer Query—1219

Writing & Preference Not comparable

Claude 2.1: —, Deepseek Coder v2: 38.2 (#253)

Writing & Preference benchmarks
BenchmarkClaude 2.1Deepseek Coder v2
LMArena Text—1191
LMArena Creative Writing—1120
LMArena Multi-Turn—1177

Frequently asked questions

Is Claude 2.1 better than Deepseek Coder v2?

Deepseek Coder v2 is the stronger model overall, scoring 35.9 to 25.2 on the Noometry Index.

Is Claude 2.1 or Deepseek Coder v2 better for coding?

Deepseek Coder v2 scores higher on coding benchmarks: 38.1 versus 26.2 in the Noometry coding category.

How many benchmarks do Claude 2.1 and Deepseek Coder v2 share?

0 benchmarks have published results for both models. Claude 2.1 has 7 scored results on Noometry and Deepseek Coder v2 has 24.

Related comparisons

Go deeper