Model comparison

Deepseek Coder v2 vs Dolly 2.0-12b

Deepseek Coder v2 is the stronger model overall, scoring 35.9 to 25.5 on the Noometry Index.

Last verified . 11 shared benchmarks.

Deepseek Coder v2 DeepSeek

35.9

Rank #220 Confirmed

Dolly 2.0-12b Databricks

25.5

Rank #342 Confirmed

Summary

  • They share 11 benchmarks with published results for both. Deepseek Coder v2 scores higher in 6 categories and Dolly 2.0-12b in 0 categories; 6 gaps are clear of the uncertainty.
  • The widest gap is in instruction following, where Deepseek Coder v2 leads 61.7 to 38.7.

Side by side

Deepseek Coder v2 and Dolly 2.0-12b specifications
Deepseek Coder v2Dolly 2.0-12b
ProviderDeepSeekDatabricks
Noometry Index35.925.5
Released2024-06-172023-04-11
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked2417

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Deepseek Coder v2 leads

Deepseek Coder v2: 38.1 (#183), Dolly 2.0-12b: 23.4 (#332)

Coding benchmarks
BenchmarkDeepseek Coder v2Dolly 2.0-12b
LMArena Coding1251776
BigCodeBench Instruct48.2%—
BigCodeBench Complete59.7%—
HumanEval+82.3%—
MBPP+75.1%—

Reasoning Deepseek Coder v2 leads

Deepseek Coder v2: 23.6 (#176), Dolly 2.0-12b: 15.3 (#316)

Reasoning benchmarks
BenchmarkDeepseek Coder v2Dolly 2.0-12b
LMArena Hard Prompts1207804
WinoGrande83.7%61.8%
Epoch Capabilities Index—89.67
HellaSwag—70.8%
PIQA—75.4%

Math Deepseek Coder v2 leads

Deepseek Coder v2: 34.9 (#190), Dolly 2.0-12b: 27.3 (#251)

Math benchmarks
BenchmarkDeepseek Coder v2Dolly 2.0-12b
LMArena Math1241871
GSM8K94.5%—

Knowledge Not comparable

Deepseek Coder v2: 32.3 (#212), Dolly 2.0-12b: —

Knowledge benchmarks
BenchmarkDeepseek Coder v2Dolly 2.0-12b
ARC (AI2) Challenge64.3%39.6%
LMArena Expert1181—
BoolQ—56.3%
MMLU—26.2%
OpenBookQA—39.2%

Multilingual Deepseek Coder v2 leads

Deepseek Coder v2: 36.3 (#240), Dolly 2.0-12b: 17.4 (#296)

Multilingual benchmarks
BenchmarkDeepseek Coder v2Dolly 2.0-12b
LMArena Non-English1182836
LMArena Chinese1201836
LMArena French1185—
LMArena German1164—
LMArena Japanese1126—
LMArena Korean1104—
LMArena Russian1188—
LMArena Spanish1153—

Instruction Following Deepseek Coder v2 leads

Deepseek Coder v2: 61.7 (#242), Dolly 2.0-12b: 38.7 (#304)

Instruction Following benchmarks
BenchmarkDeepseek Coder v2Dolly 2.0-12b
LMArena Instruction Following1180814

Long Context Not comparable

Deepseek Coder v2: 37.0 (#224), Dolly 2.0-12b: —

Long Context benchmarks
BenchmarkDeepseek Coder v2Dolly 2.0-12b
LMArena Longer Query1219—

Writing & Preference Deepseek Coder v2 leads

Deepseek Coder v2: 38.2 (#253), Dolly 2.0-12b: 15.2 (#311)

Writing & Preference benchmarks
BenchmarkDeepseek Coder v2Dolly 2.0-12b
LMArena Text1191851
LMArena Creative Writing1120864
LMArena Multi-Turn1177740

Frequently asked questions

Is Deepseek Coder v2 better than Dolly 2.0-12b?

Deepseek Coder v2 is the stronger model overall, scoring 35.9 to 25.5 on the Noometry Index.

Is Deepseek Coder v2 or Dolly 2.0-12b better for coding?

Deepseek Coder v2 scores higher on coding benchmarks: 38.1 versus 23.4 in the Noometry coding category.

How many benchmarks do Deepseek Coder v2 and Dolly 2.0-12b share?

11 benchmarks have published results for both models. Deepseek Coder v2 has 24 scored results on Noometry and Dolly 2.0-12b has 17.

Related comparisons

Go deeper