Model comparison

Deepseek Coder v2 vs GPT-4o mini

Deepseek Coder v2 is the stronger model overall, scoring 35.9 to 25.5 on the Noometry Index.

Last verified . 22 shared benchmarks.

Deepseek Coder v2 DeepSeek

35.9

Rank #220 Confirmed

GPT-4o mini OpenAI

25.5

Rank #343 Confirmed

Summary

  • They share 22 benchmarks with published results for both. Deepseek Coder v2 scores higher in 4 categories and GPT-4o mini in 4 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in math, where Deepseek Coder v2 leads 34.9 to 10.4.
  • Deepseek Coder v2 has downloadable open weights; the other is API-only.

Side by side

Deepseek Coder v2 and GPT-4o mini specifications
Deepseek Coder v2GPT-4o mini
ProviderDeepSeekOpenAI
Noometry Index35.925.5
Released2024-06-172024-07-18
WeightsOpenProprietary
Context window—128K
Max output—16K
Input $ / M tokens—$0.15
Output $ / M tokens—$0.60
Results tracked2460

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Deepseek Coder v2 leads

Deepseek Coder v2: 38.1 (#183), GPT-4o mini: 22.0 (#335)

Coding benchmarks
BenchmarkDeepseek Coder v2GPT-4o mini
BigCodeBench Instruct48.2%46.1%
LMArena Coding12511290
BigCodeBench Complete59.7%57.4%
HumanEval+82.3%83.5%
MBPP+75.1%72.2%
Aider Polyglot—3.6%
WeirdML—11.8%
LiveBench Coding—43.1%

Agentic & Tool Use Not comparable

Deepseek Coder v2: —, GPT-4o mini: 27.5 (#101)

Agentic & Tool Use benchmarks
BenchmarkDeepseek Coder v2GPT-4o mini
BALROG—17.4%

Reasoning Deepseek Coder v2 leads

Deepseek Coder v2: 23.6 (#176), GPT-4o mini: 8.7 (#347)

Reasoning benchmarks
BenchmarkDeepseek Coder v2GPT-4o mini
LMArena Hard Prompts12071267
ARC-AGI-2—0%
SimpleBench—10.7%
Kagi LLM Benchmark—28.8%
Chess Puzzles—0%
LiveBench Reasoning—32.8%
Mystery Game Puzzles—12%
DTBench—54.4%
LiveBench Data Analysis—50%
LMCA—10.4%
Epoch Capabilities Index—126.56
LiveBench—41.3%
PIQA—88.7%
WinoGrande83.7%—

Math Deepseek Coder v2 leads

Deepseek Coder v2: 34.9 (#190), GPT-4o mini: 10.4 (#314)

Math benchmarks
BenchmarkDeepseek Coder v2GPT-4o mini
LMArena Math12411267
GSM8K94.5%91.3%
FrontierMath (Tiers 1-3)—0.7%
OTIS Mock AIME 2024-2025—6.9%
Omni-MATH—28%
LiveBench Math—36.3%
MATH Level 5—52.6%

Knowledge Deepseek Coder v2 leads

Deepseek Coder v2: 32.3 (#212), GPT-4o mini: 17.7 (#284)

Knowledge benchmarks
BenchmarkDeepseek Coder v2GPT-4o mini
LMArena Expert11811235
GPQA Diamond—37.7%
SimpleQA Verified—8.3%
MMLU-Pro—60.3%
Confabulations—37.2%
GPQA (HELM)—36.8%
ARC (AI2) Challenge64.3%—
BoolQ—88.7%
MMLU—81.8%

Multimodal Not comparable

Deepseek Coder v2: —, GPT-4o mini: 25.9 (#122)

Multimodal benchmarks
BenchmarkDeepseek Coder v2GPT-4o mini
LMArena Vision—1066
Video-MME—64.8%
GeoBench—64%
VPCT—34%

Multilingual GPT-4o mini leads

Deepseek Coder v2: 36.3 (#240), GPT-4o mini: 42.0 (#199)

Multilingual benchmarks
BenchmarkDeepseek Coder v2GPT-4o mini
LMArena Non-English11821266
LMArena Chinese12011265
LMArena French11851297
LMArena German11641272
LMArena Japanese11261216
LMArena Korean11041195
LMArena Russian11881275
LMArena Spanish11531276

Instruction Following Too close to call

Deepseek Coder v2: 61.7 (#242), GPT-4o mini: 61.9 (#239)

Instruction Following benchmarks
BenchmarkDeepseek Coder v2GPT-4o mini
LMArena Instruction Following11801258
LiveBench Instruction Following—56.8%
IFEval—78.2%

Long Context GPT-4o mini leads

Deepseek Coder v2: 37.0 (#224), GPT-4o mini: 39.1 (#186)

Long Context benchmarks
BenchmarkDeepseek Coder v2GPT-4o mini
LMArena Longer Query12191289

Writing & Preference GPT-4o mini leads

Deepseek Coder v2: 38.2 (#253), GPT-4o mini: 39.5 (#248)

Writing & Preference benchmarks
BenchmarkDeepseek Coder v2GPT-4o mini
LMArena Text11911286
LMArena Creative Writing11201268
LMArena Multi-Turn11771285
Short-Story Creative Writing—67.2%
EQ-Bench Creative Writing—873
WildBench—79.1%
LiveBench Language—28.6%

Frequently asked questions

Is Deepseek Coder v2 better than GPT-4o mini?

Deepseek Coder v2 is the stronger model overall, scoring 35.9 to 25.5 on the Noometry Index.

Is Deepseek Coder v2 or GPT-4o mini better for coding?

Deepseek Coder v2 scores higher on coding benchmarks: 38.1 versus 22.0 in the Noometry coding category.

How many benchmarks do Deepseek Coder v2 and GPT-4o mini share?

22 benchmarks have published results for both models. Deepseek Coder v2 has 24 scored results on Noometry and GPT-4o mini has 60.

Related comparisons

Go deeper