Model comparison

gpt-oss-20b vs Granite 3.1 8b Instruct

gpt-oss-20b and Granite 3.1 8b Instruct score almost the same on the Noometry Index (32.5 vs 32.4), so choose on price, context window or the category you care about most.

Last verified . 12 shared benchmarks.

gpt-oss-20b OpenAI

32.5

Rank #255 Confirmed

Granite 3.1 8b Instruct IBM

32.4

Rank #258 Confirmed

Summary

  • They share 12 benchmarks with published results for both. gpt-oss-20b scores higher in 6 categories and Granite 3.1 8b Instruct in 3 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in agentic & tool use, where Granite 3.1 8b Instruct leads 24.1 to 9.3.

Side by side

gpt-oss-20b and Granite 3.1 8b Instruct specifications
gpt-oss-20bGranite 3.1 8b Instruct
ProviderOpenAIIBM
Noometry Index32.532.4
Released2025-08-05—
WeightsOpenOpen
Context window131K—
Max output16K—
Input $ / M tokens$0.018—
Output $ / M tokens$0.09—
Results tracked3413

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding gpt-oss-20b leads

gpt-oss-20b: 37.6 (#192), Granite 3.1 8b Instruct: 34.5 (#233)

Coding benchmarks
Benchmarkgpt-oss-20bGranite 3.1 8b Instruct
LMArena Coding13061186
SciCode34.4%—
WeirdML40.9%—
ALE-Bench566.05—

Agentic & Tool Use Granite 3.1 8b Instruct leads

gpt-oss-20b: 9.3 (#154), Granite 3.1 8b Instruct: 24.1 (#120)

Agentic & Tool Use benchmarks
Benchmarkgpt-oss-20bGranite 3.1 8b Instruct
Terminal-Bench3.4%—
Berkeley Function Calling Leaderboard—27.1%

Reasoning Granite 3.1 8b Instruct leads

gpt-oss-20b: 19.3 (#261), Granite 3.1 8b Instruct: 22.1 (#207)

Reasoning benchmarks
Benchmarkgpt-oss-20bGranite 3.1 8b Instruct
LMArena Hard Prompts12741145
Kagi LLM Benchmark53.2%—
CritPt1.4%—
Chess Puzzles4%—
DTBench68%—
LMCA14.5%—
Epoch Capabilities Index137.82—

Math gpt-oss-20b leads

gpt-oss-20b: 39.4 (#103), Granite 3.1 8b Instruct: 33.0 (#209)

Math benchmarks
Benchmarkgpt-oss-20bGranite 3.1 8b Instruct
LMArena Math13171152
OTIS Mock AIME 2024-202565.3%—
Omni-MATH56.5%—

Knowledge gpt-oss-20b leads

gpt-oss-20b: 34.6 (#195), Granite 3.1 8b Instruct: 31.1 (#220)

Knowledge benchmarks
Benchmarkgpt-oss-20bGranite 3.1 8b Instruct
LMArena Expert12581142
GPQA Diamond60.8%—
MMLU-Pro74%—
GPQA (HELM)59.4%—

Multilingual gpt-oss-20b leads

gpt-oss-20b: 42.2 (#197), Granite 3.1 8b Instruct: 30.9 (#260)

Multilingual benchmarks
Benchmarkgpt-oss-20bGranite 3.1 8b Instruct
LMArena Non-English12681099
LMArena Chinese13141145
LMArena Russian12781092
LMArena German1255—
LMArena Japanese1244—
LMArena Korean1236—
LMArena Spanish1267—

Instruction Following gpt-oss-20b leads

gpt-oss-20b: 61.8 (#240), Granite 3.1 8b Instruct: 58.6 (#259)

Instruction Following benchmarks
Benchmarkgpt-oss-20bGranite 3.1 8b Instruct
LMArena Instruction Following12361131
IFEval73.2%—

Long Context gpt-oss-20b leads

gpt-oss-20b: 37.9 (#209), Granite 3.1 8b Instruct: 35.2 (#241)

Long Context benchmarks
Benchmarkgpt-oss-20bGranite 3.1 8b Instruct
LMArena Longer Query12501162

Writing & Preference Too close to call

gpt-oss-20b: 35.5 (#265), Granite 3.1 8b Instruct: 35.5 (#266)

Writing & Preference benchmarks
Benchmarkgpt-oss-20bGranite 3.1 8b Instruct
LMArena Text12871150
LMArena Creative Writing12011129
LMArena Multi-Turn12681108
EQ-Bench Creative Writing666—
WildBench73.7%—

Frequently asked questions

Is gpt-oss-20b better than Granite 3.1 8b Instruct?

gpt-oss-20b and Granite 3.1 8b Instruct score almost the same on the Noometry Index (32.5 vs 32.4), so choose on price, context window or the category you care about most.

Is gpt-oss-20b or Granite 3.1 8b Instruct better for coding?

gpt-oss-20b scores higher on coding benchmarks: 37.6 versus 34.5 in the Noometry coding category.

How many benchmarks do gpt-oss-20b and Granite 3.1 8b Instruct share?

12 benchmarks have published results for both models. gpt-oss-20b has 34 scored results on Noometry and Granite 3.1 8b Instruct has 13.

Related comparisons

Go deeper