Model comparison

Qwen1.5 4b Chat vs Qwen2.5 7B Instruct

Qwen1.5 4b Chat and Qwen2.5 7B Instruct score almost the same on the Noometry Index (28.8 vs 29.0), so choose on price, context window or the category you care about most.

Last verified . 0 shared benchmarks.

Qwen1.5 4b Chat Alibaba (Qwen)

28.8

Rank #322 Confirmed

Qwen2.5 7B Instruct Alibaba (Qwen)

29.0

Rank #320 Confirmed

Summary

  • The widest gap is in writing & preference, where Qwen2.5 7B Instruct leads 48.8 to 23.8.

Side by side

Qwen1.5 4b Chat and Qwen2.5 7B Instruct specifications
Qwen1.5 4b ChatQwen2.5 7B Instruct
ProviderAlibaba (Qwen)Alibaba (Qwen)
Noometry Index28.829.0
Released—2024-09
WeightsOpenOpen
Context window—131K
Max output—8K
Input $ / M tokens—$0.17
Output $ / M tokens—$0.70
Results tracked1315

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Qwen2.5 7B Instruct leads

Qwen1.5 4b Chat: 29.1 (#308), Qwen2.5 7B Instruct: 36.5 (#208)

Coding benchmarks
BenchmarkQwen1.5 4b ChatQwen2.5 7B Instruct
BigCodeBench Instruct—37.6%
LMArena Coding999—
BigCodeBench Complete—46.1%

Agentic & Tool Use Not comparable

Qwen1.5 4b Chat: —, Qwen2.5 7B Instruct: 23.8 (#124)

Agentic & Tool Use benchmarks
BenchmarkQwen1.5 4b ChatQwen2.5 7B Instruct
BALROG—7.8%

Reasoning Qwen1.5 4b Chat leads

Qwen1.5 4b Chat: 18.5 (#279), Qwen2.5 7B Instruct: 14.8 (#322)

Reasoning benchmarks
BenchmarkQwen1.5 4b ChatQwen2.5 7B Instruct
Chess Puzzles—0%
LMArena Hard Prompts976—
DTBench—47.7%
LMCA—6.4%
Epoch Capabilities Index—118.51

Math Qwen1.5 4b Chat leads

Qwen1.5 4b Chat: 30.4 (#234), Qwen2.5 7B Instruct: 12.6 (#306)

Math benchmarks
BenchmarkQwen1.5 4b ChatQwen2.5 7B Instruct
OTIS Mock AIME 2024-2025—2.5%
Omni-MATH—29.4%
LMArena Math1026—

Knowledge Qwen1.5 4b Chat leads

Qwen1.5 4b Chat: 26.7 (#255), Qwen2.5 7B Instruct: 17.0 (#286)

Knowledge benchmarks
BenchmarkQwen1.5 4b ChatQwen2.5 7B Instruct
GPQA Diamond—35.5%
MMLU-Pro—53.9%
GPQA (HELM)—34.1%
LMArena Expert980—
MMLU—72.9%

Multilingual Not comparable

Qwen1.5 4b Chat: 24.1 (#290), Qwen2.5 7B Instruct: —

Multilingual benchmarks
BenchmarkQwen1.5 4b ChatQwen2.5 7B Instruct
LMArena Non-English979—
LMArena Chinese1024—
LMArena German902—
LMArena Russian952—

Instruction Following Qwen2.5 7B Instruct leads

Qwen1.5 4b Chat: 49.0 (#300), Qwen2.5 7B Instruct: 63.2 (#231)

Instruction Following benchmarks
BenchmarkQwen1.5 4b ChatQwen2.5 7B Instruct
IFEval—74.1%
LMArena Instruction Following978—

Long Context Not comparable

Qwen1.5 4b Chat: 30.1 (#290), Qwen2.5 7B Instruct: —

Long Context benchmarks
BenchmarkQwen1.5 4b ChatQwen2.5 7B Instruct
LMArena Longer Query988—

Writing & Preference Qwen2.5 7B Instruct leads

Qwen1.5 4b Chat: 23.8 (#309), Qwen2.5 7B Instruct: 48.8 (#195)

Writing & Preference benchmarks
BenchmarkQwen1.5 4b ChatQwen2.5 7B Instruct
LMArena Text997—
LMArena Creative Writing969—
WildBench—73.1%
LMArena Multi-Turn977—

Frequently asked questions

Is Qwen1.5 4b Chat better than Qwen2.5 7B Instruct?

Qwen1.5 4b Chat and Qwen2.5 7B Instruct score almost the same on the Noometry Index (28.8 vs 29.0), so choose on price, context window or the category you care about most.

Is Qwen1.5 4b Chat or Qwen2.5 7B Instruct better for coding?

Qwen2.5 7B Instruct scores higher on coding benchmarks: 36.5 versus 29.1 in the Noometry coding category.

How many benchmarks do Qwen1.5 4b Chat and Qwen2.5 7B Instruct share?

0 benchmarks have published results for both models. Qwen1.5 4b Chat has 13 scored results on Noometry and Qwen2.5 7B Instruct has 15.

Related comparisons

Go deeper