Model comparison

Gemini 2.5 Flash-Lite vs Gemini 4 Argon

Gemini 4 Argon is the stronger model overall, scoring 56.5 to 37.0 on the Noometry Index.

Last verified . 13 shared benchmarks.

Gemini 2.5 Flash-Lite Google

37.0

Rank #211 Confirmed

Gemini 4 Argon Google

56.5

Rank #24 Confirmed

Summary

  • They share 13 benchmarks with published results for both. Gemini 2.5 Flash-Lite scores higher in 0 categories and Gemini 4 Argon in 10 categories; 10 gaps are clear of the uncertainty.
  • The widest gap is in math, where Gemini 4 Argon leads 73.9 to 38.0.

Side by side

Gemini 2.5 Flash-Lite and Gemini 4 Argon specifications
Gemini 2.5 Flash-LiteGemini 4 Argon
ProviderGoogleGoogle
Noometry Index37.056.5
Released2025-06-172026-09-30
WeightsProprietaryProprietary
Context window1.05M—
Max output66K—
Input $ / M tokens$0.10—
Output $ / M tokens$0.40—
Results tracked3321

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemini 4 Argon leads

Gemini 2.5 Flash-Lite: 38.5 (#173), Gemini 4 Argon: 62.0 (#9)

Coding benchmarks
BenchmarkGemini 2.5 Flash-LiteGemini 4 Argon
LMArena Coding13731550
LMArena WebDev—1678
FrontierSWE—55%
SciCode—61.8%
WeirdML35.2%—
ALE-Bench325.9—

Agentic & Tool Use Gemini 4 Argon leads

Gemini 2.5 Flash-Lite: 28.0 (#96), Gemini 4 Argon: 49.2 (#8)

Agentic & Tool Use benchmarks
BenchmarkGemini 2.5 Flash-LiteGemini 4 Argon
APEX-Agents—82.2%
Berkeley Function Calling Leaderboard36.9%—
Vending-Bench 2—13,718

Reasoning Gemini 4 Argon leads

Gemini 2.5 Flash-Lite: 22.2 (#205), Gemini 4 Argon: 44.2 (#47)

Reasoning benchmarks
BenchmarkGemini 2.5 Flash-LiteGemini 4 Argon
LMArena Hard Prompts13771548
Kagi LLM Benchmark40.5%—
CritPt—27.1%
DTBench62.8%—
LMCA18.1%—
Epoch Capabilities Index133.94—

Math Gemini 4 Argon leads

Gemini 2.5 Flash-Lite: 38.0 (#144), Gemini 4 Argon: 73.9 (#17)

Math benchmarks
BenchmarkGemini 2.5 Flash-LiteGemini 4 Argon
LMArena Math13731536
ProofBench—99%
Omni-MATH48%—

Knowledge Gemini 4 Argon leads

Gemini 2.5 Flash-Lite: 32.5 (#210), Gemini 4 Argon: 43.9 (#89)

Knowledge benchmarks
BenchmarkGemini 2.5 Flash-LiteGemini 4 Argon
LMArena Expert13731553
MMLU-Pro53.7%—
Vectara Hallucination Rate3.3%—
GPQA (HELM)30.9%—

Multimodal Gemini 4 Argon leads

Gemini 2.5 Flash-Lite: 29.1 (#114), Gemini 4 Argon: 46.5 (#14)

Multimodal benchmarks
BenchmarkGemini 2.5 Flash-LiteGemini 4 Argon
LMArena Vision1198—
VPCT30%—
Blueprint-Bench 2—54.4%

Multilingual Gemini 4 Argon leads

Gemini 2.5 Flash-Lite: 49.3 (#134), Gemini 4 Argon: 60.3 (#1)

Multilingual benchmarks
BenchmarkGemini 2.5 Flash-LiteGemini 4 Argon
LMArena Non-English13691523
LMArena Chinese14041610
LMArena Russian13731537
LMArena Spanish13961497
LMArena French1388—
LMArena German1389—
LMArena Japanese1359—
LMArena Korean1360—

Instruction Following Gemini 4 Argon leads

Gemini 2.5 Flash-Lite: 70.0 (#168), Gemini 4 Argon: 80.1 (#2)

Instruction Following benchmarks
BenchmarkGemini 2.5 Flash-LiteGemini 4 Argon
LMArena Instruction Following13671538
IFEval81%—

Long Context Gemini 4 Argon leads

Gemini 2.5 Flash-Lite: 33.3 (#262), Gemini 4 Argon: 47.6 (#15)

Long Context benchmarks
BenchmarkGemini 2.5 Flash-LiteGemini 4 Argon
LMArena Longer Query13731549
Fiction.LiveBench47.2%—

Writing & Preference Gemini 4 Argon leads

Gemini 2.5 Flash-Lite: 56.8 (#135), Gemini 4 Argon: 71.4 (#19)

Writing & Preference benchmarks
BenchmarkGemini 2.5 Flash-LiteGemini 4 Argon
LMArena Text13791534
LMArena Creative Writing13671531
LMArena Multi-Turn13661557
WildBench81.8%—

Frequently asked questions

Is Gemini 2.5 Flash-Lite better than Gemini 4 Argon?

Gemini 4 Argon is the stronger model overall, scoring 56.5 to 37.0 on the Noometry Index.

Is Gemini 2.5 Flash-Lite or Gemini 4 Argon better for coding?

Gemini 4 Argon scores higher on coding benchmarks: 62.0 versus 38.5 in the Noometry coding category.

How many benchmarks do Gemini 2.5 Flash-Lite and Gemini 4 Argon share?

13 benchmarks have published results for both models. Gemini 2.5 Flash-Lite has 33 scored results on Noometry and Gemini 4 Argon has 21.

Related comparisons

Go deeper