Model comparison

Gemma 3n E4b IT vs Kimi K3

Kimi K3 is the stronger model overall, scoring 59.5 to 37.3 on the Noometry Index.

Last verified . 17 shared benchmarks.

Gemma 3n E4b IT Google

37.3

Rank #206 Confirmed

Kimi K3 Moonshot AI

59.5

Rank #15 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Gemma 3n E4b IT scores higher in 0 categories and Kimi K3 in 8 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Kimi K3 leads 63.0 to 19.9.

Side by side

Gemma 3n E4b IT and Kimi K3 specifications
Gemma 3n E4b ITKimi K3
ProviderGoogleMoonshot AI
Noometry Index37.359.5
Released—2026-07-16
WeightsOpenOpen
Context window—1.05M
Max output—1.05M
Input $ / M tokens—$3
Output $ / M tokens—$15
Results tracked1853

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Kimi K3 leads

Gemma 3n E4b IT: 37.0 (#198), Kimi K3: 61.0 (#10)

Coding benchmarks
BenchmarkGemma 3n E4b ITKimi K3
LMArena Coding12681508
DeepSWE—68.5%
FrontierCode—44.2%
LMArena WebDev—1654
FrontierSWE—25.9%
SciCode—59.5%
WeirdML—82.6%
ALE-Bench—1,524

Agentic & Tool Use Not comparable

Gemma 3n E4b IT: —, Kimi K3: 41.8 (#20)

Agentic & Tool Use benchmarks
BenchmarkGemma 3n E4b ITKimi K3
APEX-Agents—50.6%
τ²-bench Banking—37.1%
PostTrainBench—32%
GBAEval—48.3%
GDP.pdf—19%
Vending-Bench 2—5,165

Reasoning Kimi K3 leads

Gemma 3n E4b IT: 19.9 (#247), Kimi K3: 63.0 (#17)

Reasoning benchmarks
BenchmarkGemma 3n E4b ITKimi K3
LMArena Hard Prompts12841496
ARC-AGI-2—60.4%
SimpleBench—60.7%
Kagi LLM Benchmark31.5%—
NYT Connections (extended)—93.6%
ARC-AGI-1—94.5%
CritPt—23.4%
Chess Puzzles—39%
Mystery Game Puzzles—26%
DTBench—91.2%
LMCA—52.7%
Surface Evolver Bench—95%
Epoch Capabilities Index—157.45
ForecastBench—61.1

Math Kimi K3 leads

Gemma 3n E4b IT: 35.1 (#188), Kimi K3: 74.2 (#16)

Math benchmarks
BenchmarkGemma 3n E4b ITKimi K3
LMArena Math12511491
FrontierMath (Tiers 1-3)—72.2%
FrontierMath Tier 4—39%
MathArena Final-Answer Competitions—87.8%
OTIS Mock AIME 2024-2025—97.2%
ProofBench—87%

Knowledge Kimi K3 leads

Gemma 3n E4b IT: 34.2 (#198), Kimi K3: 63.2 (#21)

Knowledge benchmarks
BenchmarkGemma 3n E4b ITKimi K3
LMArena Expert12461521
GPQA Diamond—93.1%
SimpleQA Verified—50.6%

Multimodal Not comparable

Gemma 3n E4b IT: —, Kimi K3: 37.8 (#70)

Multimodal benchmarks
BenchmarkGemma 3n E4b ITKimi K3
Blueprint-Bench 2—29.5%
Furniture Assembly—34.2%

Multilingual Kimi K3 leads

Gemma 3n E4b IT: 43.4 (#183), Kimi K3: 56.3 (#21)

Multilingual benchmarks
BenchmarkGemma 3n E4b ITKimi K3
LMArena Non-English12851466
LMArena Chinese13091529
LMArena French13301491
LMArena German13111488
LMArena Japanese12721487
LMArena Korean12591458
LMArena Russian12881482
LMArena Spanish13051472

Instruction Following Kimi K3 leads

Gemma 3n E4b IT: 66.1 (#210), Kimi K3: 77.7 (#14)

Instruction Following benchmarks
BenchmarkGemma 3n E4b ITKimi K3
LMArena Instruction Following12551483

Long Context Kimi K3 leads

Gemma 3n E4b IT: 38.7 (#191), Kimi K3: 45.8 (#29)

Long Context benchmarks
BenchmarkGemma 3n E4b ITKimi K3
LMArena Longer Query12761494

Writing & Preference Kimi K3 leads

Gemma 3n E4b IT: 50.1 (#186), Kimi K3: 76.6 (#4)

Writing & Preference benchmarks
BenchmarkGemma 3n E4b ITKimi K3
LMArena Text13061476
LMArena Creative Writing12871454
LMArena Multi-Turn12761488
EQ-Bench Creative Writing—2082
EQ-Bench 4—1339

Frequently asked questions

Is Gemma 3n E4b IT better than Kimi K3?

Kimi K3 is the stronger model overall, scoring 59.5 to 37.3 on the Noometry Index.

Is Gemma 3n E4b IT or Kimi K3 better for coding?

Kimi K3 scores higher on coding benchmarks: 61.0 versus 37.0 in the Noometry coding category.

How many benchmarks do Gemma 3n E4b IT and Kimi K3 share?

17 benchmarks have published results for both models. Gemma 3n E4b IT has 18 scored results on Noometry and Kimi K3 has 53.

Related comparisons

Go deeper