Model comparison

GLM-5 vs Kimi K2 Thinking Turbo

GLM-5 and Kimi K2 Thinking Turbo score almost the same on the Noometry Index (46.1 vs 45.8), so choose on price, context window or the category you care about most.

Last verified . 21 shared benchmarks.

GLM-5 Z.ai (Zhipu)

46.1

Rank #66 Confirmed

Kimi K2 Thinking Turbo Moonshot AI

45.8

Rank #70 Confirmed

Summary

  • They share 21 benchmarks with published results for both. GLM-5 scores higher in 6 categories and Kimi K2 Thinking Turbo in 2 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in coding, where GLM-5 leads 49.0 to 38.4.
  • The biggest single-benchmark swing is Chess Puzzles: 10% for GLM-5 and 20% for Kimi K2 Thinking Turbo.

Side by side

GLM-5 and Kimi K2 Thinking Turbo specifications
GLM-5Kimi K2 Thinking Turbo
ProviderZ.ai (Zhipu)Moonshot AI
Noometry Index46.145.8
Released2026-02-112025-11-06
WeightsOpenOpen
Context window205K—
Max output131K—
Input $ / M tokens$1—
Output $ / M tokens$3.20—
Results tracked4521

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding GLM-5 leads

GLM-5: 49.0 (#52), Kimi K2 Thinking Turbo: 38.4 (#178)

Coding benchmarks
BenchmarkGLM-5Kimi K2 Thinking Turbo
LMArena WebDev14341322
LMArena Coding14611454
SWE-bench Verified72.1%—
SWE-bench Verified (bash only)72.8%—
SWE-bench Multilingual69.7%—
WeirdML48.2%—
ALE-Bench765.62—

Agentic & Tool Use Not comparable

GLM-5: 31.1 (#71), Kimi K2 Thinking Turbo: —

Agentic & Tool Use benchmarks
BenchmarkGLM-5Kimi K2 Thinking Turbo
Terminal-Bench52.4%—
τ²-bench Airline82.5%—
τ²-bench Banking9.8%—
τ²-bench Retail73.7%—
τ²-bench Telecom86.8%—
Vending-Bench 24,432—

Reasoning Kimi K2 Thinking Turbo leads

GLM-5: 27.6 (#116), Kimi K2 Thinking Turbo: 32.5 (#75)

Reasoning benchmarks
BenchmarkGLM-5Kimi K2 Thinking Turbo
Chess Puzzles10%20%
LMArena Hard Prompts14521428
ARC-AGI-24.9%—
SimpleBench53.2%—
Kagi LLM Benchmark75%—
NYT Connections (extended)74.8%—
ARC-AGI-144.7%—
Epoch Capabilities Index145.83—
ForecastBench61—

Math Kimi K2 Thinking Turbo leads

GLM-5: 46.4 (#71), Kimi K2 Thinking Turbo: 47.4 (#68)

Math benchmarks
BenchmarkGLM-5Kimi K2 Thinking Turbo
OTIS Mock AIME 2024-202580%83.1%
LMArena Math14401429
MathArena Final-Answer Competitions65.7%—
FrontierMath (Feb 2025 set)16.4%—
FrontierMath Tier 4 (v1)2.1%—

Knowledge GLM-5 leads

GLM-5: 52.3 (#64), Kimi K2 Thinking Turbo: 50.9 (#69)

Knowledge benchmarks
BenchmarkGLM-5Kimi K2 Thinking Turbo
GPQA Diamond87.8%84.2%
LMArena Expert14541439
Vectara Hallucination Rate10.1%—

Multilingual GLM-5 leads

GLM-5: 53.7 (#58), Kimi K2 Thinking Turbo: 51.4 (#109)

Multilingual benchmarks
BenchmarkGLM-5Kimi K2 Thinking Turbo
LMArena Non-English14301398
LMArena Chinese15111456
LMArena French14551425
LMArena German14451390
LMArena Japanese14161357
LMArena Korean14231330
LMArena Russian14361391
LMArena Spanish14541406

Instruction Following GLM-5 leads

GLM-5: 75.2 (#67), Kimi K2 Thinking Turbo: 74.0 (#109)

Instruction Following benchmarks
BenchmarkGLM-5Kimi K2 Thinking Turbo
LMArena Instruction Following14281403

Long Context GLM-5 leads

GLM-5: 44.7 (#60), Kimi K2 Thinking Turbo: 43.2 (#102)

Long Context benchmarks
BenchmarkGLM-5Kimi K2 Thinking Turbo
LMArena Longer Query14461415
CL-bench18.7%—

Writing & Preference GLM-5 leads

GLM-5: 66.0 (#38), Kimi K2 Thinking Turbo: 60.0 (#104)

Writing & Preference benchmarks
BenchmarkGLM-5Kimi K2 Thinking Turbo
LMArena Text14461415
LMArena Creative Writing14391374
LMArena Multi-Turn14561414
EQ-Bench Creative Writing1601—

Frequently asked questions

Is GLM-5 better than Kimi K2 Thinking Turbo?

GLM-5 and Kimi K2 Thinking Turbo score almost the same on the Noometry Index (46.1 vs 45.8), so choose on price, context window or the category you care about most.

Is GLM-5 or Kimi K2 Thinking Turbo better for coding?

GLM-5 scores higher on coding benchmarks: 49.0 versus 38.4 in the Noometry coding category.

How many benchmarks do GLM-5 and Kimi K2 Thinking Turbo share?

21 benchmarks have published results for both models. GLM-5 has 45 scored results on Noometry and Kimi K2 Thinking Turbo has 21.

Related comparisons

Go deeper