Model comparison

Kimi K2 Thinking Turbo vs Qwen3.7 Plus

Kimi K2 Thinking Turbo and Qwen3.7 Plus score almost the same on the Noometry Index (45.8 vs 45.3), so choose on price, context window or the category you care about most.

Last verified . 20 shared benchmarks.

Kimi K2 Thinking Turbo Moonshot AI

45.8

Rank #70 Confirmed

Qwen3.7 Plus Alibaba (Qwen)

45.3

Rank #72 Confirmed

Summary

  • They share 20 benchmarks with published results for both. Kimi K2 Thinking Turbo scores higher in 1 category and Qwen3.7 Plus in 7 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Qwen3.7 Plus leads 39.3 to 32.5.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 83.1% for Kimi K2 Thinking Turbo and 93.3% for Qwen3.7 Plus.
  • Kimi K2 Thinking Turbo has downloadable open weights; the other is API-only.

Side by side

Kimi K2 Thinking Turbo and Qwen3.7 Plus specifications
Kimi K2 Thinking TurboQwen3.7 Plus
ProviderMoonshot AIAlibaba (Qwen)
Noometry Index45.845.3
Released2025-11-062026-06-02
WeightsOpenProprietary
Context window—1M
Max output—131K
Input $ / M tokens—$0.40
Output $ / M tokens—$1.60
Results tracked2132

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Kimi K2 Thinking Turbo leads

Kimi K2 Thinking Turbo: 38.4 (#178), Qwen3.7 Plus: 36.6 (#206)

Coding benchmarks
BenchmarkKimi K2 Thinking TurboQwen3.7 Plus
LMArena Coding14541473
FrontierCode—10.2%
LMArena WebDev1322—
SciCode—45.5%

Agentic & Tool Use Not comparable

Kimi K2 Thinking Turbo: —, Qwen3.7 Plus: 21.4 (#138)

Agentic & Tool Use benchmarks
BenchmarkKimi K2 Thinking TurboQwen3.7 Plus
OSWorld 2.0—2.8%

Reasoning Qwen3.7 Plus leads

Kimi K2 Thinking Turbo: 32.5 (#75), Qwen3.7 Plus: 39.3 (#59)

Reasoning benchmarks
BenchmarkKimi K2 Thinking TurboQwen3.7 Plus
Chess Puzzles20%24%
LMArena Hard Prompts14281460
NYT Connections (extended)—74.8%
CritPt—9.1%
Mystery Game Puzzles—17%
DTBench—84%
LMCA—37.6%
Epoch Capabilities Index—147.37

Math Qwen3.7 Plus leads

Kimi K2 Thinking Turbo: 47.4 (#68), Qwen3.7 Plus: 50.5 (#56)

Math benchmarks
BenchmarkKimi K2 Thinking TurboQwen3.7 Plus
OTIS Mock AIME 2024-202583.1%93.3%
LMArena Math14291466
FrontierMath (Tiers 1-3)—34.4%

Knowledge Qwen3.7 Plus leads

Kimi K2 Thinking Turbo: 50.9 (#69), Qwen3.7 Plus: 54.9 (#51)

Knowledge benchmarks
BenchmarkKimi K2 Thinking TurboQwen3.7 Plus
GPQA Diamond84.2%87.9%
LMArena Expert14391467

Multimodal Not comparable

Kimi K2 Thinking Turbo: —, Qwen3.7 Plus: 41.8 (#33)

Multimodal benchmarks
BenchmarkKimi K2 Thinking TurboQwen3.7 Plus
LMArena Vision—1279
LMArena Document—1444

Multilingual Qwen3.7 Plus leads

Kimi K2 Thinking Turbo: 51.4 (#109), Qwen3.7 Plus: 54.8 (#38)

Multilingual benchmarks
BenchmarkKimi K2 Thinking TurboQwen3.7 Plus
LMArena Non-English13981445
LMArena Chinese14561510
LMArena French14251473
LMArena German13901471
LMArena Japanese13571413
LMArena Korean13301415
LMArena Russian13911457
LMArena Spanish14061457

Instruction Following Qwen3.7 Plus leads

Kimi K2 Thinking Turbo: 74.0 (#109), Qwen3.7 Plus: 75.8 (#52)

Instruction Following benchmarks
BenchmarkKimi K2 Thinking TurboQwen3.7 Plus
LMArena Instruction Following14031440

Long Context Qwen3.7 Plus leads

Kimi K2 Thinking Turbo: 43.2 (#102), Qwen3.7 Plus: 44.5 (#65)

Long Context benchmarks
BenchmarkKimi K2 Thinking TurboQwen3.7 Plus
LMArena Longer Query14151455

Writing & Preference Qwen3.7 Plus leads

Kimi K2 Thinking Turbo: 60.0 (#104), Qwen3.7 Plus: 64.3 (#56)

Writing & Preference benchmarks
BenchmarkKimi K2 Thinking TurboQwen3.7 Plus
LMArena Text14151455
LMArena Creative Writing13741439
LMArena Multi-Turn14141460

Frequently asked questions

Is Kimi K2 Thinking Turbo better than Qwen3.7 Plus?

Kimi K2 Thinking Turbo and Qwen3.7 Plus score almost the same on the Noometry Index (45.8 vs 45.3), so choose on price, context window or the category you care about most.

Is Kimi K2 Thinking Turbo or Qwen3.7 Plus better for coding?

Kimi K2 Thinking Turbo scores higher on coding benchmarks: 38.4 versus 36.6 in the Noometry coding category.

How many benchmarks do Kimi K2 Thinking Turbo and Qwen3.7 Plus share?

20 benchmarks have published results for both models. Kimi K2 Thinking Turbo has 21 scored results on Noometry and Qwen3.7 Plus has 32.

Related comparisons

Go deeper