Model comparison

Gemini 4 Argon vs GLM-4.7

Gemini 4 Argon is the stronger model overall, scoring 56.5 to 42.0 on the Noometry Index.

Last verified . 18 shared benchmarks.

Gemini 4 Argon Google

56.5

Rank #24 Confirmed

GLM-4.7 Z.ai (Zhipu)

42.0

Rank #124 Confirmed

Summary

  • They share 18 benchmarks with published results for both. Gemini 4 Argon scores higher in 8 categories and GLM-4.7 in 1 category; 9 gaps are clear of the uncertainty.
  • The widest gap is in math, where Gemini 4 Argon leads 73.9 to 38.6.
  • The biggest single-benchmark swing is ProofBench: 99% for Gemini 4 Argon and 6% for GLM-4.7.
  • GLM-4.7 has downloadable open weights; the other is API-only.

Side by side

Gemini 4 Argon and GLM-4.7 specifications
Gemini 4 ArgonGLM-4.7
ProviderGoogleZ.ai (Zhipu)
Noometry Index56.542.0
Released2026-09-302025-12-22
WeightsProprietaryOpen
Context window—205K
Max output—131K
Input $ / M tokens—$0.60
Output $ / M tokens—$2.20
Results tracked2136

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemini 4 Argon leads

Gemini 4 Argon: 62.0 (#9), GLM-4.7: 44.0 (#79)

Coding benchmarks
BenchmarkGemini 4 ArgonGLM-4.7
LMArena WebDev16781435
SciCode61.8%45.1%
LMArena Coding15501454
FrontierSWE55%—
ALE-Bench—399.48

Agentic & Tool Use Gemini 4 Argon leads

Gemini 4 Argon: 49.2 (#8), GLM-4.7: 26.5 (#103)

Agentic & Tool Use benchmarks
BenchmarkGemini 4 ArgonGLM-4.7
Vending-Bench 213,7182,377
Terminal-Bench—33.4%
APEX-Agents82.2%—

Reasoning Gemini 4 Argon leads

Gemini 4 Argon: 44.2 (#47), GLM-4.7: 24.3 (#164)

Reasoning benchmarks
BenchmarkGemini 4 ArgonGLM-4.7
CritPt27.1%1.7%
LMArena Hard Prompts15481443
SimpleBench—47.7%
Chess Puzzles—6%
Epoch Capabilities Index—143.51

Math Gemini 4 Argon leads

Gemini 4 Argon: 73.9 (#17), GLM-4.7: 38.6 (#135)

Math benchmarks
BenchmarkGemini 4 ArgonGLM-4.7
ProofBench99%6%
LMArena Math15361423
OTIS Mock AIME 2024-2025—83.3%
FrontierMath (Feb 2025 set)—2.4%
FrontierMath Tier 4 (v1)—0%

Knowledge GLM-4.7 leads

Gemini 4 Argon: 43.9 (#89), GLM-4.7: 47.0 (#80)

Knowledge benchmarks
BenchmarkGemini 4 ArgonGLM-4.7
LMArena Expert15531424
GPQA Diamond—83.3%
SimpleQA Verified—32.2%
Vectara Hallucination Rate—11.7%

Multimodal Not comparable

Gemini 4 Argon: 46.5 (#14), GLM-4.7: —

Multimodal benchmarks
BenchmarkGemini 4 ArgonGLM-4.7
Blueprint-Bench 254.4%—

Multilingual Gemini 4 Argon leads

Gemini 4 Argon: 60.3 (#1), GLM-4.7: 52.8 (#79)

Multilingual benchmarks
BenchmarkGemini 4 ArgonGLM-4.7
LMArena Non-English15231417
LMArena Chinese16101495
LMArena Russian15371423
LMArena Spanish14971434
LMArena French—1432
LMArena German—1424
LMArena Japanese—1439
LMArena Korean—1399

Instruction Following Gemini 4 Argon leads

Gemini 4 Argon: 80.1 (#2), GLM-4.7: 74.4 (#95)

Instruction Following benchmarks
BenchmarkGemini 4 ArgonGLM-4.7
LMArena Instruction Following15381411

Long Context Gemini 4 Argon leads

Gemini 4 Argon: 47.6 (#15), GLM-4.7: 42.8 (#116)

Long Context benchmarks
BenchmarkGemini 4 ArgonGLM-4.7
LMArena Longer Query15491432
CL-bench—15.9%
CL-bench Life—10.9%

Writing & Preference Gemini 4 Argon leads

Gemini 4 Argon: 71.4 (#19), GLM-4.7: 60.9 (#93)

Writing & Preference benchmarks
BenchmarkGemini 4 ArgonGLM-4.7
LMArena Text15341435
LMArena Creative Writing15311401
LMArena Multi-Turn15571446
EQ-Bench Creative Writing—1413

Frequently asked questions

Is Gemini 4 Argon better than GLM-4.7?

Gemini 4 Argon is the stronger model overall, scoring 56.5 to 42.0 on the Noometry Index.

Is Gemini 4 Argon or GLM-4.7 better for coding?

Gemini 4 Argon scores higher on coding benchmarks: 62.0 versus 44.0 in the Noometry coding category.

How many benchmarks do Gemini 4 Argon and GLM-4.7 share?

18 benchmarks have published results for both models. Gemini 4 Argon has 21 scored results on Noometry and GLM-4.7 has 36.

Related comparisons

Go deeper