Model comparison

Gemma 3 27B vs Phi 3 Mini 4k Instruct

Gemma 3 27B is the stronger model overall, scoring 30.8 to 27.9 on the Noometry Index.

Last verified . 25 shared benchmarks.

Gemma 3 27B Google

30.8

Rank #284 Confirmed

Phi 3 Mini 4k Instruct Microsoft

27.9

Rank #328 Confirmed

Summary

  • They share 25 benchmarks with published results for both. Gemma 3 27B scores higher in 4 categories and Phi 3 Mini 4k Instruct in 4 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Gemma 3 27B leads 52.5 to 27.6.
  • The biggest single-benchmark swing is LiveBench Math: 55.4% for Gemma 3 27B and 15.7% for Phi 3 Mini 4k Instruct.

Side by side

Gemma 3 27B and Phi 3 Mini 4k Instruct specifications
Gemma 3 27BPhi 3 Mini 4k Instruct
ProviderGoogleMicrosoft
Noometry Index30.827.9
Released2025-03-112024-04-23
WeightsOpenOpen
Context window131K—
Max output8K—
Input $ / M tokens$0.08—
Output $ / M tokens$0.16—
Results tracked4335

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Phi 3 Mini 4k Instruct leads

Gemma 3 27B: 22.5 (#334), Phi 3 Mini 4k Instruct: 26.6 (#323)

Coding benchmarks
BenchmarkGemma 3 27BPhi 3 Mini 4k Instruct
LiveBench Coding39.9%15.5%
LMArena Coding13221093
Aider Polyglot4.9%—
SciCode21.2%—
HumanEval+—59.1%
MBPP+—54.2%

Agentic & Tool Use Not comparable

Gemma 3 27B: 25.1 (#110), Phi 3 Mini 4k Instruct: —

Agentic & Tool Use benchmarks
BenchmarkGemma 3 27BPhi 3 Mini 4k Instruct
Berkeley Function Calling Leaderboard29.5%—

Reasoning Gemma 3 27B leads

Gemma 3 27B: 16.7 (#301), Phi 3 Mini 4k Instruct: 14.1 (#328)

Reasoning benchmarks
BenchmarkGemma 3 27BPhi 3 Mini 4k Instruct
Chess Puzzles0%0%
LiveBench Reasoning43.8%26.8%
LMArena Hard Prompts13401072
LiveBench Data Analysis51.5%34.7%
LiveBench50%22.4%
Kagi LLM Benchmark40.4%—
CritPt0%—
DTBench52.5%—
LMCA12.3%—
Adversarial NLI—52.8%
BIG-Bench Hard—71.7%
Epoch Capabilities Index130.04—
HellaSwag—76.7%
WinoGrande—70.8%

Math Too close to call

Gemma 3 27B: 25.9 (#265), Phi 3 Mini 4k Instruct: 26.6 (#257)

Math benchmarks
BenchmarkGemma 3 27BPhi 3 Mini 4k Instruct
LiveBench Math55.4%15.7%
LMArena Math13121111
OTIS Mock AIME 2024-202522.5%—
MATH Level 574%—

Knowledge Phi 3 Mini 4k Instruct leads

Gemma 3 27B: 25.5 (#261), Phi 3 Mini 4k Instruct: 28.5 (#246)

Knowledge benchmarks
BenchmarkGemma 3 27BPhi 3 Mini 4k Instruct
LMArena Expert13041045
GPQA Diamond47.7%—
Confabulations40.3%—
Vectara Hallucination Rate7.4%—
ARC (AI2) Challenge—84.9%
MMLU—68.8%
OpenBookQA—88%
TriviaQA—64%

Multimodal Not comparable

Gemma 3 27B: 32.6 (#100), Phi 3 Mini 4k Instruct: —

Multimodal benchmarks
BenchmarkGemma 3 27BPhi 3 Mini 4k Instruct
LMArena Vision1164—
GeoBench52%—

Multilingual Gemma 3 27B leads

Gemma 3 27B: 46.9 (#155), Phi 3 Mini 4k Instruct: 26.3 (#280)

Multilingual benchmarks
BenchmarkGemma 3 27BPhi 3 Mini 4k Instruct
LMArena Non-English13341021
LMArena Chinese13461021
LMArena French13681076
LMArena German13621044
LMArena Japanese1287935
LMArena Korean1308905
LMArena Russian13491022
LMArena Spanish13491085

Instruction Following Gemma 3 27B leads

Gemma 3 27B: 70.6 (#160), Phi 3 Mini 4k Instruct: 47.7 (#303)

Instruction Following benchmarks
BenchmarkGemma 3 27BPhi 3 Mini 4k Instruct
LiveBench Instruction Following74.9%39.1%
LMArena Instruction Following13211053

Long Context Phi 3 Mini 4k Instruct leads

Gemma 3 27B: 27.6 (#293), Phi 3 Mini 4k Instruct: 31.7 (#276)

Long Context benchmarks
BenchmarkGemma 3 27BPhi 3 Mini 4k Instruct
LMArena Longer Query13331044
Fiction.LiveBench33.3%—

Writing & Preference Gemma 3 27B leads

Gemma 3 27B: 52.5 (#168), Phi 3 Mini 4k Instruct: 27.6 (#300)

Writing & Preference benchmarks
BenchmarkGemma 3 27BPhi 3 Mini 4k Instruct
LMArena Text13581073
LMArena Creative Writing13461037
LMArena Multi-Turn13451018
LiveBench Language34.6%9.2%
Short-Story Creative Writing79.9%—
EQ-Bench Creative Writing1266—

Frequently asked questions

Is Gemma 3 27B better than Phi 3 Mini 4k Instruct?

Gemma 3 27B is the stronger model overall, scoring 30.8 to 27.9 on the Noometry Index.

Is Gemma 3 27B or Phi 3 Mini 4k Instruct better for coding?

Phi 3 Mini 4k Instruct scores higher on coding benchmarks: 26.6 versus 22.5 in the Noometry coding category.

How many benchmarks do Gemma 3 27B and Phi 3 Mini 4k Instruct share?

25 benchmarks have published results for both models. Gemma 3 27B has 43 scored results on Noometry and Phi 3 Mini 4k Instruct has 35.

Related comparisons

Go deeper