Model comparison

C4ai Aya Expanse 8b vs Claude 3.5 Sonnet

C4ai Aya Expanse 8b and Claude 3.5 Sonnet score almost the same on the Noometry Index (34.9 vs 34.6), so choose on price, context window or the category you care about most.

Last verified . 14 shared benchmarks.

C4ai Aya Expanse 8b Cohere

34.9

Rank #229 Confirmed

Claude 3.5 Sonnet Anthropic

34.6

Rank #231 Confirmed

Summary

  • They share 14 benchmarks with published results for both. C4ai Aya Expanse 8b scores higher in 2 categories and Claude 3.5 Sonnet in 6 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in math, where C4ai Aya Expanse 8b leads 33.3 to 19.2.
  • C4ai Aya Expanse 8b has downloadable open weights; the other is API-only.

Side by side

C4ai Aya Expanse 8b and Claude 3.5 Sonnet specifications
C4ai Aya Expanse 8bClaude 3.5 Sonnet
ProviderCohereAnthropic
Noometry Index34.934.6
Released—2024-06-20
WeightsOpenProprietary
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked1560

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude 3.5 Sonnet leads

C4ai Aya Expanse 8b: 33.8 (#252), Claude 3.5 Sonnet: 39.0 (#165)

Coding benchmarks
BenchmarkC4ai Aya Expanse 8bClaude 3.5 Sonnet
LMArena Coding11601342
Aider Polyglot—51.6%
GSO—4.6%
WeirdML—40%
BigCodeBench Instruct—46.8%
LiveBench Coding—67.1%
BigCodeBench Complete—58.6%
CadEval—48%
HumanEval+—81.7%
MBPP+—74.3%

Agentic & Tool Use Not comparable

C4ai Aya Expanse 8b: —, Claude 3.5 Sonnet: 32.3 (#67)

Agentic & Tool Use benchmarks
BenchmarkC4ai Aya Expanse 8bClaude 3.5 Sonnet
TheAgentCompany—24%
Cybench—17.5%
BALROG—32.6%
METR Time Horizons—45.2%

Reasoning Too close to call

C4ai Aya Expanse 8b: 22.4 (#197), Claude 3.5 Sonnet: 23.1 (#183)

Reasoning benchmarks
BenchmarkC4ai Aya Expanse 8bClaude 3.5 Sonnet
LMArena Hard Prompts11561305
SimpleBench—41.4%
EnigmaEval—0.9%
LiveBench Reasoning—56.7%
DTBench—67.8%
LiveBench Data Analysis—55%
Epoch Capabilities Index—133.55
ForecastBench—60.7
LiveBench—59%

Math C4ai Aya Expanse 8b leads

C4ai Aya Expanse 8b: 33.3 (#203), Claude 3.5 Sonnet: 19.2 (#288)

Math benchmarks
BenchmarkC4ai Aya Expanse 8bClaude 3.5 Sonnet
LMArena Math11681307
OTIS Mock AIME 2024-2025—8.5%
Omni-MATH—27.6%
LiveBench Math—52.3%
MATH Level 5—56.9%
FrontierMath (Feb 2025 set)—2.1%
FrontierMath Tier 4 (v1)—0%

Knowledge C4ai Aya Expanse 8b leads

C4ai Aya Expanse 8b: 33.6 (#201), Claude 3.5 Sonnet: 28.6 (#245)

Knowledge benchmarks
BenchmarkC4ai Aya Expanse 8bClaude 3.5 Sonnet
LMArena Expert11531265
GPQA Diamond—55.3%
Humanity's Last Exam—4.1%
MMLU-Pro—77.7%
Confabulations—19.9%
Vectara Hallucination Rate9.5%—
GPQA (HELM)—56.5%
MMLU—87.3%

Multimodal Not comparable

C4ai Aya Expanse 8b: —, Claude 3.5 Sonnet: 26.5 (#120)

Multimodal benchmarks
BenchmarkC4ai Aya Expanse 8bClaude 3.5 Sonnet
LMArena Vision—1125
Video-MME—60%
GeoBench—62%
VPCT—33%

Multilingual Claude 3.5 Sonnet leads

C4ai Aya Expanse 8b: 36.1 (#242), Claude 3.5 Sonnet: 43.2 (#185)

Multilingual benchmarks
BenchmarkC4ai Aya Expanse 8bClaude 3.5 Sonnet
LMArena Non-English11801283
LMArena Chinese11811272
LMArena German11881297
LMArena Japanese11201234
LMArena Russian11971306
LMArena French—1305
LMArena Korean—1200
LMArena Spanish—1290

Instruction Following Claude 3.5 Sonnet leads

C4ai Aya Expanse 8b: 60.1 (#253), Claude 3.5 Sonnet: 68.8 (#182)

Instruction Following benchmarks
BenchmarkC4ai Aya Expanse 8bClaude 3.5 Sonnet
LMArena Instruction Following11551297
LiveBench Instruction Following—69.3%
IFEval—85.5%

Long Context Claude 3.5 Sonnet leads

C4ai Aya Expanse 8b: 36.1 (#236), Claude 3.5 Sonnet: 39.9 (#167)

Long Context benchmarks
BenchmarkC4ai Aya Expanse 8bClaude 3.5 Sonnet
LMArena Longer Query11911311

Writing & Preference Claude 3.5 Sonnet leads

C4ai Aya Expanse 8b: 39.0 (#250), Claude 3.5 Sonnet: 52.9 (#164)

Writing & Preference benchmarks
BenchmarkC4ai Aya Expanse 8bClaude 3.5 Sonnet
LMArena Text11851298
LMArena Creative Writing11681292
LMArena Multi-Turn11601326
Short-Story Creative Writing—80.3%
EQ-Bench Creative Writing—1451
WildBench—79.2%
LiveBench Language—53.8%

Frequently asked questions

Is C4ai Aya Expanse 8b better than Claude 3.5 Sonnet?

C4ai Aya Expanse 8b and Claude 3.5 Sonnet score almost the same on the Noometry Index (34.9 vs 34.6), so choose on price, context window or the category you care about most.

Is C4ai Aya Expanse 8b or Claude 3.5 Sonnet better for coding?

Claude 3.5 Sonnet scores higher on coding benchmarks: 39.0 versus 33.8 in the Noometry coding category.

How many benchmarks do C4ai Aya Expanse 8b and Claude 3.5 Sonnet share?

14 benchmarks have published results for both models. C4ai Aya Expanse 8b has 15 scored results on Noometry and Claude 3.5 Sonnet has 60.

Related comparisons

Go deeper