Writing & Preference benchmark

WildBench leaderboard

As of October 2026, Qwen3 235B-A22B has the highest published WildBench score on Noometry at 86.6%, out of 57 models with results.

Last verified

About WildBench

Challenging requests taken from real chatbot conversations, graded by an LLM judge with task-specific checklists. HELM Capabilities run.

Category
Writing & Preference
Introduced
2024
Size
1,024 tasks
Format
LLM-judged answers
Unit
Percent (random guessing ≈ 0%)
Official site
crfm.stanford.edu

Top 15 models

Top models on WildBench
  1. Qwen3 235B-A22B 86.6%
  2. GPT-5.1 86.3%
  3. Kimi K2 (Jul 2025) 86.2%
  4. o3 86.1%
  5. Gemini 3 Pro 85.9%
  6. GPT-5 85.7%
  7. Gemini 2.5 Pro 85.7%
  8. GPT-5 Mini 85.5%
  9. Claude Sonnet 4.5 85.4%
  10. GPT-4.1 85.4%
  11. o4-mini 85.4%
  12. Claude Opus 4 85.2%
  13. Grok 3 84.9%
  14. gpt-oss-120b 84.5%
  15. Claude Haiku 4.5 83.9%

Sponsored placements are available on pages like this one. Advertise on Noometry

All results

WildBench results by model
#ModelProviderScoreSettingSourceDate
1Qwen3 235B-A22B Alibaba (Qwen)86.6%HELM Capabilities
2GPT-5.1 OpenAI86.3%HELM Capabilities
3Kimi K2 (Jul 2025) Moonshot AI86.2%HELM Capabilities
4o3 OpenAI86.1%HELM Capabilities
5Gemini 3 Pro Google85.9%HELM Capabilities
6GPT-5 OpenAI85.7%HELM Capabilities
7Gemini 2.5 Pro Google85.7%HELM Capabilities
8GPT-5 Mini OpenAI85.5%HELM Capabilities
9Claude Sonnet 4.5 Anthropic85.4%HELM Capabilities
10GPT-4.1 OpenAI85.4%HELM Capabilities
11o4-mini OpenAI85.4%HELM Capabilities
12Claude Opus 4 Anthropic85.2%HELM Capabilities
13Grok 3 xAI84.9%HELM Capabilities
14gpt-oss-120b OpenAI84.5%HELM Capabilities
15Claude Haiku 4.5 Anthropic83.9%HELM Capabilities
16Claude Sonnet 4 Anthropic83.8%HELM Capabilities
17GPT-4.1 mini OpenAI83.8%HELM Capabilities
18DeepSeek-V3 DeepSeek83%HELM Capabilities
19GPT-4o OpenAI82.8%HELM Capabilities
20DeepSeek-R1 DeepSeek82.8%HELM Capabilities
21Gemini 2.5 Flash-Lite Google81.8%HELM Capabilities
22Gemini 2.5 Flash Google81.7%HELM Capabilities
23Claude 3.7 Sonnet Anthropic81.4%HELM Capabilities
24Gemini 1.5 Pro (May 2024) Google81.3%HELM Capabilities
25GPT-4.1 nano OpenAI81.2%HELM Capabilities
26Qwen3-Next 80B-A3B Instruct Alibaba (Qwen)80.7%HELM Capabilities
27GPT-5 Nano OpenAI80.6%HELM Capabilities
28Qwen2.5 72B Instruct Alibaba (Qwen)80.2%HELM Capabilities
29Mistral Large Mistral AI80.1%HELM Capabilities
30Gemini 2.0 Flash (Feb 2025) Google80%HELM Capabilities
31Llama 4 Maverick Meta80%HELM Capabilities
32Grok 4 xAI79.7%HELM Capabilities
33Claude 3.5 Sonnet Anthropic79.2%HELM Capabilities
34Gemini 1.5 Flash (May 2024) Google79.2%HELM Capabilities
35GPT-4o mini OpenAI79.1%HELM Capabilities
36Gemini 2.0 Flash-Lite Google79%HELM Capabilities
37GLM-4.5-Air Z.ai (Zhipu)78.9%HELM Capabilities
38Mistral Small 3.1 Mistral AI78.8%HELM Capabilities
39Nova Premier 1.0 Amazon78.8%HELM Capabilities
40Llama 3.1-405B Meta78.3%HELM Capabilities
41Llama 4 Scout Meta78%HELM Capabilities
42Amazon Nova Pro Amazon77.7%HELM Capabilities
43Claude 3.5 Haiku Anthropic76%HELM Capabilities
44Llama 3.1-70B Meta75.8%HELM Capabilities
45Amazon Nova Lite Amazon75%HELM Capabilities
46Amazon Nova Micro Amazon74.3%HELM Capabilities
47Granite 4.0 H Small IBM73.9%HELM Capabilities
48gpt-oss-20b OpenAI73.7%HELM Capabilities
49Olmo 2 0325 32b Instruct Allen Institute for AI (Ai2)73.4%HELM Capabilities
50Qwen2.5 7B Instruct Alibaba (Qwen)73.1%HELM Capabilities
51Mixtral 8x22B Mistral AI71.1%HELM Capabilities
52OLMo 2 Furious 13B Allen Institute for AI (Ai2)68.9%HELM Capabilities
53Llama 3.1-8B Meta68.7%HELM Capabilities
54Mixtral 8x7B Mistral AI67.3%HELM Capabilities
55Granite 4.0 Micro IBM67%HELM Capabilities
56Mistral Mistral AI66%HELM Capabilities
57Grok-3 mini xAI65.1%HELM Capabilities

Compare the leaders

Other writing & preference benchmarks

Frequently asked questions

What does WildBench measure?

Challenging requests taken from real chatbot conversations, graded by an LLM judge with task-specific checklists. HELM Capabilities run.

Which model has the highest WildBench score?

As of October 2026, Qwen3 235B-A22B has the highest published WildBench score on Noometry at 86.6%, out of 57 models with results.

What is the best open-weight model on WildBench?

Qwen3 235B-A22B has the highest WildBench accuracy among open-weight models at 86.6%, ranking 1 of 57 overall.