Writing & Preference benchmark

EQ-Bench Creative Writing leaderboard

As of October 2026, GPT-6 Astra has the highest published EQ-Bench Creative Writing score on Noometry at 2173, out of 115 models with results.

Last verified

About EQ-Bench Creative Writing

Elo ratings from pairwise comparisons of short stories written to creative prompts, judged by an LLM against a detailed rubric (v3).

Category
Writing & Preference
Introduced
2025
Format
Pairwise LLM-judged stories
Unit
Arena rating (Bradley–Terry)
Official site
eqbench.com

Top 15 models

Top models on EQ-Bench Creative Writing
  1. GPT-6 Astra 2173
  2. Claude Fable 5.1 2162
  3. Claude Opus 5 2133
  4. GPT-6 Sol 2125
  5. Kimi K3 2082
  6. GLM-5.3 2075
  7. Claude Opus 5.5 2050
  8. Grok 4.7 2007
  9. GPT-5.6 Sol 1972
  10. Claude Fable 5 1943
  11. Aion 3.5 1929
  12. Muse Spark 1.1 1927
  13. Claude Opus 4.7 1914
  14. Muse Spark 1.3 1906
  15. GPT-5.6 Terra 1855

Sponsored placements are available on pages like this one. Advertise on Noometry

All results

EQ-Bench Creative Writing results by model
#ModelProviderRatingSettingSourceDate
1GPT-6 Astra OpenAI2173EQ-Bench
2Claude Fable 5.1 Anthropic2162EQ-Bench
3Claude Opus 5 Anthropic2133EQ-Bench
4GPT-6 Sol OpenAI2125EQ-Bench
5Kimi K3 Moonshot AI2082EQ-Bench
6GLM-5.3 Z.ai (Zhipu)2075EQ-Bench
7Claude Opus 5.5 Anthropic2050EQ-Bench
8Grok 4.7 xAI2007EQ-Bench
9GPT-5.6 Sol OpenAI1972EQ-Bench
10Claude Fable 5 Anthropic1943EQ-Bench
11Aion 3.5 AionLabs1929EQ-Bench
12Muse Spark 1.1 Meta1927EQ-Bench
13Claude Opus 4.7 Anthropic1914EQ-Bench
14Muse Spark 1.3 Meta1906EQ-Bench
15GPT-5.6 Terra OpenAI1855EQ-Bench
16GPT-5.5 OpenAI1844EQ-Bench
17Qwen3.8 2.4T A95B Alibaba (Qwen)1843EQ-Bench
18Muse Spark 1.2 Meta1840EQ-Bench
19Claude Opus 4.8 Anthropic1840EQ-Bench
20GPT-5.4 OpenAI1840EQ-Bench
21GPT-5.6 Luna OpenAI1829EQ-Bench
22Claude Sonnet 4.6 Anthropic1810EQ-Bench
23Claude Opus 4.6 Anthropic1809EQ-Bench
24Muse Glimmer 30B Meta1798EQ-Bench
25Claude Sonnet 5 Anthropic1794EQ-Bench
26GLM-5.2 Z.ai (Zhipu)1757EQ-Bench
27Gemini 3.8 Flash Google1748EQ-Bench
28Kimi K2.6 Moonshot AI1725EQ-Bench
29Gemini 3.7 Flash Google1723EQ-Bench
30GPT-5.2 OpenAI1703EQ-Bench
31Nemotron 3 Ultra NVIDIA1692EQ-Bench
32GPT-5.3 Chat OpenAI1690EQ-Bench
33Claude Opus 4.5 Anthropic1687EQ-Bench
34Claude Sonnet 4.5 Anthropic1678EQ-Bench
35o3 OpenAI1676EQ-Bench
36Qwen3.8 27B Alibaba (Qwen)1671EQ-Bench
37Kimi K2 (Jul 2025) Moonshot AI1666EQ-Bench
38GPT-5.4 mini OpenAI1665EQ-Bench
39GPT-5 OpenAI1627EQ-Bench
40Inkling Thinking Machines Lab1611EQ-Bench
41Gemini 3.6 Flash Google1604EQ-Bench
42GLM-5 Z.ai (Zhipu)1601EQ-Bench
43GLM-5.1 Z.ai (Zhipu)1592EQ-Bench
44Claude Opus 4 Anthropic1580EQ-Bench
45Grok 4.5 xAI1579EQ-Bench
46Kimi K2.5 Moonshot AI1579EQ-Bench
47Grok 4.20 (Non-Reasoning) xAI1574EQ-Bench
48DeepSeek V4 Flash DeepSeek1559EQ-Bench
49Gemini 3.5 Flash Lite Google1559EQ-Bench
50DeepSeek V4 Pro DeepSeek1553EQ-Bench
51DeepSeek V4.1 Flash DeepSeek1540EQ-Bench
52Gemini 3 Pro Google1525EQ-Bench
53DeepSeek-V3.2-Exp DeepSeek1515EQ-Bench
54Chatgpt 4o Latest 20250326 OpenAI1501EQ-Bench
55DeepSeek-R1 DeepSeek1500EQ-Bench
56MiMo-V2.5-Pro Xiaomi1493EQ-Bench
57Inkling-Small Thinking Machines Lab1491EQ-Bench
58Gemini 3.1 Pro Preview Google1491EQ-Bench
59Claude Sonnet 4 Anthropic1483EQ-Bench
60Qwen3.5 397B-A17B Alibaba (Qwen)1478EQ-Bench
61Mistral Medium 3.1 Mistral AI1476EQ-Bench
62DeepSeek-V3 DeepSeek1472EQ-Bench
63Claude 3.5 Sonnet Anthropic1451EQ-Bench
64DeepSeek-V3.1 DeepSeek1436EQ-Bench
65Gemini 2.5 Pro Google1421EQ-Bench
66Hermes 4 405B Nous Research1421EQ-Bench
67GPT-4.1 OpenAI1420EQ-Bench
68GLM-4.7 Z.ai (Zhipu)1413EQ-Bench
69Mistral Large 3 Mistral AI1412EQ-Bench
70Claude 3.7 Sonnet Anthropic1412EQ-Bench
71GLM-4.6 Z.ai (Zhipu)1411EQ-Bench
72Gemma 4 31B IT Google1368EQ-Bench
73Qwen3 235B-A22B Alibaba (Qwen)1366EQ-Bench
74MiniMax-M2.5 MiniMax1361EQ-Bench
75GLM-4.5 Z.ai (Zhipu)1343EQ-Bench
76Grok 4.1 Fast xAI1327EQ-Bench
77GPT-5 Mini OpenAI1313EQ-Bench
78Gemma 4 26B A4B IT Google1305EQ-Bench
79Nemotron 3.5 Lightning NVIDIA1280EQ-Bench
80DeepSeek-V3.2-Speciale DeepSeek1276EQ-Bench
81Gemma 3 27B Google1266EQ-Bench
82GPT-4.5 OpenAI1258EQ-Bench
83QwQ-32B Alibaba (Qwen)1257EQ-Bench
84Mistral Small 3.2 Mistral AI1255EQ-Bench
85Reka Flash 3 Reka1228EQ-Bench
86Grok 3 xAI1186EQ-Bench
87GPT-4.1 mini OpenAI1147EQ-Bench
88Claude 3.5 Haiku Anthropic1146EQ-Bench
89Command A Cohere1145EQ-Bench
90Gemini 2.5 Flash Google1137EQ-Bench
91Gemini 2.0 Flash (Feb 2025) Google1128EQ-Bench
92Gemma 3 12B Google1126EQ-Bench
93GLM-4.7-Flash Z.ai (Zhipu)1125EQ-Bench
94Gemma 3 4B Google1068EQ-Bench
95Pixtral Large Mistral AI988EQ-Bench
96Mistral Large Mistral AI985EQ-Bench
97gpt-oss-120b OpenAI961EQ-Bench
98GPT-4.1 nano OpenAI946EQ-Bench
99Mistral Nemo Mistral AI881EQ-Bench
100GPT-4o mini OpenAI873EQ-Bench
101Llama 3.1-405B Meta870EQ-Bench
102Llama 4 Maverick Meta860EQ-Bench
103Gemma 2 9B Google841EQ-Bench
104Llama 3.1-70B Meta784EQ-Bench
105Llama 4 Scout Meta783EQ-Bench
106Mistral Small 3.1 Mistral AI761EQ-Bench
107GPT-4 OpenAI752EQ-Bench
108Claude 3 Haiku Anthropic717EQ-Bench
109Llama 3.1-8B Meta713EQ-Bench
110Mistral Small 3 Mistral AI707EQ-Bench
111GPT-5 Nano OpenAI705EQ-Bench
112gpt-oss-20b OpenAI666EQ-Bench
113Llama 3.2 3B Meta595EQ-Bench
114GPT-3.5-turbo OpenAI451EQ-Bench
115Llama 3.2 1B Meta200EQ-Bench

Compare the leaders

Other writing & preference benchmarks

Frequently asked questions

What does EQ-Bench Creative Writing measure?

Elo ratings from pairwise comparisons of short stories written to creative prompts, judged by an LLM against a detailed rubric (v3).

Which model has the highest EQ-Bench Creative Writing score?

As of October 2026, GPT-6 Astra has the highest published EQ-Bench Creative Writing score on Noometry at 2173, out of 115 models with results.

What is the best open-weight model on EQ-Bench Creative Writing?

Kimi K3 has the highest EQ-Bench Creative Writing rating among open-weight models at 2082, ranking 5 of 115 overall.