Adverb-first sentence starts

Test: Bad Writing Habits

Avg. Score
55.5%
Scenarios
18

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1Writer: Palmyra X594.5%$0.01122.0s64%
2Qwen3 235B A22B Instruct 250790.8%$0.001159.2s56%
3Mistral Small 4 (Reasoning)86.4%$0.002230.2s54%
4Mistral Medium 3.183.9%$0.004836.5s51%
5GPT-5.4 Mini85.2%$0.01516.8s49%
6Ministral 3 14B81.0%$0.000711.7s43%
7GPT-5.4 Mini (Reasoning, Low)79.5%$0.01516.8s45%
8GPT-5.4 Nano76.8%$0.005726.3s44%
9GPT-5.4 Nano (Reasoning, Low)76.7%$0.005520.6s42%
10GPT-5.487.5%$0.0491.4m58%
11GPT-5.4 Mini (Reasoning)79.2%$0.02228.1s42%
12Mistral Small 476.4%$0.001418.2s34%
13GPT-5.4 (Reasoning, Low)86.9%$0.0551.4m54%
14Mistral Large 377.9%$0.003330.3s33%
15GPT-5.6 Luna (Reasoning)74.6%$0.01718.0s36%
16GPT-5.6 Luna73.8%$0.01515.8s35%
17Mistral Large 278.0%$0.01329.4s33%
18GPT-5.4 Nano (Reasoning)70.5%$0.006124.5s32%
19Gemma 3 4B71.3%$0.000220.0s28%
20GPT-4.1 Nano71.8%$0.000713.3s26%
21GPT-5.6 Terra75.9%$0.04636.9s38%
22Grok 4.2072.5%$0.009345.7s31%
23GPT-5.6 Terra (Reasoning)75.3%$0.04435.2s36%
24Ministral 8B70.1%$0.000410.4s22%
25Ministral 3 8B69.8%$0.000819.6s22%
26Gemma 3 27B67.9%$0.000652.6s25%
27MiniMax M2.569.8%$0.00341.3m25%
28Claude Haiku 4.564.8%$0.01121.6s20%
29Z.AI GLM 569.5%$0.00841.2m24%
30Claude Sonnet 4.571.0%$0.03538.1s26%
31Z.AI GLM 5 Turbo65.3%$0.008133.2s21%
32MoonshotAI: Kimi K3 (Reasoning, Low)72.1%$0.0281.1m27%
33Claude Sonnet 5 (Reasoning, Low)73.4%$0.03138.4s23%
34Gemini 2.5 Flash Lite (Reasoning)58.0%$0.002830.8s23%
35Muse Spark 1.1 (Reasoning, Minimal)61.9%$0.01219.2s21%
36Gemma 3 12B65.3%$0.000441.3s18%
37Z.AI GLM 5.2 (Reasoning, High)67.3%$0.0111.0m22%
38Grok 4.20 (Reasoning)67.9%$0.0181.5m28%
39Ministral 3 3B60.5%$0.000511.1s15%
40Ministral 3B61.2%$0.00018.1s13%
41MiniMax M2.765.6%$0.00401.1m20%
42DeepSeek V4 Flash (Reasoning)59.4%$0.000731.1s16%
43DeepSeek V3 (2025-03-24)63.3%$0.001439.4s14%
44Claude Opus 4.772.6%$0.06930.4s26%
45Laguna S 2.159.7%$0.000522.1s13%
46Laguna XS 2.156.5%$0.000314.4s12%
47DeepSeek V4 Flash55.0%$0.000631.6s16%
48Xiaomi MIMO v2.553.1%$0.005431.8s19%
49Grok 4.5 (Reasoning, Low)64.9%$0.0181.1m19%
50Gemini 2.5 Flash Lite54.3%$0.00099.5s12%
51GPT-5.4 (Reasoning)79.8%$0.0892.6m44%
52GPT-4.159.6%$0.01844.7s18%
53Z.AI GLM 5.163.6%$0.0141.5m22%
54ByteDance Seed 1.6 Flash53.3%$0.001327.3s14%
55Claude Sonnet 566.5%$0.02733.5s14%
56Grok 4.5 (Reasoning, High)69.5%$0.0301.6m23%
57GPT-5.5 (Reasoning, Low)82.2%$0.1391.8m49%
58o4 Mini53.5%$0.01525.7s17%
59Xiaomi MIMO v2.5 Pro59.2%$0.008553.5s16%
60GPT-5.169.8%$0.0541.8m31%
61Qwen 3 32B57.3%$0.001554.6s15%
62o4 Mini High57.3%$0.02547.2s20%
63Gemini 2.5 Flash52.2%$0.005210.6s10%
64Aion 3.0 Mini58.2%$0.00531.2m15%
65GPT-5 Nano55.1%$0.00421.4m18%
66Aion 3.058.8%$0.0241.0m18%
67Mistral NeMO50.3%$0.000510.1s8%
68Claude Sonnet 4.6 (Reasoning)67.0%$0.0601.2m24%
69Cydonia 24B V4.154.6%$0.001444.8s11%
70Claude Opus 4.7 (Reasoning)68.0%$0.07632.0s22%
71DeepSeek-V2 Chat56.8%$0.002153.3s10%
72Qwen 3.6 Flash50.8%$0.01041.4s15%
73MoonshotAI: Kimi K3 (Reasoning, High)68.2%$0.0441.8m24%
74Claude Sonnet 5 (Reasoning)63.0%$0.03038.9s12%
75GPT-4.1 Mini49.8%$0.002719.0s10%
76Gemini 2.5 Flash (Reasoning)51.4%$0.01121.5s11%
77MiniMax M368.2%$0.00603.1m25%
78GPT-5.578.7%$0.1391.7m44%
79Claude Opus 4.8 (Reasoning, Low)67.9%$0.07141.9s21%
80Z.AI GLM 4.7 Flash50.4%$0.00171.2m17%
81Claude Opus 5 (Reasoning)71.3%$0.0981.0m29%
82GPT-4o, Aug. 6th (temp=1)54.9%$0.01824.4s10%
83Muse Spark 1.1 (Reasoning, Medium)50.9%$0.01523.9s11%
84DeepSeek V4 Pro54.1%$0.00481.3m14%
85GPT-4o Mini (temp=1)50.4%$0.001234.8s9%
86GPT-5.5 (Reasoning)78.2%$0.1421.8m44%
87Gemini 3.5 Flash (Reasoning, Minimal)50.3%$0.01812.0s10%
88Qwen 3.5 Plus (2026-02-15)45.0%$0.006031.5s12%
89Claude Sonnet 454.7%$0.03243.7s15%
90Gemini 3 Flash (Preview)41.4%$0.007819.6s12%
91Gemini 3.1 Flash Lite (Preview)36.7%$0.00308.4s12%
92Claude Opus 4.8 (Reasoning)63.5%$0.07141.7s19%
93Claude Opus 567.4%$0.08250.1s20%
94Z.AI GLM 4.648.7%$0.006551.5s11%
95DeepSeek V3 (2024-12-26)50.8%$0.002154.6s8%
96Gemma 4 26B43.2%$0.000955.1s13%
97Claude Opus 4.563.6%$0.07053.4s19%
98Claude Opus 4.665.2%$0.0781.2m24%
99Hermes 3 70B53.2%$0.00101.2m9%
100Thinking Machines Inkling57.2%$0.00751.5m10%
101Gemini 3.1 Flash Lite39.5%$0.003012.1s9%
102Claude Sonnet 4.656.6%$0.03139.3s9%
103Gemini 3.1 Flash Lite (Reasoning)36.6%$0.003011.9s10%
104Qwen 3.6 35B47.0%$0.00831.0m12%
105Qwen 3.5 Flash36.6%$0.002547.5s14%
106Gemini 3.5 Flash Lite (Reasoning)43.9%$0.00356.6s2%
107Gemini 3.6 Flash (Reasoning, Minimal)36.7%$0.01714.3s12%
108GPT-5.259.9%$0.0561.5m20%
109Grok 4.339.2%$0.006930.5s9%
110Aion 2.046.1%$0.00641.3m11%
111Gemini 3 Flash (Preview, Reasoning)39.6%$0.01230.1s10%
112Hermes 3 405B43.6%$0.003253.2s8%
113DeepSeek V3.250.1%$0.00141.9m12%
114Claude Opus 5 (Reasoning, Low)65.1%$0.0971.0m21%
115Gemini 3.5 Flash Lite (Reasoning, Minimal)41.4%$0.00356.3s0%
116DeepSeek V4 Pro (Reasoning)62.0%$0.0153.1m18%
117Z.AI GLM 4.538.7%$0.005142.1s8%
118Z.AI GLM 4.744.2%$0.0101.4m12%
119Z.AI GLM 4.5 Air40.7%$0.002958.2s7%
120Gemini 2.5 Pro48.0%$0.03636.2s9%
121Claude Opus 4.6 (Reasoning)62.8%$0.0881.4m21%
122GPT-5 Mini39.9%$0.010057.4s10%
123Qwen 3.5 397B A17B54.6%$0.0143.0m20%
124Gemma 4 26B (Reasoning)47.1%$0.00132.0m11%
125Cohere Command R+ (Aug. 2024)42.4%$0.02052.5s8%
126Qwen 3.5 35B36.5%$0.0181.0m13%
127GPT-5.6 Sol61.8%$0.1051.2m22%
128Arcee AI: Trinity Mini33.6%$0.00039.2s0%
129Nemotron 3 Super36.7%$0.00001.4m10%
130GPT-5.6 Sol (Reasoning)62.9%$0.1081.2m22%
131DeepSeek V3.143.2%$0.00201.8m10%
132WizardLM 2 8x22b42.8%$0.00261.8m9%
133Qwen 3.5 122B33.5%$0.0251.1m13%
134Gemma 4 31B36.3%$0.00101.6m8%
135Qwen 3.5 Plus (2026-04-20)41.7%$0.0171.8m10%
136Gemini 3.5 Flash (Reasoning)44.2%$0.07137.6s10%
137Llama 3.1 70B26.1%$0.001529.4s0%
138GPT-4o Mini (temp=0)25.8%$0.001234.8s0%
139Qwen 2.5 72B25.0%$0.001036.7s0%
140Thinking Machines Inkling (Reasoning)68.1%$0.0255.1m21%
141Gemma 4 31B (Reasoning)30.0%$0.00142.2m10%
142MoonshotAI: Kimi K2.547.1%$0.0193.2m10%
143GPT-4o, Aug. 6th (temp=0)23.1%$0.02322.7s0%
144Qwen 3.5 27B24.4%$0.0201.6m10%
145Qwen 3.6 27B39.0%$0.0252.3m8%
146Qwen 3.5 9B23.3%$0.00111.4m2%
147Gemini 3.6 Flash (Reasoning)29.2%$0.04432.5s0%
148Inception Mercury 25.0%$0.00327.0s0%
149Nemotron 3 Nano15.3%$0.00101.1m0%
150GPT-540.7%$0.0652.8m17%
151Qwen3.6 Max Preview46.5%$0.0503.5m12%
152ByteDance Seed 2.0 Lite24.7%$0.0122.2m0%
153Claude Opus 465.4%$0.2091.4m23%
154GPT-OSS 120B10.6%$0.00151.8m0%
155Grok 4.3 (Reasoning)25.5%$0.0212.3m0%
156ByteDance Seed 2.0 Mini39.5%$0.00454.9m9%
157Qwen3.7 Max32.1%$0.0682.3m7%
158ByteDance Seed 1.620.3%$0.0132.5m0%
159Gemini 3.1 Pro (Preview)28.9%$0.1071.8m7%
160MoonshotAI: Kimi K2.656.4%$0.0586.5m17%
161Mistral Small 3.2 24B19.1%$0.00695.7m0%
55.49%

Individual Scenarios

Detailed Writing Rules

Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Writer: Palmyra X5100100100100100100.0%
Claude Sonnet 4.51001001001009398.5%
Claude Sonnet 5 (Reasoning, Low)1001001001008396.7%
Claude Sonnet 4.610010098988295.7%
GPT-5.4 Mini (Reasoning, Low)1001001001007695.2%
GPT-5.41001001001006993.8%
GPT-5.4 (Reasoning)100100100907893.7%
Qwen3 235B A22B Instruct 25071001001001005090.0%
Claude Opus 51001001001004989.8%
GPT-5.4 Mini (Reasoning)100100100787089.6%
Cydonia 24B V4.11001001001004689.1%
Claude Opus 5 (Reasoning)1001001001004088.0%
GPT-5.4 (Reasoning, Low)1001001001004088.0%
GPT-5.6 Terra10010097826188.0%
Gemma 3 4B100100100884686.6%
Claude Opus 5 (Reasoning, Low)10010091874885.1%
Z.AI GLM 5100100100804084.0%
GPT-5.5 (Reasoning, Low)1009687705982.5%
Claude Opus 4.610010073726782.3%
GPT-5.4 Nano10010094724482.2%
DeepSeek V4 Flash (Reasoning)1009188814982.0%
GPT-5.4 Nano (Reasoning)100100100565482.0%
GPT-5.51009792675381.6%
GPT-5.6 Terra (Reasoning)10010079666381.6%
Grok 4.5 (Reasoning, High)100100100100080.0%
DeepSeek-V2 Chat100100100100080.0%
Claude Opus 4.7100100100524779.8%
Claude Opus 410010071646279.3%
MoonshotAI: Kimi K3 (Reasoning, Low)1009894564678.8%
WizardLM 2 8x22b10010083812878.4%
Z.AI GLM 5.2 (Reasoning, High)10010010089077.9%
GPT-4o, Aug. 6th (temp=1)10010071645177.3%
Claude Sonnet 510010010076075.2%
Hermes 3 405B10010010071074.2%
Gemini 2.5 Flash100989478073.9%
GPT-5.6 Luna (Reasoning)10010092551973.2%
Claude Sonnet 5 (Reasoning)10010010065073.1%
GPT-5.6 Luna989762555373.1%
GPT-5.4 Mini1001009860071.5%
MoonshotAI: Kimi K2.51009367494871.3%
GPT-5 Nano1009784423270.9%
Z.AI GLM 4.7 Flash10010079403570.8%
GPT-5.4 Nano (Reasoning, Low)1007166595269.7%
Mistral Small 4 (Reasoning)1009559484669.5%
DeepSeek V4 Pro (Reasoning)10010069403969.4%
DeepSeek V3 (2024-12-26)100908172068.8%
Gemma 3 12B10010010040067.9%
GPT-5.21009759433466.8%
Claude Opus 4.510010010030066.0%
MoonshotAI: Kimi K3 (Reasoning, High)1008251484565.4%
MiniMax M2.7100858556065.3%
Laguna XS 2.11001007646064.4%
Claude Opus 4.8 (Reasoning)956157545464.2%
Grok 4.5 (Reasoning, Low)1001008040064.0%
Aion 2.01001006951064.0%
GPT-5.5 (Reasoning)797258565163.6%
Gemini 3 Flash (Preview, Reasoning)787568573863.3%
Claude Sonnet 4.6 (Reasoning)100957644063.0%
Gemini 2.5 Flash Lite (Reasoning)848257434061.5%
DeepSeek V4 Flash1006152444460.1%
Thinking Machines Inkling (Reasoning)1001001000060.0%
GPT-5.1897272501659.9%
Muse Spark 1.1 (Reasoning, Medium)1008453322859.5%
Claude Opus 4.8 (Reasoning, Low)1001005245059.4%
Ministral 3B100100950059.0%
Z.AI GLM 5 Turbo1007843423358.9%
Claude Opus 4.6 (Reasoning)1009738352458.9%
MiniMax M2.5100875552058.7%
Gemini 2.5 Flash Lite100100910058.3%
Ministral 3 14B100100870057.3%
Ministral 8B100100820056.5%
Z.AI GLM 4.6100915138056.1%
Qwen 2.5 72B9988870054.7%
GPT-4.1 Nano100635654054.3%
MiniMax M3100696140053.9%
Mistral Large 391795340052.7%
Hermes 3 70B10095670052.4%
Claude Sonnet 4100655442052.2%
Cohere Command R+ (Aug. 2024)90715146051.6%
Ministral 3 8B100100570051.5%
Qwen3.6 Max Preview100745132051.2%
Gemini 2.5 Flash (Reasoning)100823734050.7%
Claude Opus 4.7 (Reasoning)100100520050.4%
Aion 3.0 Mini100100510050.3%
GPT-5.6 Sol936141371849.9%
Z.AI GLM 5.110079690049.6%
GPT-5.6 Sol (Reasoning)755247452849.4%
Aion 3.0100100470049.4%
Qwen 3.5 397B A17B100745514048.8%
Gemini 2.5 Pro94724229047.6%
DeepSeek V3 (2025-03-24)10088490047.3%
Qwen 3 32B93494645046.6%
Mistral Large 2100100320046.5%
GPT-4.1 Mini85504946046.0%
Claude Haiku 4.510079510046.0%
Muse Spark 1.1 (Reasoning, Minimal)85674333045.7%
GPT-4.198663231045.5%
Gemma 4 26B80693938045.3%
Mistral Small 3.2 24B10080460045.3%
MoonshotAI: Kimi K2.6100573730044.8%
Mistral NeMO74674433043.4%
Qwen 3.6 35B10066510043.4%
Z.AI GLM 4.5 Air81673533043.3%
Mistral Small 410078380043.1%
Grok 4.3 (Reasoning)65605035041.9%
Gemma 3 27B79464340041.7%
ByteDance Seed 2.0 Mini10062460041.5%
Gemini 3 Flash (Preview)67614729040.8%
Qwen3.7 Max74573931040.4%
Gemini 3.5 Flash Lite (Reasoning)10010000040.0%
GPT-4o Mini (temp=1)1009700039.3%
Xiaomi MIMO v2.510069260039.0%
DeepSeek V3.269653328038.9%
Qwen 3.5 Plus (2026-04-20)654644221738.8%
Mistral Medium 3.1613934322538.1%
o4 Mini High78444322037.3%
Laguna S 2.16462610037.3%
Gemini 3.6 Flash (Reasoning, Minimal)49474640036.5%
Gemini 3.1 Flash Lite10044370036.4%
Grok 4.20664725232036.1%
Grok 4.39343360034.4%
Z.AI GLM 4.770413228034.3%
Xiaomi MIMO v2.5 Pro10043270034.0%
ByteDance Seed 2.0 Lite1006800033.6%
o4 Mini48454231033.4%
Qwen 3.6 27B10042250033.4%
Qwen 3.5 Plus (2026-02-15)65353231032.7%
ByteDance Seed 1.6 Flash6655350031.3%
GPT-5 Mini89232320031.0%
Nemotron 3 Super4644400026.1%
DeepSeek V4 Pro854300025.6%
Qwen 3.6 Flash4844340025.1%
Grok 4.20 (Reasoning)5939260024.8%
GPT-557282114024.0%
Qwen 3.5 Flash45341916022.7%
GPT-4o, Aug. 6th (temp=0)634700022.0%
Gemma 4 26B (Reasoning)525000020.4%
Gemini 3.5 Flash (Reasoning)100000020.0%
Gemini 3.5 Flash (Reasoning, Minimal)100000020.0%
Ministral 3 3B100000020.0%
Qwen 3.5 122B4131260019.6%
Qwen 3.5 27B4725190018.2%
Gemini 3.1 Flash Lite (Preview)484300018.2%
Qwen 3.5 35B4825180018.2%
ByteDance Seed 1.690000018.0%
GPT-4o Mini (temp=0)434100016.8%
Llama 3.1 70B74000014.8%
Arcee AI: Trinity Mini72000014.5%
DeepSeek V3.1373300014.1%
GPT-OSS 120B472300014.0%
Thinking Machines Inkling60000011.9%
Gemma 4 31B (Reasoning)56000011.3%
Gemma 4 31B54000010.8%
Gemini 3.1 Pro (Preview)312200010.6%
Z.AI GLM 4.54300008.7%
Nemotron 3 Nano2100004.1%
Qwen 3.5 9B1700003.4%
Gemini 3.6 Flash (Reasoning)000000.0%
Gemini 3.1 Flash Lite (Reasoning)000000.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)000000.0%
Inception Mercury 2000000.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
GPT-5.4 (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Thinking Machines Inkling (Reasoning)100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100.0%
Claude Opus 4.5100100100100100100.0%
Z.AI GLM 5100100100100100100.0%
Claude Sonnet 5100100100100100100.0%
Mistral Large 3100100100100100100.0%
Aion 3.0 Mini100100100100100100.0%
GPT-5.4 Mini (Reasoning, Low)100100100100100100.0%
Claude Haiku 4.5100100100100100100.0%
DeepSeek V3.2100100100100100100.0%
Mistral Large 2100100100100100100.0%
Writer: Palmyra X5100100100100100100.0%
Qwen3 235B A22B Instruct 2507100100100100100100.0%
Gemma 3 27B100100100100100100.0%
Gemma 3 4B100100100100100100.0%
Ministral 8B100100100100100100.0%
Z.AI GLM 4.5 Air100100100999598.8%
GPT-4o Mini (temp=1)1001001001009198.3%
Gemma 3 12B1001001001008997.9%
GPT-5.5 (Reasoning, Low)1001001001008997.8%
Mistral Small 4 (Reasoning)1001001001008697.2%
Grok 4.201001001001008596.9%
GPT-5.4 Mini1001001001008496.8%
Gemini 2.5 Flash1001001001008396.5%
Claude Opus 5 (Reasoning, Low)1001001001008196.3%
GPT-4.1 Nano1001001001008196.3%
GPT-5.4 Nano (Reasoning, Low)100100100998095.8%
MoonshotAI: Kimi K2.6100100100958395.7%
MiniMax M2.71001001001007895.5%
Ministral 3 14B1001001001007795.3%
GPT-5.41001001001007695.2%
Z.AI GLM 4.71001001001007595.0%
GPT-5.4 Nano1001001001007194.1%
GPT-5.4 Mini (Reasoning)1001001001007094.0%
Muse Spark 1.1 (Reasoning, Minimal)1001001001006993.9%
GPT-5.5 (Reasoning)100100100987093.7%
Mistral Medium 3.11001001001006893.6%
Ministral 3 3B1001001001006793.3%
GPT-5.6 Luna (Reasoning)1001001001006492.8%
WizardLM 2 8x22b100100100917192.3%
GPT-5.6 Luna100100100877492.2%
GPT-4.1 Mini100100100808092.1%
GPT-5.5100100100906490.7%
GPT-5.6 Terra100100100926290.7%
GPT-5.6 Sol1001001001005090.0%
Aion 2.0100100100806989.8%
Claude Sonnet 4.5100100100816789.7%
Z.AI GLM 4.51001001001004889.5%
Grok 4.5 (Reasoning, High)100100100786989.4%
Claude Sonnet 41001001001004789.4%
DeepSeek V4 Flash (Reasoning)100100100747289.3%
GPT-4o, Aug. 6th (temp=1)1001001001004689.3%
DeepSeek-V2 Chat100100100885889.2%
GPT-5.6 Terra (Reasoning)1009996876389.0%
Claude Opus 4100100100816288.7%
Gemini 2.5 Flash Lite (Reasoning)100100100836088.6%
GPT-5.4 Nano (Reasoning)10010092777288.3%
Claude Opus 5 (Reasoning)10010096796588.2%
Z.AI GLM 4.61001001001003887.7%
GPT-5 Nano100100100706887.5%
Claude Opus 4.710010082787587.1%
Claude Opus 51001001001003587.1%
DeepSeek V4 Pro1001001001003486.8%
Claude Opus 4.8 (Reasoning)100100100943886.4%
DeepSeek V4 Pro (Reasoning)100100100933585.6%
Grok 4.20 (Reasoning)100100100785085.5%
Claude Sonnet 4.6100100100784684.9%
DeepSeek V3 (2024-12-26)100100100715384.8%
Claude Opus 4.7 (Reasoning)100100100784183.6%
GPT-5.110010090676083.6%
Gemini 2.5 Flash Lite10010098853283.1%
Qwen3.6 Max Preview1009087845482.9%
Xiaomi MIMO v2.5 Pro10010097724181.8%
Z.AI GLM 5 Turbo100100100674081.5%
Qwen 3.5 Plus (2026-04-20)1009986764581.4%
Gemini 2.5 Pro100100100703380.7%
GPT-5.2979083746080.5%
Qwen 3.6 35B10010088644880.2%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100100080.0%
Nemotron 3 Super100100100100080.0%
Mistral Small 4100100100100080.0%
Mistral NeMO100100100100080.0%
Ministral 3 8B10010083694579.6%
GPT-5.6 Sol (Reasoning)10010093614479.5%
Arcee AI: Trinity Mini1009583783878.9%
Laguna S 2.110010079635178.7%
Gemma 4 26B10010084753478.5%
Gemma 4 31B1009382724378.1%
MoonshotAI: Kimi K3 (Reasoning, Low)10010010090078.0%
Hermes 3 70B10010010090078.0%
Qwen 3.6 27B10010096811378.0%
Aion 3.010010086683377.5%
o4 Mini1008873655977.1%
MoonshotAI: Kimi K3 (Reasoning, High)10010010084076.8%
Gemini 3.1 Flash Lite (Preview)1008876685176.6%
Gemini 3.5 Flash (Reasoning)10010087662976.3%
GPT-4.11009086693475.9%
ByteDance Seed 1.6 Flash10010083613175.0%
ByteDance Seed 2.0 Mini10010060575674.5%
DeepSeek V3 (2025-03-24)10010010067073.3%
MiniMax M2.510010094383473.2%
Gemini 2.5 Flash (Reasoning)10010010065072.9%
MiniMax M3100100100372672.8%
Grok 4.31001008574072.0%
Z.AI GLM 5.2 (Reasoning, High)1001009662071.6%
Z.AI GLM 5.110010010056071.3%
Qwen 3.5 Plus (2026-02-15)1008577563771.2%
Cohere Command R+ (Aug. 2024)10010057534571.1%
Ministral 3B1001008569071.0%
Gemini 3.1 Pro (Preview)1008771682870.8%
Laguna XS 2.11009753515170.3%
DeepSeek V4 Flash1007873484669.0%
Thinking Machines Inkling1001009055068.9%
Qwen 3.5 397B A17B1008766464468.7%
Z.AI GLM 4.7 Flash1008769473266.9%
GPT-51007165504766.5%
Cydonia 24B V4.11001007556066.2%
Claude Opus 4.6 (Reasoning)10010010029065.7%
Qwen 3 32B1008569511864.7%
Claude Opus 4.6100948246064.4%
Qwen 3.5 35B988059523264.2%
Gemini 3.5 Flash (Reasoning, Minimal)1001006450062.8%
Claude Sonnet 4.6 (Reasoning)1001007637062.5%
DeepSeek V3.11001007929061.5%
Gemma 4 26B (Reasoning)10010038362860.5%
Gemini 3.5 Flash Lite (Reasoning)1001001000060.0%
o4 Mini High1001007718059.0%
Gemma 4 31B (Reasoning)100787240058.0%
Hermes 3 405B100100880057.5%
Gemini 3.6 Flash (Reasoning, Minimal)1001004738057.1%
Muse Spark 1.1 (Reasoning, Medium)1001005028055.6%
GPT-OSS 120B77727155054.8%
Xiaomi MIMO v2.5816554462153.5%
GPT-4o Mini (temp=0)100814341053.0%
Qwen 3.6 Flash1006649262152.3%
MoonshotAI: Kimi K2.5100774137051.0%
Gemini 3 Flash (Preview)100626028050.1%
Gemini 3.1 Flash Lite100554338047.1%
Qwen 3.5 122B100594333047.0%
Gemini 3 Flash (Preview, Reasoning)100100290045.7%
Qwen 3.5 Flash79752322040.0%
GPT-4o, Aug. 6th (temp=0)9356425039.0%
GPT-5 Mini504839242236.6%
ByteDance Seed 1.66261600036.4%
Gemini 3.6 Flash (Reasoning)1007800035.5%
Qwen3.7 Max7057490035.3%
Qwen 2.5 72B1006100032.2%
Llama 3.1 70B8848170030.5%
Gemini 3.1 Flash Lite (Reasoning)736900028.5%
Grok 4.3 (Reasoning)1003200026.4%
Qwen 3.5 9B47292617023.9%
Qwen 3.5 27B7124150022.0%
Inception Mercury 2424100016.7%
Mistral Small 3.2 24B651241016.4%
ByteDance Seed 2.0 Lite51000010.3%
Nemotron 3 Nano3300006.5%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Writer: Palmyra X5100100100100100100.0%
Qwen3 235B A22B Instruct 2507100100100100100100.0%
Ministral 3 8B1001001001009899.6%
Mistral Small 41001001001009398.6%
Mistral Large 31001001001009298.3%
Mistral Large 21001001001008597.1%
Claude Haiku 4.5100100100838293.1%
Claude Sonnet 4.6 (Reasoning)100100100838192.9%
Mistral Small 4 (Reasoning)1001001001006091.9%
Cydonia 24B V4.1100100100975389.9%
Ministral 8B1001001001004889.7%
Claude Opus 4.71001001001004889.7%
Gemma 3 27B10010098777289.4%
Qwen 3 32B1001001001004488.8%
DeepSeek V4 Pro (Reasoning)100100100944086.8%
GPT-5 Nano100100100765786.6%
Ministral 3 14B10010098854385.2%
Thinking Machines Inkling (Reasoning)100100100605883.6%
Claude Opus 5 (Reasoning)100100100605182.0%
MiniMax M2.710010091704380.8%
Gemma 3 4B100100100100080.0%
GPT-5.6 Terra (Reasoning)100100100533377.2%
GPT-4.11008972705477.1%
GPT-5.4 Nano1009867635776.9%
Claude Opus 410010080752676.3%
Mistral Medium 3.110010071634676.0%
GPT-5.41007270706675.6%
Claude Opus 4.7 (Reasoning)1007972695575.2%
MiniMax M2.510010081514074.5%
Xiaomi MIMO v2.5 Pro10010098383674.4%
Claude Opus 5 (Reasoning, Low)10010010071074.2%
Claude Opus 4.8 (Reasoning, Low)1007669685673.9%
GPT-5.51007571655773.6%
Claude Opus 4.8 (Reasoning)10010010065073.0%
GPT-5.6 Luna (Reasoning)787675686872.8%
MoonshotAI: Kimi K3 (Reasoning, Low)10010010064072.8%
MoonshotAI: Kimi K3 (Reasoning, High)10010010063072.6%
Hermes 3 70B10010010058071.7%
Ministral 3B10010010058071.7%
DeepSeek V3.210010065593471.6%
DeepSeek-V2 Chat10010010052070.4%
GPT-5.5 (Reasoning, Low)1009553534969.9%
GPT-4.1 Nano10010010049069.8%
GPT-5.4 Nano (Reasoning)10010075373368.9%
GPT-5.21007861574167.3%
o4 Mini High1007362574266.9%
Z.AI GLM 51007366563766.3%
GPT-5.4 (Reasoning, Low)10010060482366.1%
Claude Sonnet 4.510010061353165.3%
Claude Opus 51001006462065.2%
Claude Opus 4.5100978840064.8%
Gemini 2.5 Flash (Reasoning)1001008438064.5%
Qwen 3.5 397B A17B928173492463.9%
GPT-5.4 Nano (Reasoning, Low)847473454163.6%
o4 Mini1006863563063.5%
Grok 4.20 (Reasoning)10010047432763.5%
Muse Spark 1.1 (Reasoning, Minimal)100938439063.2%
GPT-5.4 Mini (Reasoning)1008852472862.9%
GPT-5.5 (Reasoning)1007967383062.9%
Thinking Machines Inkling1001006744062.1%
Claude Opus 4.6100938330061.2%
Ministral 3 3B1001005142158.9%
Gemini 2.5 Flash Lite (Reasoning)99816251058.6%
Z.AI GLM 5.2 (Reasoning, High)100975339057.9%
GPT-510010031292857.7%
Claude Sonnet 4.61005348444357.7%
Z.AI GLM 5.1100777337057.4%
GPT-5.6 Terra1005851492656.5%
Claude Sonnet 5100100810056.3%
DeepSeek V4 Flash100100810056.3%
GPT-5.4 Mini1001005326055.9%
DeepSeek V4 Pro1001004040055.9%
DeepSeek V3 (2025-03-24)100100740054.8%
Claude Sonnet 4100884343054.7%
Gemini 3.5 Flash Lite (Reasoning)100100720054.5%
ByteDance Seed 2.0 Lite10088710051.7%
Claude Sonnet 5 (Reasoning, Low)10090680051.6%
WizardLM 2 8x22b100933232051.3%
Aion 3.0 Mini100675535051.2%
Gemini 3.6 Flash (Reasoning, Minimal)10078720050.0%
Z.AI GLM 4.7726842353250.0%
GPT-5 Mini686845412549.5%
GPT-5.4 (Reasoning)100814223049.3%
Gemma 3 12B100100460049.3%
Grok 4.2074686140048.7%
Grok 4.5 (Reasoning, Low)100525041048.6%
GPT-5.6 Sol (Reasoning)887240201948.1%
MiniMax M382784634048.0%
ByteDance Seed 1.6 Flash100783224047.0%
GPT-5.6 Luna785454262447.0%
Cohere Command R+ (Aug. 2024)9083610046.8%
Gemini 2.5 Pro10084440045.7%
Z.AI GLM 4.677625535045.6%
Aion 3.010089370045.2%
Qwen 3.5 Plus (2026-04-20)725241342745.0%
DeepSeek V4 Flash (Reasoning)10080390043.8%
GPT-4o, Aug. 6th (temp=1)10064530043.4%
GPT-5.6 Sol935822222143.2%
Laguna XS 2.110057560042.6%
GPT-5.181723029042.3%
ByteDance Seed 2.0 Mini10057530042.1%
GPT-5.4 Mini (Reasoning, Low)744728262540.0%
Llama 3.1 70B10010000040.0%
Qwen 3.5 Flash75534525039.7%
Aion 2.08572350038.5%
GPT-4o Mini (temp=1)1009300038.5%
Gemini 2.5 Flash10049370037.3%
Z.AI GLM 5 Turbo8356460037.1%
Qwen 3.5 122B100362919036.9%
Claude Sonnet 5 (Reasoning)938800036.1%
Xiaomi MIMO v2.563443930035.2%
ByteDance Seed 1.6957200033.5%
Muse Spark 1.1 (Reasoning, Medium)10031310032.5%
Gemini 3.1 Flash Lite1006200032.3%
Laguna S 2.15751500031.7%
Qwen3.6 Max Preview94232121031.7%
DeepSeek V3.19731310031.6%
Qwen 3.6 Flash10039190031.6%
Mistral NeMO1005600031.1%
Hermes 3 405B1005500031.0%
MoonshotAI: Kimi K2.5896300030.4%
Z.AI GLM 4.5 Air1004700029.4%
Qwen 3.5 27B8135270028.6%
Grok 4.5 (Reasoning, High)934600027.7%
Gemini 2.5 Flash Lite954200027.4%
GPT-4.1 Mini766100027.3%
MoonshotAI: Kimi K2.65345340026.5%
Gemma 4 31B (Reasoning)625500023.3%
Claude Opus 4.6 (Reasoning)684500022.6%
Gemini 3.1 Flash Lite (Preview)565300021.9%
Qwen 3.5 Plus (2026-02-15)763300021.8%
Gemini 3 Flash (Preview)3835340021.3%
Nemotron 3 Super693600021.1%
Z.AI GLM 4.7 Flash4131300020.5%
Qwen 3.5 35B4923218020.4%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100000020.0%
Qwen 3.6 27B4526250019.2%
Gemma 4 26B484400018.6%
Nemotron 3 Nano542800016.3%
Qwen 3.6 35B393050014.7%
Qwen 3.5 9B332960013.7%
Gemini 3.1 Pro (Preview)353200013.5%
Gemini 3.6 Flash (Reasoning)56000011.3%
Qwen 2.5 72B53000010.6%
Mistral Small 3.2 24B50110010.5%
Gemma 4 31B4900009.8%
DeepSeek V3 (2024-12-26)4800009.5%
Z.AI GLM 4.54600009.3%
Qwen3.7 Max4600009.1%
Gemma 4 26B (Reasoning)4500009.0%
Arcee AI: Trinity Mini4200008.4%
GPT-OSS 120B4000008.0%
GPT-4o Mini (temp=0)3600007.2%
Gemini 3 Flash (Preview, Reasoning)3400006.9%
Gemini 3.5 Flash (Reasoning)000000.0%
Grok 4.3 (Reasoning)000000.0%
Gemini 3.1 Flash Lite (Reasoning)000000.0%
Gemini 3.5 Flash (Reasoning, Minimal)000000.0%
GPT-4o, Aug. 6th (temp=0)000000.0%
Inception Mercury 2000000.0%
Grok 4.3000000.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Writer: Palmyra X5100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)10010010010010099.9%
Qwen3 235B A22B Instruct 25071001001001009198.3%
MiniMax M3100100100946291.1%
Mistral Large 310010091867490.3%
Claude Sonnet 5 (Reasoning, Low)100100100856289.4%
GPT-5.4 (Reasoning, Low)100100100984288.1%
Claude Sonnet 4.51001001001003987.8%
Mistral Medium 3.1100100100972784.8%
GPT-5.6 Luna10010085706383.5%
Claude Opus 4.8 (Reasoning)10010083804982.5%
Mistral Small 4 (Reasoning)1009382815682.4%
Cydonia 24B V4.1100100100100080.0%
Ministral 3 3B10010010093078.5%
Ministral 3 14B10010010091078.3%
GPT-5.410010074664276.6%
Gemma 4 26B (Reasoning)100979787076.0%
Ministral 3B10010010065073.1%
Claude Opus 41009370494070.6%
Qwen 3.6 35B1009564474369.8%
GPT-5.4 Mini (Reasoning, Low)1007675702769.8%
MiniMax M2.510010010048069.5%
GPT-5.4 Nano787769675569.2%
Aion 3.0 Mini10010010046069.1%
Claude Opus 4.7 (Reasoning)10010010043068.7%
Gemini 2.5 Flash Lite1001007863068.3%
Gemini 2.5 Flash1001009443067.3%
MiniMax M2.710010010037067.3%
Z.AI GLM 4.71006968653367.1%
GPT-5.4 Nano (Reasoning, Low)757471674766.8%
Ministral 3 8B1001009140066.3%
Thinking Machines Inkling (Reasoning)787667625066.3%
Z.AI GLM 5.11001009138065.8%
Qwen 3 32B1007261603565.3%
GPT-5.4 Mini (Reasoning)1008666472665.1%
Gemma 3 4B100958346065.0%
Z.AI GLM 5888276413464.1%
Mistral Small 410010054343163.8%
Qwen 3.5 397B A17B1001008136063.3%
GPT-5.1977460434162.9%
GPT-5.4 Mini1006664602462.9%
Mistral Large 21001007440062.8%
Grok 4.5 (Reasoning, Low)100906360062.5%
Gemini 2.5 Flash Lite (Reasoning)100906359062.4%
GPT-5.4 (Reasoning)1001006346061.8%
Gemma 3 27B1008243434061.7%
GPT-5.5 (Reasoning)897465413760.9%
Claude Sonnet 5 (Reasoning)1001001000060.0%
Ministral 8B1001001000060.0%
GPT-5.6 Terra100726460059.2%
Gemini 3.1 Flash Lite (Preview)1001005140058.3%
Qwen 3.6 Flash97958316058.1%
Grok 4.5 (Reasoning, High)100100890057.8%
Z.AI GLM 4.5 Air100100890057.8%
Claude Sonnet 4.6 (Reasoning)878045393757.6%
DeepSeek V3 (2025-03-24)100100880057.5%
GPT-5.4 Nano (Reasoning)937846452557.3%
Claude Opus 4.6 (Reasoning)100666160057.2%
Z.AI GLM 4.7 Flash100807824056.6%
Claude Opus 5 (Reasoning)935646444356.2%
Qwen3.6 Max Preview1009046242156.2%
Aion 3.01001003939055.7%
Gemma 4 26B100726739055.6%
Hermes 3 70B100785542054.8%
Z.AI GLM 5 Turbo100944435054.8%
DeepSeek V4 Pro (Reasoning)100725249054.7%
Grok 4.20100816326054.0%
DeepSeek V3.210084780052.3%
GPT-5.5 (Reasoning, Low)100715138052.0%
Grok 4.20 (Reasoning)1001003028051.7%
o4 Mini1006834332251.5%
Laguna XS 2.1100100550050.9%
GPT-5.2917335342050.6%
Gemini 3.5 Flash (Reasoning, Minimal)100100480049.7%
DeepSeek V4 Flash100585434049.3%
Claude Opus 5 (Reasoning, Low)95535144048.6%
GPT-5 Nano88604444047.1%
Gemini 3 Flash (Preview, Reasoning)72695440047.0%
o4 Mini High100734319046.9%
Gemma 3 12B10083500046.6%
MoonshotAI: Kimi K2.695654033046.6%
Claude Opus 4.59591460046.6%
Qwen 3.5 Plus (2026-02-15)686052312246.4%
Gemini 3.1 Flash Lite79565044045.8%
Gemini 3.5 Flash (Reasoning)10078510045.6%
Grok 4.3100454537045.5%
MoonshotAI: Kimi K3 (Reasoning, Low)90484842045.4%
Claude Opus 594464641045.2%
DeepSeek V3.110089350044.8%
Qwen 3.5 122B9785390044.2%
Arcee AI: Trinity Mini10065550044.0%
DeepSeek V4 Pro80524341043.3%
WizardLM 2 8x22b97583323042.3%
Qwen 3.5 27B88712523041.8%
Xiaomi MIMO v2.5655735272341.5%
GPT-5.5100543616041.3%
Claude Opus 4.610062430041.1%
Claude Sonnet 4.610052480040.1%
Gemma 4 31B10010000040.0%
Gemini 3 Flash (Preview)8973370039.8%
Qwen 3.5 Plus (2026-04-20)62555228039.4%
Claude Opus 4.8 (Reasoning, Low)10050460039.1%
GPT-5.6 Sol (Reasoning)67543633038.0%
GPT-4o, Aug. 6th (temp=0)7658560038.0%
Thinking Machines Inkling7956540037.9%
Gemini 3.1 Flash Lite (Reasoning)1008900037.7%
Gemini 2.5 Flash (Reasoning)7863440037.1%
Gemini 3.5 Flash Lite (Reasoning, Minimal)1008100036.3%
Claude Sonnet 51007900035.9%
DeepSeek V4 Flash (Reasoning)10038360034.8%
Gemini 3.5 Flash Lite (Reasoning)957800034.6%
Claude Haiku 4.57364300033.5%
Qwen 3.6 27B10033320033.1%
Z.AI GLM 4.5937200033.0%
GPT-5.6 Terra (Reasoning)7661280032.9%
GPT-5504637141432.1%
MoonshotAI: Kimi K2.51005800031.7%
MoonshotAI: Kimi K3 (Reasoning, High)6451410031.1%
GPT-5.6 Sol64393319030.9%
Xiaomi MIMO v2.5 Pro1005400030.8%
GPT-4.1 Nano1005400030.8%
Muse Spark 1.1 (Reasoning, Minimal)44403632030.6%
GPT-4o Mini (temp=1)1005000030.0%
GPT-4o, Aug. 6th (temp=1)746900028.7%
ByteDance Seed 1.6 Flash1004200028.3%
Gemma 4 31B (Reasoning)5446420028.2%
Gemini 2.5 Pro1004000028.0%
DeepSeek V3 (2024-12-26)1003400026.7%
GPT-5 Mini943700026.2%
Muse Spark 1.1 (Reasoning, Medium)854200025.4%
Z.AI GLM 4.64738370024.5%
Nemotron 3 Super605900023.7%
Laguna S 2.1645300023.4%
Qwen 3.5 35B403517121123.2%
Claude Sonnet 4684200022.0%
Claude Opus 4.7575100021.8%
Gemini 3.6 Flash (Reasoning)555100021.2%
Gemini 3.6 Flash (Reasoning, Minimal)604200020.3%
GPT-4.1100000020.0%
ByteDance Seed 2.0 Mini100000020.0%
Hermes 3 405B100000020.0%
Qwen 2.5 72B100000020.0%
Cohere Command R+ (Aug. 2024)100000020.0%
Qwen3.7 Max494700019.2%
ByteDance Seed 2.0 Lite95000019.0%
Qwen 3.5 Flash93000018.7%
GPT-5.6 Luna (Reasoning)4223220017.4%
Grok 4.3 (Reasoning)434000016.6%
Aion 2.0433500015.8%
Gemini 3.1 Pro (Preview)383600014.8%
Qwen 3.5 9B441000010.9%
GPT-4.1 Mini4600009.3%
GPT-4o Mini (temp=0)4400008.8%
Mistral NeMO4100008.2%
DeepSeek-V2 Chat4000007.9%
Mistral Small 3.2 24B100000.2%
ByteDance Seed 1.6000000.0%
GPT-OSS 120B000000.0%
Inception Mercury 2000000.0%
Llama 3.1 70B000000.0%
Nemotron 3 Nano000000.0%