Paragraph length variance

Test: Bad Writing Habits

Avg. Score
95.7%
Scenarios
18

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1Ministral 3 14B100.0%$0.000711.7s100%
2Mistral Small 4100.0%$0.001418.2s100%
3Ministral 3 8B100.0%$0.000819.6s100%
4Ministral 8B99.9%$0.000410.4s98%
5ByteDance Seed 1.6 Flash100.0%$0.001327.3s100%
6DeepSeek V4 Flash100.0%$0.000631.6s100%
7Mistral Small 4 (Reasoning)100.0%$0.002230.2s100%
8DeepSeek V4 Flash (Reasoning)100.0%$0.000731.1s100%
9Mistral Large 3100.0%$0.003330.3s100%
10GPT-5.4 Nano100.0%$0.005726.3s100%
11GPT-5.4 Nano (Reasoning)100.0%$0.006124.5s99%
12Muse Spark 1.1 (Reasoning, Minimal)100.0%$0.01219.2s100%
13Writer: Palmyra X5100.0%$0.01122.0s100%
14Mistral Medium 3.1100.0%$0.004836.5s100%
15Ministral 3B99.5%$0.00018.1s94%
16GPT-5.6 Luna100.0%$0.01515.8s100%
17GPT-5.4 Mini (Reasoning, Low)100.0%$0.01516.8s100%
18Gemini 3.8 Flash (Reasoning, Medium)100.0%$0.01418.0s100%
19GPT-5.4 Mini100.0%$0.01516.8s100%
20Muse Glimmer 30B (Reasoning, Medium)100.0%$0.003843.4s100%
21GPT-5.6 Luna (Reasoning)100.0%$0.01718.0s100%
22GPT-5.4 Nano (Reasoning, Low)99.8%$0.005520.6s96%
23Muse Spark 1.1 (Reasoning, Medium)100.0%$0.01523.9s100%
24Qwen 3 235B A22B Instruct 2507100.0%$0.001159.2s100%
25Gemma 3 27B99.9%$0.000652.6s98%
26Mistral Large 299.9%$0.01329.4s99%
27Z.AI GLM 5.3 Flash (Reasoning, Low)100.0%$0.00051.1m100%
28GPT-5.4 Mini (Reasoning)100.0%$0.02228.1s100%
29Gemini 3 Flash (Preview)99.3%$0.007819.6s94%
30MiniMax M2.7100.0%$0.00401.1m100%
31Muse Spark 1.2 (Reasoning, Medium)100.0%$0.01838.3s100%
32MiniMax M2.5100.0%$0.00341.3m100%
33DeepSeek V4 Pro100.0%$0.00481.3m100%
34Z.AI GLM 5 Turbo99.7%$0.008133.2s94%
35DeepSeek V4.1 Flash (Reasoning, High)99.6%$0.002935.4s92%
36Claude Sonnet 5100.0%$0.02733.5s100%
37Gemini 3.5 Flash (Reasoning, Minimal)99.2%$0.01812.0s94%
38Z.AI GLM 5.2 (Reasoning, High)99.9%$0.0111.0m98%
39Laguna XS 2.198.7%$0.000314.4s88%
40Gemini 3 Flash (Preview, Reasoning)99.3%$0.01230.1s94%
41Gemma 3 12B98.9%$0.000441.3s92%
42Qwen 3.5 Flash99.4%$0.002547.5s93%
43Gemini 3.6 Flash (Reasoning, Minimal)99.1%$0.01714.3s92%
44Claude Sonnet 5 (Reasoning, Low)100.0%$0.03138.4s100%
45Claude Sonnet 4.6100.0%$0.03139.3s100%
46Claude Sonnet 5 (Reasoning)100.0%$0.03038.9s99%
47Ministral 3 3B98.6%$0.000511.1s85%
48Gemini 3.7 Flash (Reasoning, Medium)98.9%$0.01218.2s90%
49Xiaomi MIMO v2.5 Pro99.2%$0.008553.5s94%
50Qwen 3 32B99.0%$0.001554.6s91%
51Z.AI GLM 5.1100.0%$0.0141.5m100%
52Aion 2.099.7%$0.00641.3m95%
53Qwen 3.5 Plus (2026-02-15)98.0%$0.006031.5s89%
54GPT-5.6 Terra (Reasoning)100.0%$0.04435.2s100%
55DeepSeek V3 (2025-03-24)98.9%$0.001439.4s87%
56Kimi K3 (Reasoning, Low)100.0%$0.0281.1m100%
57Z.AI GLM 4.799.8%$0.0101.4m97%
58Claude Haiku 4.599.0%$0.01121.6s87%
59Aion 3.099.8%$0.0241.0m97%
60Gemma 4 26B98.3%$0.000955.1s90%
61GPT-4.1 Mini97.6%$0.002719.0s85%
62GPT-5.6 Terra100.0%$0.04636.9s100%
63Thinking Machines Inkling Small (Reasoning, High)99.8%$0.00881.7m98%
64Aion 3.0 Mini99.5%$0.00531.2m91%
65DeepSeek V3.299.7%$0.00141.9m96%
66Qwen 3.5 35B99.3%$0.0181.0m93%
67Laguna S 2.197.4%$0.000522.1s82%
68Gemma 4 31B99.2%$0.00101.6m93%
69Z.AI GLM 4.7 Flash99.0%$0.00171.2m88%
70Xiaomi MIMO v2.597.7%$0.005431.8s85%
71Claude Sonnet 4.599.4%$0.03538.1s93%
72Gemini 3.5 Flash Lite (Reasoning)96.8%$0.00356.6s81%
73Gemini 3.5 Flash Lite (Reasoning, Minimal)97.1%$0.00356.3s79%
74DeepSeek V4 Pro 0813 (Reasoning, High)100.0%$0.0251.8m100%
75DeepSeek V4 Flash 0731 (Reasoning, High)100.0%$0.00222.6m100%
76Gemma 3 4B97.2%$0.000220.0s79%
77Z.AI GLM 599.0%$0.00841.2m87%
78GPT-4.198.3%$0.01844.7s87%
79Thinking Machines Inkling98.9%$0.00751.5m90%
80Claude Opus 4.7100.0%$0.06930.4s100%
81DeepSeek V3 (2024-12-26)97.9%$0.002154.6s82%
82Claude Opus 4.8 (Reasoning)100.0%$0.07141.7s100%
83GPT-5.4100.0%$0.0491.4m100%
84Claude Opus 4.7 (Reasoning)100.0%$0.07632.0s100%
85Claude Opus 4.8 (Reasoning, Low)100.0%$0.07141.9s100%
86Gemma 4 26B (Reasoning)98.8%$0.00132.0m90%
87DeepSeek V3.198.6%$0.00201.8m88%
88Claude Sonnet 4.6 (Reasoning)100.0%$0.0601.2m100%
89Gemini 3.1 Flash Lite (Reasoning)94.6%$0.003011.9s78%
90Qwen 3.5 122B98.8%$0.0251.1m88%
91GPT-5.4 (Reasoning, Low)100.0%$0.0551.4m100%
92Qwen 3.8 Flash (Reasoning)100.0%$0.00643.1m100%
93Claude Opus 4.5100.0%$0.07053.4s100%
94DeepSeek-V2 Chat97.5%$0.002153.3s79%
95 Kimi K3 (Reasoning, High)100.0%$0.0441.8m100%
96Gemini 3.1 Flash Lite93.9%$0.003012.1s79%
97Gemma 4 31B (Reasoning)99.1%$0.00142.2m89%
98Muse Spark 1.3 (Reasoning, Medium)99.6%$0.0251.8m93%
99Gemini 3.6 Flash (Reasoning)98.5%$0.04432.5s88%
100GPT-5.2100.0%$0.0561.5m100%
101Gemini 3.1 Flash Lite (Preview)94.5%$0.00308.4s76%
102Cydonia 24B V4.196.0%$0.001444.8s78%
103MiniMax M399.8%$0.00603.1m97%
104GPT-5.1100.0%$0.0541.8m100%
105Claude Opus 5100.0%$0.08250.1s100%
106Qwen 3.5 9B97.5%$0.00111.4m79%
107Claude Opus 4.6100.0%$0.0781.2m100%
108Qwen 3.5 27B99.1%$0.0201.6m84%
109Gemini 3.5 Flash (Reasoning)99.3%$0.07137.6s92%
110Z.AI GLM 4.695.9%$0.006551.5s74%
111Z.AI GLM 4.593.8%$0.005142.1s75%
112Kimi K2.599.7%$0.0193.2m96%
113GPT-5 Mini95.2%$0.010057.4s77%
114Grok 4.2094.5%$0.009345.7s75%
115Claude Opus 5 (Reasoning, Low)100.0%$0.0971.0m100%
116Grok 4.6 (Reasoning, High)99.8%$0.0422.5m96%
117Claude Opus 4.6 (Reasoning)100.0%$0.0881.4m100%
118Claude Opus 5 (Reasoning)100.0%$0.0981.0m100%
119GPT-4o Mini (temp=0)94.5%$0.001234.8s69%
120Gemini 2.5 Pro96.4%$0.03636.2s78%
121Qwen 3.5 397B A17B98.6%$0.0143.0m90%
122Qwen 3.6 Flash94.7%$0.01041.4s70%
123Z.AI GLM 4.5 Air93.4%$0.002958.2s73%
124Claude Sonnet 495.3%$0.03243.7s77%
125GPT-5.6 Sol100.0%$0.1051.2m100%
126GPT-4o Mini (temp=1)91.1%$0.001234.8s71%
127GPT-5.6 Sol (Reasoning)100.0%$0.1081.2m100%
128GPT-5100.0%$0.0652.8m100%
129Qwen 2.5 72B91.0%$0.001036.7s67%
130Qwen 3.6 27B97.3%$0.0252.3m82%
131Grok 4.5 (Reasoning, High)96.2%$0.0301.6m75%
132Grok 4.20 (Reasoning)95.3%$0.0181.5m72%
133GPT-5.4 (Reasoning)100.0%$0.0892.6m100%
134Hy4 Preview (Reasoning, High)100.0%$0.0404.4m100%
135Grok 4.5 (Reasoning, Low)92.9%$0.0181.1m68%
136DeepSeek V4 Pro (Reasoning)98.0%$0.0153.1m78%
137Gemini 2.5 Flash (Reasoning)89.1%$0.01121.5s63%
138Thinking Machines Inkling (Reasoning)99.9%$0.0255.1m99%
139Qwen 3.7 Flash (Reasoning)91.9%$0.001055.2s59%
140Qwen 3.6 35B92.8%$0.00831.0m60%
141Qwen 3.8 27B (Reasoning, XHigh)99.8%$0.0404.7m97%
142Qwen 3.5 Plus (2026-04-20)94.1%$0.0171.8m67%
143Gemini 3.1 Pro (Preview)99.0%$0.1071.8m90%
144GPT-5.5100.0%$0.1391.7m100%
145GPT-5.5 (Reasoning, Low)100.0%$0.1391.8m100%
146Z.AI GLM 5.3 Flash (Reasoning, Max)100.0%$0.00316.5m100%
147GPT-5.5 (Reasoning)100.0%$0.1421.8m100%
148Gemini 2.5 Flash86.7%$0.005210.6s54%
149o4 Mini88.6%$0.01525.7s55%
150GPT-4.1 Nano83.7%$0.000713.3s54%
151WizardLM 2 8x22b88.5%$0.00261.8m53%
152Qwen 3.7 Max95.2%$0.0682.3m69%
153Gemini 2.5 Flash Lite82.0%$0.00099.5s46%
154Qwen 3.8 Max (Reasoning, XHigh)100.0%$0.0835.9m100%
155GPT-4o, Aug. 6th (temp=0)82.3%$0.02322.7s51%
156Kimi K2.699.7%$0.0586.5m95%
157o4 Mini High85.9%$0.02547.2s47%
158Grok 4.382.1%$0.006930.5s42%
159Qwen 3.6 Max Preview95.2%$0.0503.5m66%
160Llama 3.1 70B79.4%$0.001529.4s45%
161GPT-4o, Aug. 6th (temp=1)79.5%$0.01824.4s50%
162Cohere Command R+ (Aug. 2024)82.1%$0.02052.5s50%
163ByteDance Seed 1.686.1%$0.0132.5m56%
164Gemini 2.5 Flash Lite (Reasoning)79.7%$0.002830.8s43%
165Z.AI GLM 5.3 (Reasoning, Max)100.0%$0.0667.3m100%
166Mistral NeMO77.6%$0.000510.1s41%
167Hermes 3 70B79.8%$0.00101.2m47%
168Hermes 3 405B78.0%$0.003253.2s48%
169Claude Opus 498.5%$0.2091.4m89%
170Nemotron 3 Super79.9%$0.00001.4m47%
171Inception Mercury 274.5%$0.00327.0s41%
172ByteDance Seed 2.0 Lite82.0%$0.0122.2m48%
173GPT-OSS 120B71.3%$0.00151.8m41%
174GPT-5 Nano65.5%$0.00421.4m43%
175ByteDance Seed 2.0 Mini81.0%$0.00454.9m48%
176Arcee AI: Trinity Mini64.3%$0.00039.2s20%
177Grok 4.3 (Reasoning)71.2%$0.0212.3m30%
178Nemotron 3 Nano61.6%$0.00101.1m27%
179Mistral Small 3.2 24B61.8%$0.00695.7m20%
95.67%

Individual Scenarios

Detailed Writing Rules

Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, High)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Kimi K3 (Reasoning, High)100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Kimi K2.6100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100.0%
GPT-5100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
GPT-5 Mini100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.1100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
MiniMax M3100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
Qwen 3.5 122B100100100100100100.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
Gemini 3 Flash (Preview, Reasoning)100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Gemma 4 31B (Reasoning)100100100100100100.0%
Claude Opus 4.5100100100100100100.0%
Z.AI GLM 5100100100100100100.0%
GPT-5.2100100100100100100.0%
GPT-5.5100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100.0%
Gemma 4 26B (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
Aion 3.0100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100100100100.0%
Gemini 2.5 Pro100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
DeepSeek V4 Flash 0731 (Reasoning, High)100100100100100100.0%
Z.AI GLM 4.7100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Thinking Machines Inkling Small (Reasoning, High)100100100100100100.0%
Claude Sonnet 5100100100100100100.0%
GPT-4.1100100100100100100.0%
MiniMax M2.5100100100100100100.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100100.0%
Aion 2.0100100100100100100.0%
MiniMax M2.7100100100100100100.0%
Qwen 3.5 Plus (2026-02-15)100100100100100100.0%
Xiaomi MIMO v2.5 Pro100100100100100100.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
Gemini 3 Flash (Preview)100100100100100100.0%
Gemma 4 31B100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Gemma 4 26B100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning)100100100100100100.0%
GPT-5.4100100100100100100.0%
Mistral Large 3100100100100100100.0%
Gemini 2.5 Flash (Reasoning)100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
Aion 3.0 Mini100100100100100100.0%
GPT-5.4 Mini (Reasoning, Low)100100100100100100.0%
Claude Haiku 4.5100100100100100100.0%
DeepSeek V3 (2024-12-26)100100100100100100.0%
DeepSeek V3.1100100100100100100.0%
DeepSeek V3.2100100100100100100.0%
Z.AI GLM 4.7 Flash100100100100100100.0%
DeepSeek V4 Pro100100100100100100.0%
DeepSeek V4 Flash100100100100100100.0%
Mistral Large 2100100100100100100.0%
GPT-4.1 Mini100100100100100100.0%
GPT-5.4 Mini100100100100100100.0%
GPT-5.4 Nano (Reasoning)100100100100100100.0%
DeepSeek V3 (2025-03-24)100100100100100100.0%
Mistral Small 4 (Reasoning)100100100100100100.0%
Qwen 3 32B100100100100100100.0%
Writer: Palmyra X5100100100100100100.0%
Qwen 3 235B A22B Instruct 2507100100100100100100.0%
GPT-5.4 Nano (Reasoning, Low)100100100100100100.0%
Mistral Medium 3.1100100100100100100.0%
Mistral Small 4100100100100100100.0%
GPT-5.4 Nano100100100100100100.0%
WizardLM 2 8x22b100100100100100100.0%
ByteDance Seed 1.6 Flash100100100100100100.0%
Ministral 3 14B100100100100100100.0%
Ministral 3 8B100100100100100100.0%
Gemma 3 4B100100100100100100.0%
Ministral 8B100100100100100100.0%
Ministral 3B100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)10010010010010099.9%
Kimi K2.51001001001009999.8%
GPT-4o Mini (temp=0)1001001001009899.6%
DeepSeek V4 Flash (Reasoning)1001001001009899.6%
Cydonia 24B V4.11001001001009899.6%
Gemma 3 27B1001001001009799.5%
Nemotron 3 Super1001001001009799.3%
Qwen 3.7 Max1001001001009699.2%
Claude Sonnet 41001001001009699.2%
DeepSeek-V2 Chat1001001001009498.8%
Thinking Machines Inkling (Reasoning)1001001001009498.8%
Gemini 3.1 Flash Lite (Preview)1001001001009298.3%
Gemini 3.6 Flash (Reasoning)1001001001009298.3%
Grok 4.20100100100989498.3%
Gemini 2.5 Flash Lite1001001001009198.2%
Claude Opus 41001001001009198.2%
o4 Mini1001001001009198.1%
Qwen 3.5 Plus (2026-04-20)1001001001009098.0%
Qwen 3.6 27B1001001001009098.0%
Laguna XS 2.11001001001008997.9%
Laguna S 2.11001001001008997.8%
Gemini 2.5 Flash100100100979297.8%
Thinking Machines Inkling100100100959197.2%
Gemini 3.1 Flash Lite (Reasoning)100100100988797.1%
Grok 4.3 (Reasoning)10010098969197.0%
Qwen 2.5 72B100100100939196.9%
Z.AI GLM 4.5 Air100100100958896.7%
o4 Mini High1001001001008396.6%
Qwen 3.6 35B1001001001007795.4%
Gemma 3 12B100100100997594.8%
Qwen 3.5 35B1001001001007194.2%
Z.AI GLM 4.5100100100868293.6%
Xiaomi MIMO v2.51001001001006693.2%
Z.AI GLM 4.6100100100857191.2%
GPT-4o Mini (temp=1)10010090877891.0%
Gemini 3.1 Flash Lite100100100926290.9%
Gemini 2.5 Flash Lite (Reasoning)10010093787188.3%
GPT-4o, Aug. 6th (temp=0)10010086816285.8%
Hermes 3 405B10010083835984.9%
Qwen 3.7 Flash (Reasoning)1001001001002484.7%
Hermes 3 70B1009995705583.9%
Ministral 3 3B100100100753682.3%
Mistral NeMO1009693764782.3%
ByteDance Seed 1.610010075736181.7%
GPT-4o, Aug. 6th (temp=1)1008179757381.7%
Llama 3.1 70B10010083695681.6%
Mistral Small 3.2 24B10010090675081.3%
Grok 4.3100100100535080.6%
GPT-4.1 Nano989783636280.4%
GPT-5 Nano978576696578.2%
Cohere Command R+ (Aug. 2024)10010091781376.5%
ByteDance Seed 2.0 Mini1008079534571.5%
ByteDance Seed 2.0 Lite10010076532771.2%
Nemotron 3 Nano1008861594570.7%
Inception Mercury 2979481282464.6%
GPT-OSS 120B846661545163.2%
Arcee AI: Trinity Mini80473215034.9%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Kimi K3 (Reasoning, High)100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100.0%
GPT-5100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
GPT-5 Mini100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Kimi K2.5100100100100100100.0%
Thinking Machines Inkling (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.1100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
MiniMax M3100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Gemma 4 31B (Reasoning)100100100100100100.0%
Claude Opus 4.5100100100100100100.0%
Z.AI GLM 5100100100100100100.0%
GPT-5.2100100100100100100.0%
GPT-5.5100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100.0%
Gemma 4 26B (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
Aion 3.0100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100100100100.0%
Qwen 3.6 27B100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
DeepSeek V4 Flash (Reasoning)100100100100100100.0%
DeepSeek V4 Flash 0731 (Reasoning, High)100100100100100100.0%
Z.AI GLM 4.7100100100100100100.0%
Claude Sonnet 4100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Thinking Machines Inkling Small (Reasoning, High)100100100100100100.0%
Claude Sonnet 5100100100100100100.0%
Claude Opus 4100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
GPT-4.1100100100100100100.0%
MiniMax M2.5100100100100100100.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100100.0%
Aion 2.0100100100100100100.0%
MiniMax M2.7100100100100100100.0%
Qwen 3.5 Plus (2026-02-15)100100100100100100.0%
Xiaomi MIMO v2.5 Pro100100100100100100.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
Gemini 3 Flash (Preview)100100100100100100.0%
Gemini 3.1 Flash Lite (Preview)100100100100100100.0%
Gemma 4 31B100100100100100100.0%
Gemini 3.1 Flash Lite100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Gemma 4 26B100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning)100100100100100100.0%
GPT-5.4100100100100100100.0%
Mistral Large 3100100100100100100.0%
DeepSeek-V2 Chat100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
Xiaomi MIMO v2.5100100100100100100.0%
Aion 3.0 Mini100100100100100100.0%
GPT-5.4 Mini (Reasoning, Low)100100100100100100.0%
Claude Haiku 4.5100100100100100100.0%
DeepSeek V3.1100100100100100100.0%
DeepSeek V3.2100100100100100100.0%
Z.AI GLM 4.7 Flash100100100100100100.0%
DeepSeek V4 Pro100100100100100100.0%
DeepSeek V4 Flash100100100100100100.0%
Mistral Large 2100100100100100100.0%
GPT-4.1 Mini100100100100100100.0%
GPT-5.4 Mini100100100100100100.0%
GPT-5.4 Nano (Reasoning)100100100100100100.0%
DeepSeek V3 (2025-03-24)100100100100100100.0%
Mistral Small 4 (Reasoning)100100100100100100.0%
Qwen 3 32B100100100100100100.0%
Writer: Palmyra X5100100100100100100.0%
Qwen 3 235B A22B Instruct 2507100100100100100100.0%
GPT-5.4 Nano (Reasoning, Low)100100100100100100.0%
Mistral Medium 3.1100100100100100100.0%
Gemma 3 12B100100100100100100.0%
Gemma 3 27B100100100100100100.0%
Laguna XS 2.1100100100100100100.0%
Mistral Small 4100100100100100100.0%
Cydonia 24B V4.1100100100100100100.0%
GPT-5.4 Nano100100100100100100.0%
WizardLM 2 8x22b100100100100100100.0%
ByteDance Seed 1.6 Flash100100100100100100.0%
Ministral 3 14B100100100100100100.0%
Ministral 3 8B100100100100100100.0%
Ministral 8B100100100100100100.0%
Ministral 3B100100100100100100.0%
Gemini 3.1 Flash Lite (Reasoning)1001001001009999.8%
Ministral 3 3B1001001001009699.2%
Gemini 3 Flash (Preview, Reasoning)1001001001009498.7%
Laguna S 2.11001001001008997.9%
Grok 4.201001001001008697.2%
Qwen 3.7 Flash (Reasoning)1001001001008596.9%
Thinking Machines Inkling1001001001007995.9%
Qwen 3.5 122B1001001001007795.3%
Kimi K2.61001001001007695.3%
Gemini 2.5 Pro1001001001007595.0%
ByteDance Seed 1.61001001001007494.7%
Qwen 3.6 Flash1001001001006993.8%
Qwen 3.7 Max1001001001006693.2%
Arcee AI: Trinity Mini1001001001005390.6%
Grok 4.5 (Reasoning, High)1001001001005290.4%
GPT-4o Mini (temp=0)10010099955690.0%
ByteDance Seed 2.0 Lite1001001001004989.8%
DeepSeek V3 (2024-12-26)1001001001004689.2%
Z.AI GLM 4.5 Air10010093787388.9%
Z.AI GLM 4.51009893876588.5%
Gemini 2.5 Flash100100100924988.2%
Qwen 3.6 Max Preview1001001001004088.0%
Qwen 3.6 35B100100100884286.1%
Grok 4.20 (Reasoning)100100100804284.5%
GPT-4o Mini (temp=1)100100100625984.0%
Z.AI GLM 4.61001001001002083.9%
Inception Mercury 210010084714479.6%
Gemini 2.5 Flash Lite (Reasoning)1008584694676.8%
Gemma 3 4B100100100493175.9%
Hermes 3 405B999264615474.0%
Gemini 2.5 Flash (Reasoning)898076616073.1%
o4 Mini High10010074474472.9%
Nemotron 3 Super1007465615671.2%
GPT-4.1 Nano1007474633469.1%
o4 Mini877574624568.5%
Cohere Command R+ (Aug. 2024)1008174602467.8%
Gemini 2.5 Flash Lite96928857467.3%
GPT-OSS 120B966057555564.5%
Mistral Small 3.2 24B1001006850063.8%
Mistral NeMO91878649663.6%
Qwen 2.5 72B1008262403463.5%
GPT-4o, Aug. 6th (temp=1)816657564160.0%
Hermes 3 70B100866931057.0%
Llama 3.1 70B1009450171454.9%
Grok 4.3100100638054.3%
GPT-5 Nano705947474253.0%
ByteDance Seed 2.0 Mini1008451171152.5%
GPT-4o, Aug. 6th (temp=0)615344342142.7%
Nemotron 3 Nano554126181831.5%
Grok 4.3 (Reasoning)2053005.5%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Kimi K3 (Reasoning, High)100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Kimi K2.6100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100.0%
GPT-5100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
GPT-5 Mini100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100.0%
Kimi K2.5100100100100100100.0%
Thinking Machines Inkling (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.1100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
MiniMax M3100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
Qwen 3.5 122B100100100100100100.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
Gemini 3 Flash (Preview, Reasoning)100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Gemma 4 31B (Reasoning)100100100100100100.0%
Claude Opus 4.5100100100100100100.0%
Z.AI GLM 5100100100100100100.0%
GPT-5.2100100100100100100.0%
GPT-5.5100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100.0%
Gemma 4 26B (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
Aion 3.0100100100100100100.0%
o4 Mini High100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100100100100.0%
Qwen 3.7 Flash (Reasoning)100100100100100100.0%
Gemini 2.5 Pro100100100100100100.0%
Qwen 3.6 27B100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
DeepSeek V4 Flash (Reasoning)100100100100100100.0%
DeepSeek V4 Flash 0731 (Reasoning, High)100100100100100100.0%
Z.AI GLM 4.7100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Z.AI GLM 4.6100100100100100100.0%
Claude Sonnet 4100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Thinking Machines Inkling Small (Reasoning, High)100100100100100100.0%
Claude Sonnet 5100100100100100100.0%
Claude Opus 4100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
GPT-4.1100100100100100100.0%
MiniMax M2.5100100100100100100.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100100.0%
Aion 2.0100100100100100100.0%
o4 Mini100100100100100100.0%
MiniMax M2.7100100100100100100.0%
Qwen 3.5 Plus (2026-02-15)100100100100100100.0%
Xiaomi MIMO v2.5 Pro100100100100100100.0%
Gemini 3.1 Flash Lite (Reasoning)100100100100100100.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
Gemini 3 Flash (Preview)100100100100100100.0%
Gemini 3.1 Flash Lite (Preview)100100100100100100.0%
Gemma 4 31B100100100100100100.0%
Gemini 3.1 Flash Lite100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Z.AI GLM 4.5100100100100100100.0%
Gemma 4 26B100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning)100100100100100100.0%
GPT-5.4100100100100100100.0%
Mistral Large 3100100100100100100.0%
ByteDance Seed 2.0 Lite100100100100100100.0%
Gemini 2.5 Flash (Reasoning)100100100100100100.0%
DeepSeek-V2 Chat100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
Aion 3.0 Mini100100100100100100.0%
GPT-5.4 Mini (Reasoning, Low)100100100100100100.0%
Claude Haiku 4.5100100100100100100.0%
DeepSeek V3.1100100100100100100.0%
DeepSeek V3.2100100100100100100.0%
Z.AI GLM 4.7 Flash100100100100100100.0%
DeepSeek V4 Pro100100100100100100.0%
DeepSeek V4 Flash100100100