Em-dash & semicolon overuse

Test: Bad Writing Habits

Avg. Score
53.3%
Scenarios
18

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1GPT-5.6 Luna (Reasoning)99.1%$0.01718.0s93%
2GPT-5.6 Luna98.2%$0.01515.8s86%
3GPT-5.4 Mini97.4%$0.01516.8s81%
4GPT-5.4 Mini (Reasoning)98.0%$0.02228.1s85%
5Qwen 3.6 Flash97.4%$0.01041.4s81%
6GPT-5.6 Terra98.7%$0.04636.9s88%
7GPT-5.4 Mini (Reasoning, Low)95.0%$0.01516.8s72%
8Mistral NeMO95.0%$0.000510.1s63%
9Muse Glimmer 30B (Reasoning, Medium)96.0%$0.003843.4s69%
10Qwen 3.5 Flash94.4%$0.002547.5s67%
11Qwen 3.5 9B95.9%$0.00111.4m72%
12Qwen 2.5 72B93.0%$0.001036.7s64%
13GPT-5.6 Terra (Reasoning)96.7%$0.04435.2s80%
14Qwen 3.7 Flash (Reasoning)94.0%$0.001055.2s64%
15Qwen 3.6 35B95.3%$0.00831.0m66%
16Qwen 3.5 122B94.6%$0.0251.1m69%
17Qwen 3.5 35B94.3%$0.0181.0m64%
18Gemini 2.5 Flash86.7%$0.005210.6s51%
19Qwen 3.5 27B94.5%$0.0201.6m66%
20Qwen 3.5 397B A17B98.3%$0.0143.0m78%
21Qwen 3.8 Flash (Reasoning)96.6%$0.00643.1m77%
22Gemini 2.5 Flash Lite82.2%$0.00099.5s48%
23Qwen 3.7 Max99.6%$0.0682.3m92%
24Qwen 3.6 Max Preview100.0%$0.0503.5m100%
25GPT-5.6 Sol (Reasoning)99.5%$0.1081.2m93%
26Qwen 3.5 Plus (2026-04-20)94.2%$0.0171.8m62%
27GPT-5.6 Sol98.6%$0.1051.2m89%
28Muse Spark 1.2 (Reasoning, Medium)89.3%$0.01838.3s44%
29Gemini 2.5 Flash (Reasoning)83.4%$0.01121.5s42%
30Z.AI GLM 4.684.0%$0.006551.5s43%
31Muse Spark 1.1 (Reasoning, Medium)85.0%$0.01523.9s39%
32Gemini 2.5 Pro83.7%$0.03636.2s50%
33Muse Spark 1.1 (Reasoning, Minimal)80.2%$0.01219.2s37%
34GPT-5.4 (Reasoning, Low)91.3%$0.0551.4m62%
35Qwen 3.8 27B (Reasoning, XHigh)99.0%$0.0404.7m89%
36Muse Spark 1.3 (Reasoning, Medium)90.0%$0.0251.8m47%
37Qwen 3.6 27B91.2%$0.0252.3m52%
38GPT-5.488.6%$0.0491.4m52%
39GPT-4o, Aug. 6th (temp=0)79.3%$0.02322.7s30%
40Gemma 3 27B73.5%$0.000652.6s30%
41GPT-5.5 (Reasoning, Low)97.0%$0.1391.8m84%
42GPT-5.596.6%$0.1391.7m83%
43Gemini 3.1 Pro (Preview)95.9%$0.1071.8m67%
44ByteDance Seed 2.0 Lite83.7%$0.0122.2m38%
45Hermes 3 405B73.8%$0.003253.2s24%
46Qwen 3.5 Plus (2026-02-15)71.3%$0.006031.5s22%
47GPT-4o Mini (temp=0)66.3%$0.001234.8s24%
48GPT-5.5 (Reasoning)96.8%$0.1421.8m74%
49GPT-5.4 (Reasoning)91.6%$0.0892.6m63%
50Grok 4.6 (Reasoning, High)85.2%$0.0422.5m45%
51Gemini 3.5 Flash Lite (Reasoning, Minimal)66.2%$0.00356.3s12%
52Qwen 3.8 Max (Reasoning, XHigh)99.5%$0.0835.9m92%
53Gemini 3.5 Flash Lite (Reasoning)64.5%$0.00356.6s7%
54DeepSeek V4.1 Flash (Reasoning, High)59.9%$0.002935.4s8%
55Grok 4.360.1%$0.006930.5s8%
56Z.AI GLM 4.764.3%$0.0101.4m17%
57Gemini 2.5 Flash Lite (Reasoning)50.7%$0.002830.8s15%
58Inception Mercury 252.0%$0.00327.0s7%
59Gemini 3.7 Flash (Reasoning, Medium)57.1%$0.01218.2s9%
60Llama 3.1 70B54.4%$0.001529.4s6%
61DeepSeek V3.260.4%$0.00141.9m19%
62DeepSeek V3.159.9%$0.00201.8m19%
63Gemini 3.5 Flash (Reasoning, Minimal)54.2%$0.01812.0s9%
64Hermes 3 70B57.7%$0.00101.2m11%
65Grok 4.20 (Reasoning)68.7%$0.0181.5m12%
66Cohere Command R+ (Aug. 2024)60.2%$0.02052.5s12%
67Gemini 3.8 Flash (Reasoning, Medium)54.6%$0.01418.0s7%
68Z.AI GLM 5 Turbo55.8%$0.008133.2s6%
69Mistral Small 3.2 24B88.0%$0.00695.7m43%
70Aion 2.055.9%$0.00641.3m13%
71Xiaomi MIMO v2.5 Pro53.2%$0.008553.5s11%
72GPT-5.4 Nano (Reasoning, Low)47.6%$0.005520.6s3%
73DeepSeek V4 Flash46.1%$0.000631.6s5%
74Grok 4.3 (Reasoning)71.9%$0.0212.3m13%
75Grok 4.2053.8%$0.009345.7s4%
76GPT-5.4 Nano46.2%$0.005726.3s4%
77GPT-5.4 Nano (Reasoning)45.9%$0.006124.5s3%
78Gemini 3.6 Flash (Reasoning, Minimal)47.2%$0.01714.3s4%
79Gemma 3 12B41.2%$0.000441.3s8%
80WizardLM 2 8x22b54.5%$0.00261.8m11%
81Z.AI GLM 4.7 Flash47.2%$0.00171.2m8%
82Gemini 3.5 Flash (Reasoning)64.3%$0.07137.6s17%
83GPT-5.169.9%$0.0541.8m18%
84Gemma 4 26B43.5%$0.000955.1s7%
85Xiaomi MIMO v2.543.8%$0.005431.8s3%
86Aion 3.0 Mini48.6%$0.00531.2m6%
87DeepSeek V4 Pro 0813 (Reasoning, High)61.3%$0.0251.8m11%
88Gemini 3 Flash (Preview, Reasoning)41.5%$0.01230.1s4%
89MiniMax M2.746.7%$0.00401.1m3%
90Arcee AI: Trinity Mini32.0%$0.00039.2s2%
91Grok 4.5 (Reasoning, Low)50.6%$0.0181.1m2%
92Gemma 4 31B (Reasoning)53.1%$0.00142.2m5%
93o4 Mini38.1%$0.01525.7s2%
94Z.AI GLM 5.3 Flash (Reasoning, Low)40.0%$0.00051.1m0%
95Gemma 4 31B42.2%$0.00101.6m5%
96Claude Sonnet 4.546.5%$0.03538.1s2%
97o4 Mini High42.8%$0.02547.2s4%
98DeepSeek V4 Pro42.8%$0.00481.3m0%
99Aion 3.047.9%$0.0241.0m1%
100DeepSeek V4 Flash (Reasoning)30.5%$0.000731.1s0%
101Gemini 3.6 Flash (Reasoning)48.1%$0.04432.5s3%
102Claude Sonnet 542.5%$0.02733.5s0%
103Gemma 4 26B (Reasoning)46.4%$0.00132.0m4%
104Gemini 3.1 Flash Lite (Preview)24.7%$0.00308.4s0%
105Z.AI GLM 541.9%$0.00841.2m0%
106Gemini 3.1 Flash Lite (Reasoning)25.3%$0.003011.9s0%
107Z.AI GLM 5.2 (Reasoning, High)40.2%$0.0111.0m0%
108Ministral 3 3B22.9%$0.000511.1s0%
109Z.AI GLM 4.528.3%$0.005142.1s2%
110Thinking Machines Inkling41.7%$0.00751.5m0%
111Claude Sonnet 5 (Reasoning)40.9%$0.03038.9s0%
112Gemini 3 Flash (Preview)25.7%$0.007819.6s0%
113Claude Haiku 4.527.6%$0.01121.6s0%
114Z.AI GLM 4.5 Air31.8%$0.002958.2s0%
115GPT-569.5%$0.0652.8m18%
116Nemotron 3 Nano32.5%$0.00101.1m0%
117Ministral 3B17.9%$0.00018.1s0%
118Gemini 3.1 Flash Lite20.0%$0.003012.1s0%
119Claude Sonnet 5 (Reasoning, Low)39.4%$0.03138.4s0%
120Ministral 3 8B20.2%$0.000819.6s0%
121Mistral Large 323.8%$0.003330.3s0%
122GPT-5.256.0%$0.0561.5m7%
123Grok 4.5 (Reasoning, High)47.3%$0.0301.6m3%
124DeepSeek V3 (2024-12-26)27.1%$0.002154.6s0%
125Mistral Large 225.7%$0.01329.4s0%
126Claude Sonnet 4.636.5%$0.03139.3s0%
127DeepSeek-V2 Chat24.3%$0.002153.3s1%
128Ministral 8B14.0%$0.000410.4s0%
129Z.AI GLM 5.139.3%$0.0141.5m0%
130MiniMax M353.6%$0.00603.1m4%
131Claude Sonnet 436.4%$0.03243.7s0%
132Kimi K3 (Reasoning, Low)39.1%$0.0281.1m0%
133GPT-5 Mini27.9%$0.010057.4s0%
134Thinking Machines Inkling Small (Reasoning, High)36.6%$0.00881.7m0%
135Gemma 3 4B11.5%$0.000220.0s0%
136Laguna S 2.111.7%$0.000522.1s0%
137 Kimi K3 (Reasoning, High)50.7%$0.0441.8m2%
138Ministral 3 14B8.0%$0.000711.7s0%
139MiniMax M2.524.0%$0.00341.3m0%
140DeepSeek V4 Flash 0731 (Reasoning, High)41.8%$0.00222.6m0%
141Claude Opus 4.743.9%$0.06930.4s0%
142Laguna XS 2.15.6%$0.000314.4s0%
143GPT-4o Mini (temp=1)10.0%$0.001234.8s0%
144Claude Opus 4.7 (Reasoning)43.8%$0.07632.0s1%
145Claude Opus 4.8 (Reasoning)42.9%$0.07141.7s1%
146GPT-4.1 Mini5.0%$0.002719.0s0%
147Mistral Small 44.0%$0.001418.2s0%
148GPT-OSS 120B24.5%$0.00151.8m0%
149Qwen 3 32B12.3%$0.001554.6s0%
150GPT-4.1 Nano2.2%$0.000713.3s0%
151Mistral Medium 3.19.1%$0.004836.5s0%
152Cydonia 24B V4.19.3%$0.001444.8s0%
153ByteDance Seed 1.6 Flash4.7%$0.001327.3s0%
154Writer: Palmyra X58.0%$0.01122.0s0%
155Nemotron 3 Super17.5%$0.00001.4m0%
156DeepSeek V3 (2025-03-24)6.3%$0.001439.4s0%
157Claude Opus 4.8 (Reasoning, Low)40.2%$0.07141.9s0%
158Mistral Small 4 (Reasoning)4.2%$0.002230.2s0%
159Claude Opus 542.4%$0.08250.1s2%
160Qwen 3 235B A22B Instruct 25076.9%$0.001159.2s0%
161GPT-4o, Aug. 6th (temp=1)7.0%$0.01824.4s0%
162Hy4 Preview (Reasoning, High)61.2%$0.0404.4m11%
163Claude Opus 4.536.6%$0.07053.4s0%
164DeepSeek V4 Pro (Reasoning)38.9%$0.0153.1m0%
165Claude Sonnet 4.6 (Reasoning)33.3%$0.0601.2m0%
166GPT-4.15.6%$0.01844.7s0%
167Kimi K2.537.7%$0.0193.2m0%
168Claude Opus 5 (Reasoning)42.6%$0.0981.0m2%
169Claude Opus 5 (Reasoning, Low)42.8%$0.0971.0m0%
170Claude Opus 4.633.4%$0.0781.2m0%
171GPT-5 Nano0.8%$0.00421.4m0%
172ByteDance Seed 2.0 Mini42.2%$0.00454.9m3%
173Claude Opus 4.6 (Reasoning)33.9%$0.0881.4m0%
174ByteDance Seed 1.60.0%$0.0132.5m0%
175Thinking Machines Inkling (Reasoning)38.6%$0.0255.1m0%
176Kimi K2.660.8%$0.0586.5m11%
177Z.AI GLM 5.3 Flash (Reasoning, Max)43.3%$0.00316.5m1%
178Claude Opus 434.6%$0.2091.4m0%
179Z.AI GLM 5.3 (Reasoning, Max)41.0%$0.0667.3m0%
53.32%

Individual Scenarios

Detailed Writing Rules

Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Kimi K3 (Reasoning, High)100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Kimi K2.6100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100.0%
GPT-5100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100.0%
Thinking Machines Inkling (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.1100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
MiniMax M3100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
Qwen 3.5 122B100100100100100100.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Gemma 4 31B (Reasoning)100100100100100100.0%
Claude Opus 4.5100100100100100100.0%
GPT-5.2100100100100100100.0%
GPT-5.5100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
Aion 3.0100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100100100100.0%
Qwen 3.7 Flash (Reasoning)100100100100100100.0%
Qwen 3.6 27B100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Claude Sonnet 5100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning)100100100100100100.0%
GPT-5.4100100100100100100.0%
ByteDance Seed 2.0 Lite100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
GPT-5.4 Mini (Reasoning, Low)100100100100100100.0%
DeepSeek V4 Pro100100100100100100.0%
Grok 4.20100100100100100100.0%
GPT-5.4 Mini100100100100100100.0%
GPT-5.4 Nano (Reasoning, Low)100100100100100100.0%
Mistral Small 3.2 24B100100100100100100.0%
Thinking Machines Inkling100100100100100100.0%
Qwen 2.5 72B100100100100100100.0%
Mistral NeMO100100100100100100.0%
GPT-5.4 Nano1001001001009899.5%
GPT-4o, Aug. 6th (temp=0)1001001001009799.4%
Qwen 3.5 Plus (2026-02-15)1001001001009498.8%
Grok 4.3 (Reasoning)1001001001009498.7%
Claude Opus 4.7 (Reasoning)1001001001009398.6%
Grok 4.5 (Reasoning, High)1001001001008997.8%
Claude Opus 5 (Reasoning)1001001001007394.5%
Z.AI GLM 51001001001006993.8%
GPT-5.4 Nano (Reasoning)1001001001005591.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100816689.3%
Thinking Machines Inkling Small (Reasoning, High)10010096883483.6%
Z.AI GLM 4.7100100100991883.3%
Grok 4.5 (Reasoning, Low)100100100100380.6%
Claude Sonnet 4.6 (Reasoning)100100100100080.0%
Claude Sonnet 4.6100100100100080.0%
Gemma 4 26B (Reasoning)10010075685479.4%
GPT-4o Mini (temp=0)10010091831878.4%
Gemini 2.5 Pro100100100503877.6%
Claude Opus 4100100100641976.5%
Z.AI GLM 4.610010075653875.5%
o4 Mini High10010096661174.6%
Gemini 2.5 Flash100100100372973.1%
Xiaomi MIMO v2.5 Pro10010082641472.1%
Gemini 2.5 Flash (Reasoning)10010057553870.1%
DeepSeek V4 Pro (Reasoning)10010010043068.5%
GPT-OSS 120B1009379561167.8%
Gemini 3 Flash (Preview, Reasoning)10010010038067.6%
Gemini 2.5 Flash Lite10010060491965.4%
DeepSeek V4 Flash 0731 (Reasoning, High)10010010025065.1%
Claude Sonnet 41001001000060.0%
MiniMax M2.71001001000060.0%
Grok 4.31001001000060.0%
Hermes 3 70B1001001000060.0%
Gemma 3 27B1006158561357.7%
GPT-5 Mini1008371221057.1%
DeepSeek V3.2100956724057.1%
ByteDance Seed 2.0 Mini100100739056.4%
Inception Mercury 2100797623055.7%
Gemma 4 26B846766342655.4%
Nemotron 3 Nano10083797053.9%
Aion 3.0 Mini100100680053.5%
Gemma 4 31B1001002420048.8%
Llama 3.1 70B100100430048.5%
DeepSeek V3.1864843402548.4%
Gemini 2.5 Flash Lite (Reasoning)78545250046.6%
Kimi K2.5100100200044.1%
o4 Mini100613720043.6%
Xiaomi MIMO v2.510010040040.8%
WizardLM 2 8x22b7866546040.6%
Z.AI GLM 4.7 Flash10060430040.4%
MiniMax M2.510010000040.0%
Hermes 3 405B10010000040.0%
Cohere Command R+ (Aug. 2024)10010000040.0%
Claude Haiku 4.51007600035.3%
DeepSeek V4 Flash888500034.6%
Aion 2.073502616033.1%
Laguna S 2.110040110030.1%
Z.AI GLM 4.5 Air1001900023.7%
DeepSeek-V2 Chat803600023.2%
DeepSeek V3 (2024-12-26)76700016.6%
GPT-4.178000015.7%
Qwen 3 32B67900015.1%
Z.AI GLM 4.5432400013.5%
Gemini 3.1 Flash Lite (Preview)471630013.2%
Gemma 3 12B52200010.7%
Arcee AI: Trinity Mini25240009.8%
GPT-4o, Aug. 6th (temp=1)3000006.0%
DeepSeek V4 Flash (Reasoning)2200004.4%
Mistral Large 22200004.4%
Gemini 3.1 Flash Lite (Reasoning)1900003.7%
Nemotron 3 Super1400002.8%
Mistral Large 31100002.2%
Gemini 3.1 Flash Lite300000.7%
ByteDance Seed 1.6000000.0%
Gemini 3 Flash (Preview)000000.0%
GPT-4.1 Mini000000.0%
GPT-5 Nano000000.0%
DeepSeek V3 (2025-03-24)000000.0%
Mistral Small 4 (Reasoning)000000.0%
Writer: Palmyra X5000000.0%
Qwen 3 235B A22B Instruct 2507000000.0%
GPT-4o Mini (temp=1)000000.0%
Mistral Medium 3.1000000.0%
Laguna XS 2.1000000.0%
Mistral Small 4000000.0%
Cydonia 24B V4.1000000.0%
ByteDance Seed 1.6 Flash000000.0%
Ministral 3 14B000000.0%
Ministral 3 8B000000.0%
GPT-4.1 Nano000000.0%
Gemma 3 4B000000.0%
Ministral 3 3B000000.0%
Ministral 8B000000.0%
Ministral 3B000000.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Kimi K3 (Reasoning, High)100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Kimi K2.6100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100.0%
GPT-5100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100.0%
Thinking Machines Inkling (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.1100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
MiniMax M3100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
Qwen 3.5 122B100100100100100100.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Claude Opus 4.5100100100100100100.0%
Z.AI GLM 5100100100100100100.0%
GPT-5.2100100100100100100.0%
GPT-5.5100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
Aion 3.0100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100100100100.0%
Qwen 3.7 Flash (Reasoning)100100100100100100.0%
Qwen 3.6 27B100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
DeepSeek V4 Flash 0731 (Reasoning, High)100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Claude Sonnet 4100100100100100100.0%
Claude Sonnet 5100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
Qwen 3.5 Plus (2026-02-15)100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning)100100100100100100.0%
GPT-5.4100100100100100100.0%
ByteDance Seed 2.0 Lite100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
GPT-5.4 Mini (Reasoning, Low)100100100100100100.0%
Claude Haiku 4.5100100100100100100.0%
DeepSeek V4 Pro100100100100100100.0%
Grok 4.20100100100100100100.0%
GPT-5.4 Mini100100100100100100.0%
GPT-5.4 Nano (Reasoning)100100100100100100.0%
GPT-5.4 Nano (Reasoning, Low)100100100100100100.0%
Mistral Small 3.2 24B100100100100100100.0%
Thinking Machines Inkling100100100100100100.0%
Qwen 2.5 72B100100100100100100.0%
GPT-5.4 Nano100100100100100100.0%
Mistral NeMO100100100100100100.0%
GPT-4o, Aug. 6th (temp=0)1001001001009999.8%
Gemini 3.5 Flash (Reasoning)1001001001009498.8%
ByteDance Seed 2.0 Mini100100100969497.9%
Gemma 4 31B (Reasoning)1001001001008496.8%
Gemini 2.5 Flash Lite1001001001008396.7%
Gemini 2.5 Flash1001001001008096.0%
Gemini 2.5 Flash (Reasoning)1001001001007093.9%
Gemini 2.5 Pro1001001001006893.7%
Hermes 3 405B10010099947593.5%
Grok 4.5 (Reasoning, High)1001001001005891.6%
Gemma 3 12B100100100946391.3%
Z.AI GLM 4.6100100100866690.5%
Thinking Machines Inkling Small (Reasoning, High)100100100817190.4%
Z.AI GLM 4.7 Flash100100100994789.2%
Gemma 4 26B (Reasoning)100100100796689.1%
Gemma 4 31B100100100915088.1%
Gemini 3.6 Flash (Reasoning, Minimal)1001001001003286.4%
Grok 4.31001001001002985.7%
Kimi K2.51001001001002584.9%
DeepSeek V3.2100100100851981.0%
Claude Sonnet 4.5100100100100080.0%
MiniMax M2.7100100100100080.0%
DeepSeek V4 Flash (Reasoning)10010010094078.8%
Hermes 3 70B10010010090078.0%
Gemma 3 27B100100100711877.8%
Claude Opus 410010010087077.4%
Gemini 3 Flash (Preview, Reasoning)10010068595075.3%
Gemma 4 26B10010092434075.0%
Z.AI GLM 4.7948977683673.0%
DeepSeek V3.11008977292463.8%
Xiaomi MIMO v2.51001006452063.2%
Aion 3.0 Mini10010060361161.5%
Aion 2.0100835754760.2%
o4 Mini100985250060.0%
WizardLM 2 8x22b100100932059.0%
o4 Mini High1001007412057.3%
Z.AI GLM 4.51001004935257.1%
GPT-5 Mini100964641056.5%
Llama 3.1 70B100100680053.5%
Xiaomi MIMO v2.5 Pro10092490048.1%
GPT-4o Mini (temp=0)10080530046.5%
Gemini 3.5 Flash (Reasoning, Minimal)100100300046.0%
Gemini 2.5 Flash Lite (Reasoning)83794211042.9%
Cohere Command R+ (Aug. 2024)10066440042.0%
DeepSeek V4 Flash10010000040.0%
Z.AI GLM 4.5 Air9656400038.3%
Gemini 3 Flash (Preview)64383717031.1%
Gemini 3.1 Flash Lite (Preview)776380029.8%
Inception Mercury 21004700029.3%
GPT-OSS 120B614650022.4%
DeepSeek V3 (2024-12-26)624100020.6%
Laguna S 2.1100000020.0%
Mistral Small 4100000020.0%
MiniMax M2.574000014.9%
Mistral Small 4 (Reasoning)64000012.8%
Gemini 3.1 Flash Lite (Reasoning)323000012.3%
GPT-4.157000011.4%
Ministral 3 3B51300010.8%
Qwen 3 32B3290008.2%
Nemotron 3 Nano17110005.6%
Ministral 8B2600005.2%
Gemini 3.1 Flash Lite1930004.3%
Ministral 3 14B1400002.8%
DeepSeek-V2 Chat1200002.4%
ByteDance Seed 1.6000000.0%
Mistral Large 3000000.0%
Nemotron 3 Super000000.0%
Mistral Large 2000000.0%
GPT-4.1 Mini000000.0%
GPT-4o, Aug. 6th (temp=1)000000.0%
GPT-5 Nano000000.0%
DeepSeek V3 (2025-03-24)000000.0%
Writer: Palmyra X5000000.0%
Qwen 3 235B A22B Instruct 2507000000.0%
GPT-4o Mini (temp=1)000000.0%
Mistral Medium 3.1000000.0%
Laguna XS 2.1000000.0%
Cydonia 24B V4.1000000.0%
ByteDance Seed 1.6 Flash000000.0%
Ministral 3 8B000000.0%
GPT-4.1 Nano000000.0%
Arcee AI: Trinity Mini000000.0%
Gemma 3 4B000000.0%
Ministral 3B000000.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Kimi K3 (Reasoning, High)100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Kimi K2.6100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100