Overuse of "that" (subordinate clause padding)

Test: Bad Writing Habits

Avg. Score
98.3%
Scenarios
18

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1Gemini 2.5 Flash Lite100.0%$0.00099.5s100%
2Arcee AI: Trinity Mini100.0%$0.00039.2s99%
3Mistral Small 4100.0%$0.001418.2s100%
4Inception Mercury 299.9%$0.00327.0s98%
5GPT-4.1 Mini99.9%$0.002719.0s99%
6DeepSeek V4 Flash100.0%$0.000631.6s100%
7Gemini 2.5 Flash Lite (Reasoning)100.0%$0.002830.8s100%
8Mistral Large 3100.0%$0.003330.3s100%
9GPT-4o Mini (temp=0)100.0%$0.001234.8s100%
10GPT-5.4 Nano100.0%$0.005726.3s100%
11Gemini 3.5 Flash Lite (Reasoning)99.8%$0.00356.6s96%
12Gemma 3 12B100.0%$0.000441.3s100%
13GPT-5.4 Nano (Reasoning)99.9%$0.006124.5s99%
14Muse Spark 1.1 (Reasoning, Minimal)100.0%$0.01219.2s100%
15Gemma 3 4B99.8%$0.000220.0s96%
16Writer: Palmyra X5100.0%$0.01122.0s100%
17Mistral Medium 3.1100.0%$0.004836.5s100%
18Xiaomi MIMO v2.5100.0%$0.005431.8s99%
19Mistral Small 4 (Reasoning)99.9%$0.002230.2s98%
20Gemini 3.6 Flash (Reasoning, Minimal)100.0%$0.01714.3s100%
21DeepSeek V4 Flash (Reasoning)99.8%$0.000731.1s98%
22Muse Glimmer 30B (Reasoning, Medium)100.0%$0.003843.4s100%
23Gemini 2.5 Flash (Reasoning)99.9%$0.01121.5s99%
24Qwen 3.5 Flash100.0%$0.002547.5s100%
25GPT-5.6 Luna (Reasoning)100.0%$0.01718.0s100%
26GPT-5.6 Luna99.9%$0.01515.8s99%
27Gemini 3.8 Flash (Reasoning, Medium)99.9%$0.01418.0s99%
28Gemma 3 27B100.0%$0.000652.6s100%
29o4 Mini100.0%$0.01525.7s100%
30Qwen 3.7 Flash (Reasoning)100.0%$0.001055.2s100%
31Qwen 3 32B100.0%$0.001554.6s100%
32DeepSeek V3 (2025-03-24)99.8%$0.001439.4s98%
33GPT-5.4 Nano (Reasoning, Low)99.7%$0.005520.6s96%
34Qwen 3.5 Plus (2026-02-15)99.8%$0.006031.5s98%
35Qwen 3 235B A22B Instruct 2507100.0%$0.001159.2s100%
36Gemini 3.5 Flash Lite (Reasoning, Minimal)99.5%$0.00356.3s93%
37Z.AI GLM 4.5 Air100.0%$0.002958.2s100%
38Grok 4.20100.0%$0.009345.7s100%
39DeepSeek-V2 Chat99.9%$0.002153.3s99%
40Gemma 4 26B99.9%$0.000955.1s99%
41GPT-5.4 Mini (Reasoning, Low)99.7%$0.01516.8s97%
42ByteDance Seed 1.6 Flash99.5%$0.001327.3s94%
43Qwen 3.6 Flash99.9%$0.01041.4s98%
44Gemini 3.5 Flash (Reasoning, Minimal)99.8%$0.01812.0s96%
45Grok 4.399.7%$0.006930.5s95%
46GPT-4.1100.0%$0.01844.7s100%
47Ministral 3 3B99.4%$0.000511.1s89%
48Muse Spark 1.1 (Reasoning, Medium)99.7%$0.01523.9s95%
49Aion 2.0100.0%$0.00641.3m100%
50GPT-5.4 Mini99.5%$0.01516.8s94%
51Ministral 3B99.2%$0.00018.1s88%
52DeepSeek V4 Pro100.0%$0.00481.3m99%
53Gemini 3.7 Flash (Reasoning, Medium)99.6%$0.01218.2s93%
54Qwen 3.6 35B99.8%$0.00831.0m97%
55DeepSeek V3 (2024-12-26)99.7%$0.002154.6s94%
56Laguna XS 2.199.0%$0.000314.4s88%
57Gemini 3.1 Flash Lite98.9%$0.003012.1s89%
58o4 Mini High100.0%$0.02547.2s100%
59Qwen 3.5 35B100.0%$0.0181.0m100%
60Mistral Large 299.6%$0.01329.4s93%
61Z.AI GLM 4.699.6%$0.006551.5s94%
62GPT-OSS 120B100.0%$0.00151.8m100%
63Gemini 2.5 Pro100.0%$0.03636.2s100%
64DeepSeek V3.2100.0%$0.00141.9m100%
65Gemini 3 Flash (Preview)98.9%$0.007819.6s89%
66Grok 4.5 (Reasoning, Low)99.9%$0.0181.1m97%
67GPT-5 Mini99.6%$0.010057.4s93%
68Z.AI GLM 4.799.9%$0.0101.4m98%
69Gemini 3.6 Flash (Reasoning)100.0%$0.04432.5s100%
70GPT-5.6 Terra (Reasoning)100.0%$0.04435.2s100%
71GPT-5.4 Mini (Reasoning)99.5%$0.02228.1s93%
72DeepSeek V3.199.9%$0.00201.8m98%
73GPT-4o, Aug. 6th (temp=1)99.4%$0.01824.4s91%
74Z.AI GLM 5 Turbo99.1%$0.008133.2s89%
75Gemma 4 31B99.7%$0.00101.6m96%
76Z.AI GLM 4.7 Flash99.3%$0.00171.2m92%
77GPT-5.6 Terra100.0%$0.04636.9s100%
78Aion 3.099.8%$0.0241.0m97%
79Qwen 3.5 27B100.0%$0.0201.6m100%
80DeepSeek V4.1 Flash (Reasoning, High)98.9%$0.002935.4s86%
81Muse Spark 1.2 (Reasoning, Medium)99.2%$0.01838.3s91%
82Qwen 2.5 72B98.8%$0.001036.7s84%
83GPT-4o Mini (temp=1)98.8%$0.001234.8s83%
84Z.AI GLM 4.598.4%$0.005142.1s87%
85Qwen 3.5 Plus (2026-04-20)99.9%$0.0171.8m97%
86Aion 3.0 Mini98.9%$0.00531.2m89%
87Xiaomi MIMO v2.5 Pro99.0%$0.008553.5s87%
88Qwen 3.5 9B99.4%$0.00111.4m88%
89Gemma 4 26B (Reasoning)99.7%$0.00132.0m94%
90Z.AI GLM 5.2 (Reasoning, High)98.8%$0.0111.0m89%
91GPT-4.1 Nano97.4%$0.000713.3s81%
92Gemini 3.1 Flash Lite (Preview)97.4%$0.00308.4s81%
93Gemma 4 31B (Reasoning)99.5%$0.00142.2m94%
94Qwen 3.5 122B99.3%$0.0251.1m91%
95Gemini 3 Flash (Preview, Reasoning)99.0%$0.01230.1s81%
96Ministral 8B97.9%$0.000410.4s77%
97Gemini 3.5 Flash (Reasoning)100.0%$0.07137.6s100%
98Gemini 3.1 Flash Lite (Reasoning)97.4%$0.003011.9s79%
99GPT-5.4100.0%$0.0491.4m100%
100MiniMax M2.598.4%$0.00341.3m86%
101Qwen 3.6 27B100.0%$0.0252.3m100%
102Muse Spark 1.3 (Reasoning, Medium)99.7%$0.0251.8m95%
103Cydonia 24B V4.198.3%$0.001444.8s80%
104Z.AI GLM 598.8%$0.00841.2m85%
105Ministral 3 14B97.7%$0.000711.7s74%
106GPT-5.4 (Reasoning, Low)100.0%$0.0551.4m99%
107MiniMax M2.798.3%$0.00401.1m83%
108GPT-5.2100.0%$0.0561.5m100%
109Qwen 3.8 Flash (Reasoning)99.9%$0.00643.1m99%
110Z.AI GLM 5.3 Flash (Reasoning, Low)98.2%$0.00051.1m81%
111Grok 4.5 (Reasoning, High)99.4%$0.0301.6m92%
112Gemini 2.5 Flash97.8%$0.005210.6s73%
113GPT-5.1100.0%$0.0541.8m100%
114Claude Sonnet 4.598.5%$0.03538.1s84%
115Grok 4.6 (Reasoning, High)100.0%$0.0422.5m100%
116Qwen 3.5 397B A17B99.7%$0.0143.0m95%
117Z.AI GLM 5.198.3%$0.0141.5m84%
118Mistral NeMO96.4%$0.000510.1s69%
119Claude Opus 4.599.1%$0.07053.4s90%
120Grok 4.20 (Reasoning)98.7%$0.0181.5m79%
121Thinking Machines Inkling97.6%$0.00751.5m79%
122Ministral 3 8B96.2%$0.000819.6s68%
123Kimi K3 (Reasoning, Low)97.4%$0.0281.1m83%
124Claude Sonnet 497.3%$0.03243.7s80%
125DeepSeek V4 Pro 0813 (Reasoning, High)98.7%$0.0251.8m83%
126Qwen 3.7 Max100.0%$0.0682.3m100%
127GPT-5.6 Sol100.0%$0.1051.2m100%
128GPT-5.6 Sol (Reasoning)100.0%$0.1081.2m100%
129Hermes 3 405B96.7%$0.003253.2s70%
130DeepSeek V4 Flash 0731 (Reasoning, High)98.2%$0.00222.6m82%
131Claude Opus 4.6 (Reasoning)99.7%$0.0881.4m95%
132Claude Opus 4.7 (Reasoning)98.7%$0.07632.0s85%
133Nemotron 3 Super97.0%$0.00001.4m72%
134Nemotron 3 Nano96.0%$0.00101.1m72%
135GPT-5100.0%$0.0652.8m100%
136Cohere Command R+ (Aug. 2024)97.1%$0.02052.5s72%
137WizardLM 2 8x22b97.0%$0.00261.8m76%
138Qwen 3.6 Max Preview100.0%$0.0503.5m100%
139MiniMax M397.9%$0.00603.1m84%
140GPT-5.4 (Reasoning)100.0%$0.0892.6m100%
141Laguna S 2.193.5%$0.000522.1s65%
142DeepSeek V4 Pro (Reasoning)98.6%$0.0153.1m80%
143Grok 4.3 (Reasoning)98.0%$0.0212.3m76%
144Claude Opus 4.797.4%$0.06930.4s76%
145Hermes 3 70B95.3%$0.00101.2m66%
146Claude Opus 597.5%$0.08250.1s83%
147Kimi K2.598.6%$0.0193.2m81%
148Claude Opus 5 (Reasoning, Low)98.7%$0.0971.0m86%
149Claude Opus 4.698.1%$0.0781.2m83%
150GPT-4o, Aug. 6th (temp=0)95.0%$0.02322.7s64%
151Claude Haiku 4.593.9%$0.01121.6s63%
152Gemini 3.1 Pro (Preview)99.5%$0.1071.8m91%
153GPT-5.5100.0%$0.1391.7m100%
154Claude Opus 4.8 (Reasoning)96.9%$0.07141.7s74%
155Claude Sonnet 4.694.5%$0.03139.3s67%
156GPT-5.5 (Reasoning, Low)100.0%$0.1391.8m100%
157GPT-5.5 (Reasoning)100.0%$0.1421.8m100%
158Claude Opus 4.8 (Reasoning, Low)96.7%$0.07141.9s73%
159 Kimi K3 (Reasoning, High)96.7%$0.0441.8m74%
160Claude Sonnet 4.6 (Reasoning)96.2%$0.0601.2m74%
161Qwen 3.8 27B (Reasoning, XHigh)99.5%$0.0404.7m91%
162GPT-5 Nano92.4%$0.00421.4m61%
163Z.AI GLM 5.3 Flash (Reasoning, Max)98.8%$0.00316.5m89%
164Claude Sonnet 591.6%$0.02733.5s59%
165Claude Opus 5 (Reasoning)96.2%$0.0981.0m73%
166Claude Sonnet 5 (Reasoning)91.7%$0.03038.9s56%
167Hy4 Preview (Reasoning, High)97.8%$0.0404.4m77%
168Kimi K2.699.9%$0.0586.5m98%
169Claude Opus 499.8%$0.2091.4m97%
170Qwen 3.8 Max (Reasoning, XHigh)99.7%$0.0835.9m94%
171Claude Sonnet 5 (Reasoning, Low)90.4%$0.03138.4s49%
172Thinking Machines Inkling (Reasoning)95.8%$0.0255.1m66%
173Llama 3.1 70B84.8%$0.001529.4s36%
174ByteDance Seed 1.688.5%$0.0132.5m47%
175Z.AI GLM 5.3 (Reasoning, Max)98.1%$0.0667.3m84%
176Thinking Machines Inkling Small (Reasoning, High)83.7%$0.00881.7m38%
177ByteDance Seed 2.0 Lite81.4%$0.0122.2m35%
178ByteDance Seed 2.0 Mini79.8%$0.00454.9m28%
179Mistral Small 3.2 24B78.0%$0.00695.7m23%
98.32%

Individual Scenarios

Detailed Writing Rules

Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, High)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Kimi K3 (Reasoning, High)100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Kimi K2.6100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
GPT-5100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
GPT-5 Mini100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100.0%
Kimi K2.5100100100100100100.0%
Thinking Machines Inkling (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.1100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
MiniMax M3100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
Qwen 3.5 122B100100100100100100.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
Gemini 3 Flash (Preview, Reasoning)100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Gemma 4 31B (Reasoning)100100100100100100.0%
Claude Opus 4.5100100100100100100.0%
Z.AI GLM 5100100100100100100.0%
ByteDance Seed 1.6100100100100100100.0%
GPT-5.2100100100100100100.0%
GPT-5.5100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100.0%
Gemma 4 26B (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
Aion 3.0100100100100100100.0%
o4 Mini High100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100100100100.0%
Qwen 3.7 Flash (Reasoning)100100100100100100.0%
Gemini 2.5 Pro100100100100100100.0%
Qwen 3.6 27B100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
DeepSeek V4 Flash (Reasoning)100100100100100100.0%
DeepSeek V4 Flash 0731 (Reasoning, High)100100100100100100.0%
Z.AI GLM 4.7100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Z.AI GLM 4.6100100100100100100.0%
Claude Sonnet 4100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Claude Sonnet 5100100100100100100.0%
Claude Opus 4100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
GPT-4.1100100100100100100.0%
MiniMax M2.5100100100100100100.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100100.0%
Aion 2.0100100100100100100.0%
o4 Mini100100100100100100.0%
MiniMax M2.7100100100100100100.0%
Qwen 3.5 Plus (2026-02-15)100100100100100100.0%
Xiaomi MIMO v2.5 Pro100100100100100100.0%
Gemini 3.1 Flash Lite (Reasoning)100100100100100100.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100100100100.0%
ByteDance Seed 2.0 Mini100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
Gemini 3 Flash (Preview)100100100100100100.0%
Gemini 3.1 Flash Lite (Preview)100100100100100100.0%
Gemma 4 31B100100100100100100.0%
Gemini 3.1 Flash Lite100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Z.AI GLM 4.5100100100100100100.0%
Gemma 4 26B100100100100100100.0%
GPT-OSS 120B100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning)100100100100100100.0%
GPT-5.4100100100100100100.0%
Mistral Large 3100100100100100100.0%
ByteDance Seed 2.0 Lite100100100100100100.0%
Gemini 2.5 Flash (Reasoning)100100100100100100.0%
DeepSeek-V2 Chat100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
Xiaomi MIMO v2.5100100100100100100.0%
Aion 3.0 Mini100100100100100100.0%
GPT-5.4 Mini (Reasoning, Low)100100100100100100.0%
Claude Haiku 4.5100100100100100100.0%
Gemini 2.5 Flash Lite (Reasoning)100100100100100100.0%
DeepSeek V3 (2024-12-26)100100100100100100.0%
DeepSeek V3.1100100100100100100.0%
DeepSeek V3.2100100100100100100.0%
Z.AI GLM 4.7 Flash100100100100100100.0%
GPT-4o, Aug. 6th (temp=0)100100100100100100.0%
DeepSeek V4 Pro100100100100100100.0%
DeepSeek V4 Flash100100100100100100.0%
Inception Mercury 2100100100100100100.0%
Nemotron 3 Super100100100100100100.0%
Mistral Large 2100100100100100100.0%
GPT-4.1 Mini100100100100100100.0%
GPT-4o, Aug. 6th (temp=1)100100100100100100.0%
Grok 4.20100100100100100100.0%
Hermes 3 405B100100100100100100.0%
Z.AI GLM 4.5 Air100100100100100100.0%
Gemini 2.5 Flash100100100100100100.0%
GPT-5.4 Mini100100100100100100.0%
GPT-5 Nano100100100100100100.0%
GPT-5.4 Nano (Reasoning)100100100100100100.0%
DeepSeek V3 (2025-03-24)100100100100100100.0%
Gemini 2.5 Flash Lite100100100100100100.0%
Mistral Small 4 (Reasoning)100100100100100100.0%
Qwen 3 32B100100100100100100.0%
Writer: Palmyra X5100100100100100100.0%
Qwen 3 235B A22B Instruct 2507100100100100100100.0%
Grok 4.3100100100100100100.0%
GPT-4o Mini (temp=1)100100100100100100.0%
GPT-5.4 Nano (Reasoning, Low)100100100100100100.0%
GPT-4o Mini (temp=0)100100100100100100.0%
Mistral Medium 3.1100100100100100100.0%
Gemma 3 12B100100100100100100.0%
Gemma 3 27B100100100100100100.0%
Laguna XS 2.1100100100100100100.0%
Mistral Small 4100100100100100100.0%
Nemotron 3 Nano100100100100100100.0%
Thinking Machines Inkling100100100100100100.0%
Qwen 2.5 72B100100100100100100.0%
Cydonia 24B V4.1100100100100100100.0%
GPT-5.4 Nano100100100100100100.0%
WizardLM 2 8x22b100100100100100100.0%
ByteDance Seed 1.6 Flash100100100100100100.0%
Ministral 3 14B100100100100100100.0%
Ministral 3 8B100100100100100100.0%
GPT-4.1 Nano100100100100100100.0%
Hermes 3 70B100100100100100100.0%
Gemma 3 4B100100100100100100.0%
Ministral 3 3B100100100100100100.0%
Ministral 8B100100100100100100.0%
Ministral 3B100100100100100100.0%
Arcee AI: Trinity Mini1001001001009799.4%
Claude Sonnet 5 (Reasoning, Low)1001001001009699.1%
Claude Opus 4.8 (Reasoning, Low)1001001001009599.0%
Laguna S 2.1100100100928695.6%
Cohere Command R+ (Aug. 2024)1001001001007595.1%
Llama 3.1 70B100100100100080.0%
Mistral NeMO100100100100080.0%
Thinking Machines Inkling Small (Reasoning, High)10010010033066.7%
Mistral Small 3.2 24B100100480049.5%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, High)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Kimi K2.6100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100.0%
GPT-5100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
GPT-5 Mini100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Kimi K2.5100100100100100100.0%
Thinking Machines Inkling (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.1100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
MiniMax M3100100100100100100.0%
Qwen 3.5 122B100100100100100100.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Gemini 3 Flash (Preview, Reasoning)100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Gemma 4 31B (Reasoning)100100100100100100.0%
Claude Opus 4.5100100100100100100.0%
Z.AI GLM 5100100100100100100.0%
ByteDance Seed 1.6100100100100100100.0%
GPT-5.2100100100100100100.0%
GPT-5.5100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100.0%
Gemma 4 26B (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
Aion 3.0100100100100100100.0%
o4 Mini High100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100100100100.0%
Qwen 3.7 Flash (Reasoning)100100100100100100.0%
Gemini 2.5 Pro100100100100100100.0%
Qwen 3.6 27B100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
DeepSeek V4 Flash (Reasoning)100100100100100100.0%
DeepSeek V4 Flash 0731 (Reasoning, High)100100100100100100.0%
Z.AI GLM 4.7100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Z.AI GLM 4.6100100100100100100.0%
Claude Sonnet 4100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Thinking Machines Inkling Small (Reasoning, High)100100100100100100.0%
Claude Sonnet 5100100100100100100.0%
Claude Opus 4100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
GPT-4.1100100100100100100.0%
MiniMax M2.5100100100100100100.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100100.0%
Aion 2.0100100100100100100.0%
o4 Mini100100100100100100.0%
MiniMax M2.7100100100100100100.0%
Qwen 3.5 Plus (2026-02-15)100100100100100100.0%
Xiaomi MIMO v2.5 Pro100100100100100100.0%
Gemini 3.1 Flash Lite (Reasoning)100100100100100100.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
Gemini 3 Flash (Preview)100100100100100100.0%
Gemini 3.1 Flash Lite (Preview)100100100100100100.0%
Gemma 4 31B100100100100100100.0%
Gemini 3.1 Flash Lite100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Z.AI GLM 4.5100100100100100100.0%
Gemma 4 26B100100100100100100.0%
GPT-OSS 120B100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning)100100100100100100.0%
GPT-5.4100100100100100100.0%
Mistral Large 3100100100100100100.0%
DeepSeek-V2 Chat100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
Xiaomi MIMO v2.5100100100100100100.0%
Aion 3.0 Mini100100100100100100.0%
GPT-5.4 Mini (Reasoning, Low)100100100100100100.0%
Gemini 2.5 Flash Lite (Reasoning)100100100100100100.0%
DeepSeek V3 (2024-12-26)100100100100100100.0%
DeepSeek V3.1100100100100100100.0%
DeepSeek V3.2100100100100100100.0%
Z.AI GLM 4.7 Flash100100100100100100.0%
GPT-4o, Aug. 6th (temp=0)100100100100100100.0%
DeepSeek V4 Pro100100100100100100.0%
DeepSeek V4 Flash100100100100100100.0%
Inception Mercury 2100100100100100100.0%
Nemotron 3 Super100100100100100100.0%
GPT-4.1 Mini100100100100100100.0%
GPT-4o, Aug. 6th (temp=1)100100100100100100.0%
Grok 4.20100100100100100100.0%
Hermes 3 405B100100100100100100.0%
Z.AI GLM 4.5 Air100100100100100100.0%
Gemini 2.5 Flash100100100100100100.0%
GPT-5.4 Mini100100100100100100.0%
GPT-5.4 Nano (Reasoning)100100100100100100.0%
DeepSeek V3 (2025-03-24)100100100100100100.0%
Gemini 2.5 Flash Lite100100100100100100.0%
Mistral Small 4 (Reasoning)100100100100100100.0%
Qwen 3 32B100100100100100100.0%
Writer: Palmyra X5100100100100100100.0%
Qwen 3 235B A22B Instruct 2507100100100100100100.0%
Grok 4.3100100100100100100.0%
GPT-4o Mini (temp=1)100100100100100100.0%
GPT-5.4 Nano (Reasoning, Low)100100100100100100.0%
GPT-4o Mini (temp=0)100100100100100100.0%
Mistral Medium 3.1100100100100100100.0%
Gemma 3 12B100100100100100100.0%
Gemma 3 27B100100100100100100.0%
Laguna XS 2.1100100100100100100.0%
Mistral Small 4100100100100100100.0%
Nemotron 3 Nano100100100100100100.0%
GPT-5.4 Nano100100100100100100.0%
WizardLM 2 8x22b100100100100100100.0%
ByteDance Seed 1.6 Flash100100100100100100.0%
Ministral 3 14B100100100100100100.0%
Ministral 3 8B100100100100100100.0%
GPT-4.1 Nano100100100100100100.0%
Arcee AI: Trinity Mini100100100100100100.0%
Cohere Command R+ (Aug. 2024)100100100100100100.0%
Gemma 3 4B100100100100100100.0%
Ministral 3 3B100100100100100100.0%
Ministral 8B100100100100100100.0%
Ministral 3B100100100100100100.0%
Claude Sonnet 5 (Reasoning)1001001001009999.7%
Mistral Large 21001001001009999.7%
DeepSeek V4.1 Flash (Reasoning, High)1001001001009899.6%
Gemini 3.8 Flash (Reasoning, Medium)1001001001009699.1%
Gemini 2.5 Flash (Reasoning)1001001001009598.9%
Grok 4.20 (Reasoning)1001001001009398.6%
Mistral NeMO1001001001009298.4%
Cydonia 24B V4.11001001001009198.3%
Claude Opus 4.61001001001009098.1%
Z.AI GLM 5.3 Flash (Reasoning, Max)1001001001009097.9%
Laguna S 2.11001001001008797.5%
Claude Haiku 4.51001001001008797.3%
Hy4 Preview (Reasoning, High)1001001001008496.8%
Claude Sonnet 4.6 (Reasoning)1001001001007595.0%
GPT-5 Nano100100100987093.6%
Thinking Machines Inkling1001001001006492.8%
Claude Sonnet 4.61001001001006092.1%
Kimi K3 (Reasoning, Low)1001001001005490.9%
Qwen 2.5 72B1001001001005390.6%
Grok 4.3 (Reasoning)1001001001005089.9%
ByteDance Seed 2.0 Mini1001001001005089.9%
Claude Opus 5 (Reasoning)1001001001004789.3%
Claude Opus 5100100100766387.7%
Llama 3.1 70B100100100795686.9%
Kimi K3 (Reasoning, High)1001001001001182.2%
Claude Sonnet 5 (Reasoning, Low)1001001001001082.0%
Mistral Small 3.2 24B100100100100080.0%
Hermes 3 70B10010010083076.7%
ByteDance Seed 2.0 Lite10010000040.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, High)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Kimi K2.6100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100.0%
GPT-5100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
GPT-5 Mini100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100.0%
Kimi K2.5100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.1100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
MiniMax M3100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
Gemini 3 Flash (Preview, Reasoning)100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Gemma 4 31B (Reasoning)100100100100100100.0%
Z.AI GLM 5100100100100100100.0%
GPT-5.2100100100100100100.0%
GPT-5.5100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100.0%
Gemma 4 26B (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
Aion 3.0100100100100100100.0%
o4 Mini High100100100100100100.0%
Qwen 3.7 Flash (Reasoning)100100100100100100.0%
Gemini 2.5 Pro100100100100100100.0%
Qwen 3.6 27B100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
DeepSeek V4 Flash (Reasoning)100100100100100100.0%
DeepSeek V4 Flash 0731 (Reasoning, High)100100100100100100.0%
Z.AI GLM 4.7100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Z.AI GLM 4.6100100100100100100.0%
Claude Sonnet 4100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Claude Sonnet 5100100100100100100.0%
Claude Opus 4100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
GPT-4.1100100100100100100.0%
MiniMax M2.5100100100100100100.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100100.0%
Aion 2.0100100100100100100.0%
o4 Mini100100100100100100.0%
MiniMax M2.7100100100100100100.0%
Qwen 3.5 Plus (2026-02-15)100100100100100100.0%
Gemini 3.1 Flash Lite (Reasoning)100100100100100100.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
Gemini 3 Flash (Preview)100100100100100100.0%
Gemini 3.1 Flash Lite (Preview)100100100100100100.0%
Gemma 4 31B100100100100100100.0%
Gemini 3.1 Flash Lite100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Z.AI GLM 4.5100100100100100100.0%
Gemma 4 26B100100100100100100.0%
GPT-OSS 120B100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning)100100100100100100.0%
GPT-5.4100100100100100100.0%
Mistral Large 3100100100100100100.0%
Gemini 2.5 Flash (Reasoning)100100100100100100.0%
DeepSeek-V2 Chat100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
Xiaomi MIMO v2.5100100100100100100.0%
Aion 3.0 Mini100100100100100100.0%
GPT-5.4 Mini (Reasoning, Low)100100100100100100.0%
Gemini 2.5 Flash Lite (Reasoning)100100100100100100.0%
DeepSeek V3 (2024-12-26)100100100100100100.0%
DeepSeek V3.1100100100100100100.0%
DeepSeek V3.2100100100100100100.0%
Z.AI GLM 4.7 Flash100100100100100100.0%
GPT-4o, Aug. 6th (temp=0)100100100100100100.0%
DeepSeek V4 Pro100100100100100100.0%
DeepSeek V4 Flash100100100100100100.0%
Inception Mercury 2100100100100100100.0%
Nemotron 3 Super100100100100100100.0%
Mistral Large 2100100100100100100.0%
GPT-4.1 Mini100100100100100100.0%
GPT-4o, Aug. 6th (temp=1)100100100100100100.0%
Grok 4.20100100100100100100.0%
Hermes 3 405B100100100100100100.0%
Z.AI GLM 4.5 Air100100100100100100.0%
Gemini 2.5 Flash100100100100100100.0%
GPT-5.4 Mini100100100100100100.0%
GPT-5.4 Nano (Reasoning)100100100100100100.0%
Gemini 2.5 Flash Lite100100100100100100.0%
Mistral Small 4 (Reasoning)100100100100100100.0%
Qwen 3 32B100100100100100100.0%
Writer: Palmyra X5100100100100100100.0%
Qwen 3 235B A22B Instruct 2507100100100100100100.0%
Grok 4.3100100100100100100.0%
GPT-4o Mini (temp=1)100100100100100100.0%
GPT-5.4 Nano (Reasoning, Low)100100100100100100.0%
Llama 3.1 70B100100100100100100.0%
GPT-4o Mini (temp=0)100100100100100100.0%
Mistral Medium 3.1100100100100100100.0%
Gemma 3 12B100100100100100100.0%
Gemma 3 27B100100100100100100.0%
Laguna XS 2.1100100100100100100.0%
Mistral Small 4100100100100100100.0%
Nemotron 3 Nano100100100100100100.0%
Thinking Machines Inkling100100100100100100.0%
Qwen 2.5 72B100100100100100100.0%
Cydonia 24B V4.1100100100100100100.0%
GPT-5.4 Nano100100100100100100.0%
WizardLM 2 8x22b100100100100100100.0%
ByteDance Seed 1.6 Flash100100100100100100.0%
Ministral 3 14B100100100100100100.0%
Hermes 3 70B100100100100100100.0%
Arcee AI: Trinity Mini100100100100100100.0%
Cohere Command R+ (Aug. 2024)100100100100100100.0%
Gemma 3 4B100100100100100100.0%
Ministral 3 3B100100100100100100.0%
Mistral NeMO100100100100100100.0%
Ministral 8B100100100100100100.0%
Ministral 3B100100100100100100.0%
ByteDance Seed 2.0 Lite1001001001009999.7%
Muse Spark 1.1 (Reasoning, Medium)1001001001009899.6%
Thinking Machines Inkling (Reasoning)1001001001009599.0%
Kimi K3 (Reasoning, Low)1001001001009498.8%
DeepSeek V3 (2025-03-24)1001001001009398.7%
ByteDance Seed 2.0 Mini1001001001008897.6%
Gemini 3.5 Flash Lite (Reasoning, Minimal)1001001001008396.7%
GPT-4.1 Nano1001001001008396.7%
Z.AI GLM 5.3 Flash (Reasoning, Low)1001001001008096.0%
Qwen 3.5 122B1001001001007995.8%
Ministral 3 8B1001001001007895.7%
Z.AI GLM 5.3 (Reasoning, Max)1001001001007394.7%
Laguna S 2.11001001001007194.3%
Mistral Small 3.2 24B100