"Not X but Y" pattern overuse

Test: Bad Writing Habits

Avg. Score
86.7%
Scenarios
18

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1Qwen 2.5 72B99.6%$0.001036.7s95%
2GPT-4o Mini (temp=0)99.6%$0.001234.8s93%
3Gemini 3.5 Flash (Reasoning, Minimal)99.3%$0.01812.0s92%
4o4 Mini High100.0%$0.02547.2s100%
5Mistral NeMO98.0%$0.000510.1s77%
6Llama 3.1 70B98.1%$0.001529.4s81%
7Hermes 3 405B98.6%$0.003253.2s82%
8GPT-4o, Aug. 6th (temp=0)98.6%$0.02322.7s84%
9Gemini 3 Flash (Preview, Reasoning)97.3%$0.01230.1s79%
10Gemini 3 Flash (Preview)96.5%$0.007819.6s75%
11Grok 4.2097.4%$0.009345.7s78%
12ByteDance Seed 2.0 Lite99.7%$0.0122.2m96%
13GPT-4o Mini (temp=1)97.0%$0.001234.8s71%
14GPT-5.6 Luna97.1%$0.01515.8s71%
15Hermes 3 70B96.8%$0.00101.2m76%
16Grok 4.5 (Reasoning, Low)97.9%$0.0181.1m81%
17DeepSeek V4.1 Flash (Reasoning, High)96.0%$0.002935.4s69%
18Muse Glimmer 30B (Reasoning, Medium)96.4%$0.003843.4s70%
19Gemini 3.5 Flash Lite (Reasoning)94.0%$0.00356.6s61%
20o4 Mini96.1%$0.01525.7s68%
21Muse Spark 1.3 (Reasoning, Medium)98.9%$0.0251.8m87%
22GPT-5.6 Luna (Reasoning)95.4%$0.01718.0s66%
23Qwen 3.6 35B96.7%$0.00831.0m69%
24GPT-5.6 Terra97.3%$0.04636.9s79%
25Qwen 3.7 Flash (Reasoning)94.8%$0.001055.2s64%
26Grok 4.393.6%$0.006930.5s61%
27Gemini 3.7 Flash (Reasoning, Medium)94.4%$0.01218.2s59%
28Gemini 3.6 Flash (Reasoning, Minimal)93.7%$0.01714.3s61%
29Gemini 3.5 Flash Lite (Reasoning, Minimal)93.0%$0.00356.3s53%
30Gemini 3.8 Flash (Reasoning, Medium)93.6%$0.01418.0s57%
31Qwen 3.6 Flash93.4%$0.01041.4s59%
32Mistral Large 293.5%$0.01329.4s57%
33GPT-5.6 Terra (Reasoning)96.3%$0.04435.2s70%
34Ministral 8B90.7%$0.000410.4s49%
35Kimi K3 (Reasoning, Low)96.6%$0.0281.1m68%
36Grok 4.6 (Reasoning, High)99.3%$0.0422.5m90%
37Grok 4.5 (Reasoning, High)96.3%$0.0301.6m75%
38Grok 4.20 (Reasoning)96.1%$0.0181.5m68%
39Inception Mercury 290.3%$0.00327.0s47%
40Qwen 3.5 Plus (2026-04-20)95.8%$0.0171.8m71%
41Z.AI GLM 5.3 Flash (Reasoning, Low)93.0%$0.00051.1m56%
42Ministral 3 14B89.6%$0.000711.7s47%
43Gemini 3.6 Flash (Reasoning)95.6%$0.04432.5s65%
44Qwen 3.5 27B95.6%$0.0201.6m69%
45GPT-5.4 Mini (Reasoning)93.2%$0.02228.1s56%
46Z.AI GLM 4.793.7%$0.0101.4m61%
47Gemini 3.5 Flash (Reasoning)96.9%$0.07137.6s76%
48Qwen 3.5 9B92.5%$0.00111.4m57%
49Qwen 3.7 Max99.7%$0.0682.3m94%
50Gemma 4 31B (Reasoning)95.7%$0.00142.2m64%
51Qwen 3.5 Flash91.7%$0.002547.5s50%
52DeepSeek V3 (2024-12-26)91.9%$0.002154.6s51%
53Muse Spark 1.1 (Reasoning, Medium)90.9%$0.01523.9s51%
54GPT-OSS 120B93.0%$0.00151.8m61%
55Gemini 3.1 Flash Lite (Reasoning)88.4%$0.003011.9s45%
56Gemma 3 12B91.4%$0.000441.3s47%
57Muse Spark 1.1 (Reasoning, Minimal)90.0%$0.01219.2s49%
58Mistral Large 390.1%$0.003330.3s47%
59DeepSeek V4 Flash90.1%$0.000631.6s45%
60ByteDance Seed 1.697.2%$0.0132.5m70%
61Cohere Command R+ (Aug. 2024)92.4%$0.02052.5s56%
62Aion 3.0 Mini91.0%$0.00531.2m54%
63Gemma 4 26B88.4%$0.000955.1s51%
64Gemini 3.1 Flash Lite (Preview)87.0%$0.00308.4s41%
65Ministral 3 8B88.1%$0.000819.6s41%
66Qwen 3.5 122B94.2%$0.0251.1m56%
67Gemini 3.1 Pro (Preview)99.9%$0.1071.8m98%
68Gemini 3.1 Flash Lite87.6%$0.003012.1s38%
69Z.AI GLM 4.589.1%$0.005142.1s43%
70Z.AI GLM 5 Turbo88.3%$0.008133.2s44%
71Gemma 4 31B90.5%$0.00101.6m53%
72Qwen 3.6 Max Preview99.3%$0.0503.5m93%
73Mistral Small 3.2 24B100.0%$0.00695.7m100%
74GPT-5.4 Mini (Reasoning, Low)87.6%$0.01516.8s42%
75Z.AI GLM 4.7 Flash88.9%$0.00171.2m47%
76ByteDance Seed 2.0 Mini98.9%$0.00454.9m89%
77GPT-5.4 Mini86.5%$0.01516.8s43%
78DeepSeek V4 Flash (Reasoning)87.2%$0.000731.1s38%
79DeepSeek-V2 Chat88.4%$0.002153.3s42%
80Gemma 4 26B (Reasoning)91.9%$0.00132.0m53%
81Ministral 3B84.2%$0.00018.1s35%
82Qwen 3.6 27B95.8%$0.0252.3m63%
83Grok 4.3 (Reasoning)94.2%$0.0212.3m62%
84Claude Opus 595.5%$0.08250.1s69%
85Qwen 3.5 Plus (2026-02-15)82.1%$0.006031.5s42%
86GPT-4.1 Nano84.7%$0.000713.3s32%
87Z.AI GLM 589.0%$0.00841.2m44%
88Qwen 3.5 35B90.0%$0.0181.0m44%
89GPT-5.6 Sol97.6%$0.1051.2m79%
90Ministral 3 3B82.7%$0.000511.1s32%
91GPT-5.4 Nano (Reasoning)83.0%$0.006124.5s37%
92Mistral Medium 3.185.5%$0.004836.5s36%
93Muse Spark 1.2 (Reasoning, Medium)86.9%$0.01838.3s41%
94GPT-4o, Aug. 6th (temp=1)87.1%$0.01824.4s37%
95MiniMax M2.786.3%$0.00401.1m41%
96MiniMax M2.587.5%$0.00341.3m40%
97GPT-5.6 Sol (Reasoning)98.0%$0.1081.2m77%
98DeepSeek V4 Pro86.0%$0.00481.3m40%
99GPT-4.1 Mini82.0%$0.002719.0s30%
100GPT-5.192.4%$0.0541.8m62%
101Z.AI GLM 5.188.6%$0.0141.5m43%
102Claude Sonnet 587.7%$0.02733.5s37%
103Qwen 3.5 397B A17B92.9%$0.0143.0m58%
104Claude Sonnet 5 (Reasoning)87.9%$0.03038.9s39%
105Mistral Small 4 (Reasoning)81.2%$0.002230.2s31%
106Qwen 3 32B83.0%$0.001554.6s33%
107GPT-5.4 Nano (Reasoning, Low)80.5%$0.005520.6s30%
108WizardLM 2 8x22b85.6%$0.00261.8m41%
109Claude Opus 5 (Reasoning)96.0%$0.0981.0m62%
110Z.AI GLM 4.682.9%$0.006551.5s32%
111MiniMax M390.9%$0.00603.1m53%
112Claude Opus 4.8 (Reasoning)91.2%$0.07141.7s49%
113Laguna S 2.176.6%$0.000522.1s28%
114Gemma 3 27B81.9%$0.000652.6s28%
115Gemma 3 4B78.3%$0.000220.0s25%
116Arcee AI: Trinity Mini74.9%$0.00039.2s26%
117Claude Opus 5 (Reasoning, Low)95.0%$0.0971.0m60%
118DeepSeek V3 (2025-03-24)81.5%$0.001439.4s25%
119Gemini 2.5 Pro83.6%$0.03636.2s37%
120 Kimi K3 (Reasoning, High)90.6%$0.0441.8m49%
121Claude Sonnet 4.584.3%$0.03538.1s34%
122Claude Opus 4.7 (Reasoning)90.0%$0.07632.0s46%
123ByteDance Seed 1.6 Flash75.9%$0.001327.3s25%
124DeepSeek V3.182.8%$0.00201.8m35%
125Claude Sonnet 5 (Reasoning, Low)84.6%$0.03138.4s31%
126GPT-5.4 Nano77.8%$0.005726.3s23%
127Claude Haiku 4.577.7%$0.01121.6s24%
128Claude Opus 4.8 (Reasoning, Low)88.3%$0.07141.9s44%
129Claude Sonnet 483.6%$0.03243.7s31%
130Qwen 3 235B A22B Instruct 250777.7%$0.001159.2s26%
131GPT-5.4 (Reasoning, Low)87.8%$0.0551.4m45%
132Claude Opus 4.788.0%$0.06930.4s39%
133Claude Opus 4.588.2%$0.07053.4s44%
134Aion 3.081.1%$0.0241.0m32%
135Z.AI GLM 4.5 Air77.1%$0.002958.2s25%
136GPT-4.179.3%$0.01844.7s26%
137Gemini 2.5 Flash Lite72.2%$0.00099.5s18%
138Cydonia 24B V4.176.2%$0.001444.8s21%
139Laguna XS 2.173.9%$0.000314.4s16%
140Mistral Small 471.2%$0.001418.2s19%
141Gemini 2.5 Flash70.9%$0.005210.6s19%
142GPT-5.485.3%$0.0491.4m41%
143Qwen 3.8 Flash (Reasoning)85.8%$0.00643.1m42%
144DeepSeek V4 Flash 0731 (Reasoning, High)82.9%$0.00222.6m36%
145Nemotron 3 Nano76.2%$0.00101.1m23%
146Claude Sonnet 4.680.4%$0.03139.3s26%
147Xiaomi MIMO v2.569.8%$0.005431.8s21%
148Z.AI GLM 5.2 (Reasoning, High)75.9%$0.0111.0m23%
149Writer: Palmyra X570.8%$0.01122.0s16%
150Hy4 Preview (Reasoning, High)93.4%$0.0404.4m56%
151Z.AI GLM 5.3 Flash (Reasoning, Max)95.6%$0.00316.5m64%
152GPT-5 Mini69.0%$0.010057.4s19%
153GPT-589.3%$0.0652.8m47%
154GPT-5.4 (Reasoning)89.6%$0.0892.6m54%
155Xiaomi MIMO v2.5 Pro68.7%$0.008553.5s14%
156Claude Opus 4.681.3%$0.0781.2m37%
157DeepSeek V3.271.2%$0.00141.9m21%
158Claude Opus 4.6 (Reasoning)84.8%$0.0881.4m38%
159Aion 2.066.0%$0.00641.3m18%
160DeepSeek V4 Pro (Reasoning)79.2%$0.0153.1m31%
161DeepSeek V4 Pro 0813 (Reasoning, High)76.0%$0.0251.8m21%
162Gemini 2.5 Flash (Reasoning)60.8%$0.01121.5s11%
163GPT-5.5 (Reasoning)92.6%$0.1421.8m56%
164GPT-5.276.9%$0.0561.5m26%
165GPT-5.589.5%$0.1391.7m52%
166Claude Sonnet 4.6 (Reasoning)74.6%$0.0601.2m21%
167GPT-5.5 (Reasoning, Low)87.8%$0.1391.8m51%
168Z.AI GLM 5.3 (Reasoning, Max)97.8%$0.0667.3m78%
169Gemini 2.5 Flash Lite (Reasoning)47.5%$0.002830.8s5%
170Nemotron 3 Super54.8%$0.00001.4m7%
171Qwen 3.8 27B (Reasoning, XHigh)82.5%$0.0404.7m37%
172Qwen 3.8 Max (Reasoning, XHigh)92.2%$0.0835.9m55%
173Thinking Machines Inkling51.4%$0.00751.5m4%
174Kimi K2.559.6%$0.0193.2m10%
175Claude Opus 486.4%$0.2091.4m37%
176Thinking Machines Inkling Small (Reasoning, High)28.5%$0.00881.7m0%
177Kimi K2.678.5%$0.0586.5m25%
178GPT-5 Nano14.2%$0.00421.4m0%
179Thinking Machines Inkling (Reasoning)45.9%$0.0255.1m3%
86.71%

Individual Scenarios

Detailed Writing Rules

Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
Gemini 3 Flash (Preview, Reasoning)100100100100100100.0%
Gemma 4 31B (Reasoning)100100100100100100.0%
ByteDance Seed 1.6100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
o4 Mini High100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100100100100.0%
Qwen 3.7 Flash (Reasoning)100100100100100100.0%
Qwen 3.6 27B100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
o4 Mini100100100100100100.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100100100100.0%
ByteDance Seed 2.0 Lite100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
DeepSeek V3 (2024-12-26)100100100100100100.0%
GPT-4o, Aug. 6th (temp=0)100100100100100100.0%
Inception Mercury 2100100100100100100.0%
Grok 4.20100100100100100100.0%
GPT-4o Mini (temp=1)100100100100100100.0%
Llama 3.1 70B100100100100100100.0%
Mistral Small 3.2 24B100100100100100100.0%
GPT-4o Mini (temp=0)100100100100100100.0%
Hermes 3 70B100100100100100100.0%
Mistral NeMO100100100100100100.0%
Qwen 3.6 35B1001001001009599.0%
GPT-5.6 Terra (Reasoning)1001001001009198.3%
Hermes 3 405B1001001001009098.1%
GPT-OSS 120B1001001001008797.3%
Z.AI GLM 4.51001001001008597.1%
Gemini 3 Flash (Preview)1001001001008196.2%
Qwen 3.8 Max (Reasoning, XHigh)1001001001007995.9%
Qwen 3.5 Plus (2026-04-20)1001001001007995.8%
DeepSeek V3.21001001001007895.6%
Qwen 2.5 72B1001001001007895.5%
GPT-4o, Aug. 6th (temp=1)1001001001007795.3%
Laguna S 2.11001001001007594.9%
Qwen 3.5 27B1001001001007394.7%
Aion 3.0 Mini100100100868493.9%
Cohere Command R+ (Aug. 2024)1001001001006292.4%
Grok 4.3100100100996292.1%
Muse Spark 1.1 (Reasoning, Medium)1001001001005891.6%
Mistral Large 21001001001005891.6%
Gemini 3.1 Flash Lite (Reasoning)1001001001005791.5%
Grok 4.5 (Reasoning, High)1001001001005691.2%
ByteDance Seed 2.0 Mini1001001001005190.3%
Gemini 3.5 Flash Lite (Reasoning)1001001001005190.1%
Hy4 Preview (Reasoning, High)1001001001005089.9%
GPT-5.6 Terra1001001001004989.8%
MiniMax M3100100100806689.2%
Gemma 4 26B1001001001004589.1%
GPT-5.5100100100747088.8%
Claude Opus 5 (Reasoning)1001001001004488.8%
Mistral Large 3100100100905088.1%
Nemotron 3 Nano100100100696787.2%
Gemini 3.6 Flash (Reasoning, Minimal)1001001001003587.0%
Gemma 4 31B1001001001003386.7%
Z.AI GLM 5 Turbo1001001001003386.6%
Muse Spark 1.1 (Reasoning, Minimal)1001001001003286.3%
Gemma 3 12B1001001001003186.2%
MiniMax M2.51001001001003086.0%
GPT-5.1100100100784183.9%
Kimi K3 (Reasoning, Low)1001001001001883.5%
Gemma 3 27B1001001001001783.3%
GPT-4.1 Nano1001001001001683.2%
Z.AI GLM 4.7 Flash10010098744383.1%
DeepSeek V4.1 Flash (Reasoning, High)100100100100981.9%
Qwen 3.5 122B100100100100981.8%
Claude Sonnet 5 (Reasoning, Low)100100100100581.0%
DeepSeek V4 Flash100100100100581.0%
Z.AI GLM 5.1100100100100080.0%
GPT-5.5 (Reasoning)100100100100080.0%
Claude Opus 4.8 (Reasoning, Low)100100100100080.0%
Claude Opus 5100100100100080.0%
Claude Opus 4.7100100100100080.0%
Z.AI GLM 4.7100100100100080.0%
DeepSeek-V2 Chat100100100100080.0%
DeepSeek V4 Pro100100100100080.0%
Ministral 3B100100100100080.0%
GPT-510010010083076.5%
GPT-5.5 (Reasoning, Low)10010080544174.8%
DeepSeek V4 Pro (Reasoning)100999282074.6%
DeepSeek V3.110010010069073.8%
Claude Opus 4.61001008779073.2%
Qwen 3 32B10010079651972.5%
Claude Sonnet 4.510010010055672.1%
MiniMax M2.710010010059071.9%
Kimi K2.610010010051771.5%
Kimi K3 (Reasoning, High)100100100401170.1%
Qwen 3.5 397B A17B10010010047069.4%
Gemini 3.1 Flash Lite (Preview)10010010045069.0%
DeepSeek V4 Flash 0731 (Reasoning, High)10010010043068.5%
Claude Opus 410010010042068.5%
Qwen 3.8 Flash (Reasoning)10010010042068.4%
Aion 2.010010010041068.2%
Claude Sonnet 4.610010010034066.9%
GPT-5.4 Nano (Reasoning)1001008337063.9%
Muse Spark 1.2 (Reasoning, Medium)1001006147963.3%
Ministral 3 3B1001006452063.2%
Gemini 3.1 Flash Lite10010010015063.1%
GPT-4.1 Mini10010010011062.3%
GPT-5.4 Mini (Reasoning)1001001004060.9%
Qwen 3.5 Plus (2026-02-15)1001009113060.9%
Thinking Machines Inkling (Reasoning)1001001000060.0%
DeepSeek V4 Pro 0813 (Reasoning, High)1001001000060.0%
Claude Sonnet 51001001000060.0%
GPT-4.11001001000060.0%
DeepSeek V3 (2025-03-24)1001001000060.0%
Writer: Palmyra X51001001000060.0%
Qwen 3 235B A22B Instruct 25071001001000060.0%
Cydonia 24B V4.11001001000060.0%
Ministral 3 14B1001001000060.0%
Gemini 2.5 Flash Lite1001006040059.9%
Gemma 4 26B (Reasoning)100100990059.9%
GPT-5.4100866645059.3%
Mistral Small 4 (Reasoning)100100940058.7%
Z.AI GLM 4.610097950058.2%
GPT-5.4 Mini (Reasoning, Low)100100860057.3%
Gemini 2.5 Flash (Reasoning)1006551431655.0%
GPT-5.4 (Reasoning)100796036054.9%
GPT-5.4 (Reasoning, Low)10094770054.1%
Claude Opus 4.5100100660053.3%
Z.AI GLM 5100100630052.6%
Arcee AI: Trinity Mini100100630052.6%
Claude Opus 4.6 (Reasoning)1001002418048.4%
Claude Sonnet 4100100328048.0%
GPT-5.4 Mini100792915746.1%
Ministral 8B10097250044.5%
Aion 3.0100100200044.1%
WizardLM 2 8x22b100100190043.9%
Claude Sonnet 4.6 (Reasoning)100100190043.7%
GPT-5.4 Nano (Reasoning, Low)10010000040.0%
Ministral 3 8B10010000040.0%
GPT-5.210069140036.6%
Mistral Small 41006700033.5%
Gemini 2.5 Flash10035280032.5%
Claude Haiku 4.51006200032.5%
DeepSeek V4 Flash (Reasoning)10042140031.3%
Nemotron 3 Super10035180030.7%
Mistral Medium 3.11004600029.2%
Z.AI GLM 4.5 Air864400025.9%
ByteDance Seed 1.6 Flash5855130025.3%
GPT-5 Mini922500023.5%
Gemini 2.5 Pro742700020.2%
Xiaomi MIMO v2.5 Pro100000020.0%
Laguna XS 2.1100000020.0%
GPT-5.4 Nano100000020.0%
Gemma 3 4B100000020.0%
Kimi K2.598000019.7%
Thinking Machines Inkling621000014.5%
Thinking Machines Inkling Small (Reasoning, High)000000.0%
Xiaomi MIMO v2.5000000.0%
Gemini 2.5 Flash Lite (Reasoning)000000.0%
GPT-5 Nano000000.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Grok 4.5 (Reasoning, High)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Kimi K3 (Reasoning, High)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100.0%
GPT-5100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
Gemini 3 Flash (Preview, Reasoning)100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Gemma 4 31B (Reasoning)100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
Gemma 4 26B (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
o4 Mini High100100100100100100.0%
Qwen 3.7 Flash (Reasoning)100100100100100100.0%
Gemini 2.5 Pro100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Claude Sonnet 4100100100100100100.0%
Claude Sonnet 5100100100100100100.0%
o4 Mini100100100100100100.0%
ByteDance Seed 2.0 Mini100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning)100100100100100100.0%
Mistral Large 3100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
GPT-4o, Aug. 6th (temp=0)100100100100100100.0%
Hermes 3 405B100100100100100100.0%
Grok 4.3100100100100100100.0%
GPT-4o Mini (temp=1)100100100100100100.0%
Mistral Small 3.2 24B100100100100100100.0%
GPT-4o Mini (temp=0)100100100100100100.0%
Qwen 2.5 72B100100100100100100.0%
Mistral NeMO100100100100100100.0%
Cohere Command R+ (Aug. 2024)1001001001009999.7%
Qwen 3.6 27B1001001001009799.3%
GPT-5.5 (Reasoning)1001001001009598.9%
Mistral Medium 3.11001001001009498.7%
Gemma 4 31B1001001001009498.7%
Gemini 3.6 Flash (Reasoning, Minimal)1001001001009398.5%
ByteDance Seed 2.0 Lite1001001001009298.5%
Gemini 3.5 Flash (Reasoning, Minimal)1001001001009098.0%
Claude Sonnet 4.6 (Reasoning)1001001001008897.7%
Claude Opus 4.61001001001008897.6%
Mistral Large 21001001001008797.4%
GPT-5.6 Terra1001001001008496.8%
Llama 3.1 70B1001001001007494.9%
GPT-5.4 (Reasoning)100100100948094.8%
DeepSeek V4 Flash1001001001006993.9%
Gemini 3 Flash (Preview)1001001001006993.8%
Gemini 3.5 Flash Lite (Reasoning, Minimal)1001001001006392.5%
GPT-5.6 Sol1001001001006192.2%
Z.AI GLM 4.71001001001005290.4%
Qwen 3.8 27B (Reasoning, XHigh)1001001001005190.3%
Qwen 3.8 Flash (Reasoning)100100100797390.3%
Z.AI GLM 5.2 (Reasoning, High)1001001001005190.2%
Aion 3.0 Mini1001001001005089.9%
Muse Spark 1.1 (Reasoning, Minimal)1001001001004889.6%
Mistral Small 41001001001003787.4%
Qwen 3 32B1001001001003587.0%
Muse Spark 1.1 (Reasoning, Medium)1001001001003386.6%
MiniMax M2.51001001001002785.4%
Gemini 3.6 Flash (Reasoning)1001001001002384.5%
Z.AI GLM 5.3 Flash (Reasoning, Low)1001001001002083.9%
Claude Sonnet 5 (Reasoning)1001001001001482.7%
ByteDance Seed 1.61001001001001382.7%
GPT-5.4 Mini (Reasoning, Low)100100100575682.5%
Gemma 4 26B100100100694482.5%
GPT-OSS 120B1001001001001282.4%
MiniMax M3100100100100080.0%
Nemotron 3 Nano100100100703080.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100080.0%
Qwen 3.5 122B100100100100080.0%
Claude Opus 4.5100100100100080.0%
DeepSeek V4 Pro (Reasoning)100100100100080.0%
Claude Sonnet 4.5100100100100080.0%
Qwen 3.5 35B100100100100080.0%
Gemini 3.1 Flash Lite (Preview)100100100100080.0%
Writer: Palmyra X5100100100100080.0%
Ministral 3 8B100100100100080.0%
Ministral 8B100100100100080.0%
Ministral 3B100100100100080.0%
GPT-4o, Aug. 6th (temp=1)10010010097079.4%
GPT-5.5 (Reasoning, Low)1009985832979.0%
Hermes 3 70B100100100603077.8%
Kimi K2.6100100100652277.4%
Grok 4.20100100100651475.7%
Claude Opus 4.6 (Reasoning)10010086691774.5%
Laguna S 2.1100100100531974.3%
Mistral Small 4 (Reasoning)10010083483873.7%
GPT-5.51009480512970.9%
DeepSeek V4 Pro10010010054070.8%
Gemini 3.1 Flash Lite (Reasoning)100100100322070.3%
Ministral 3 14B10010010048069.6%
DeepSeek V4 Pro 0813 (Reasoning, High)1009995322069.2%
Gemma 3 12B10010010042068.4%
GPT-4.1 Nano100100100231567.6%
WizardLM 2 8x22b1009952463666.7%
Z.AI GLM 510010010034066.7%
Aion 3.010010010031066.2%
MiniMax M2.71007772402963.6%
GPT-5.110010010011062.2%
Qwen 3.5 Plus (2026-02-15)100948032061.2%
Claude Sonnet 4.61001001003260.8%
Z.AI GLM 4.51001001002060.5%
DeepSeek V4 Flash 0731 (Reasoning, High)1009855282160.4%
DeepSeek V4 Flash (Reasoning)1001001000060.0%
GPT-4.11001001000060.0%
Claude Haiku 4.51001001000060.0%
DeepSeek V3 (2024-12-26)1001001000060.0%
Gemini 2.5 Flash1001001000060.0%
DeepSeek V3 (2025-03-24)1001001000060.0%
Laguna XS 2.11001001000060.0%
GPT-5.4 Nano1001001000060.0%
Ministral 3 3B1001001000060.0%
Z.AI GLM 4.7 Flash1001001000059.9%
Thinking Machines Inkling (Reasoning)100100920058.4%
Xiaomi MIMO v2.5 Pro100100870057.3%
DeepSeek V3.2100875049057.2%
Z.AI GLM 4.5 Air1001007013056.8%
DeepSeek V3.1100100810056.2%
Cydonia 24B V4.11001006120056.0%
Z.AI GLM 4.6100100760055.3%
GPT-5.4 Nano (Reasoning)1001004925054.7%
GPT-5.4 Mini100100721054.6%
Claude Opus 4100100657054.4%
Inception Mercury 2100100510050.1%
GPT-5.4 Nano (Reasoning, Low)1005239381849.4%
Kimi K2.510087590049.3%
DeepSeek-V2 Chat1001001811045.8%
Aion 2.010071532045.2%
Gemma 3 4B10010000040.0%
Gemma 3 27B1009900039.8%
Qwen 3 235B A22B Instruct 25071009200038.4%
GPT-5.410051390038.0%
Gemini 3.1 Flash Lite10058274037.8%
GPT-4.1 Mini1008610037.3%
ByteDance Seed 1.6 Flash6556500034.2%
GPT-5 Mini1004970031.1%
Nemotron 3 Super6843220026.7%
Gemini 2.5 Flash (Reasoning)1002400024.8%
Thinking Machines Inkling1002400024.7%
Xiaomi MIMO v2.55245170022.8%
Arcee AI: Trinity Mini4738140019.7%
GPT-5.2582700017.0%
Gemini 2.5 Flash Lite (Reasoning)82000016.5%
Thinking Machines Inkling Small (Reasoning, High)51000010.1%
Gemini 2.5 Flash Lite100000.2%
GPT-5 Nano000000.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, High)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Kimi K2.6100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100.0%
GPT-5100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.1100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
MiniMax M3100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
Qwen 3.5 122B100100100100100100.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
Gemini 3 Flash (Preview, Reasoning)100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Gemma 4 31B (Reasoning)100100100100100100.0%
Claude Opus 4.5100100100100100100.0%
Z.AI GLM 5100100100100100100.0%
ByteDance Seed 1.6100100100100100100.0%
GPT-5.2100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
Gemma 4 26B (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
o4 Mini High100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100100100100.0%
Qwen 3.7 Flash (Reasoning)100100100100100100.0%
Gemini 2.5 Pro100100100100100100.0%
Qwen 3.6 27B100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
Z.AI GLM 4.7100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Z.AI GLM 4.6100100100100100100.0%
Claude Sonnet 4100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Claude Sonnet 5100100100100100100.0%
Claude Opus 4100100100100100100.0%
Qwen 3.5 35B100100100100