Pronoun-first sentence starts

Test: Bad Writing Habits

Avg. Score
74.7%
Scenarios
18

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1GPT-5.6 Luna (Reasoning)97.2%$0.01718.0s82%
2GPT-5.6 Luna96.8%$0.01515.8s80%
3GPT-5.4 Mini (Reasoning)95.5%$0.02228.1s79%
4Llama 3.1 70B96.0%$0.001529.4s71%
5GPT-5.6 Terra (Reasoning)97.8%$0.04435.2s86%
6GPT-5.4 Mini (Reasoning, Low)93.3%$0.01516.8s73%
7GPT-5.4 Nano (Reasoning, Low)89.7%$0.005520.6s71%
8GPT-5.6 Terra95.9%$0.04636.9s81%
9GPT-5.4 Nano (Reasoning)87.7%$0.006124.5s66%
10Mistral Small 4 (Reasoning)89.7%$0.002230.2s63%
11GPT-5.4 Mini91.0%$0.01516.8s64%
12Grok 4.2088.9%$0.009345.7s67%
13Ministral 3B88.2%$0.00018.1s56%
14Ministral 3 14B86.8%$0.000711.7s57%
15DeepSeek V3 (2025-03-24)91.5%$0.001439.4s57%
16Cydonia 24B V4.189.4%$0.001444.8s59%
17Z.AI GLM 4.590.5%$0.005142.1s58%
18GPT-5.4 Nano84.9%$0.005726.3s61%
19DeepSeek V4 Pro91.1%$0.00481.3m64%
20Z.AI GLM 5 Turbo89.5%$0.008133.2s56%
21Ministral 3 3B85.9%$0.000511.1s52%
22Mistral Small 485.4%$0.001418.2s53%
23Gemini 3.5 Flash Lite (Reasoning, Minimal)86.8%$0.00356.3s50%
24Grok 4.5 (Reasoning, Low)90.4%$0.0181.1m62%
25Mistral Medium 3.186.9%$0.004836.5s54%
26Mistral Large 386.6%$0.003330.3s51%
27Grok 4.20 (Reasoning)88.7%$0.0181.5m66%
28Gemini 3.5 Flash Lite (Reasoning)85.2%$0.00356.6s46%
29GPT-5.293.6%$0.0561.5m75%
30Claude Haiku 4.587.1%$0.01121.6s50%
31Ministral 3 8B83.7%$0.000819.6s49%
32Claude Sonnet 490.6%$0.03243.7s58%
33Grok 4.383.5%$0.006930.5s53%
34Muse Spark 1.1 (Reasoning, Medium)85.6%$0.01523.9s52%
35Grok 4.5 (Reasoning, High)90.9%$0.0301.6m67%
36Qwen 2.5 72B83.5%$0.001036.7s51%
37GPT-5.4 (Reasoning, Low)93.7%$0.0551.4m71%
38GPT-5.6 Sol (Reasoning)97.6%$0.1081.2m84%
39Claude Sonnet 4.591.5%$0.03538.1s55%
40Z.AI GLM 5.2 (Reasoning, High)86.1%$0.0111.0m55%
41GPT-5.492.0%$0.0491.4m69%
42Mistral Large 285.8%$0.01329.4s49%
43Ministral 8B81.3%$0.000410.4s44%
44Z.AI GLM 586.8%$0.00841.2m54%
45Qwen 3.5 Plus (2026-02-15)82.2%$0.006031.5s49%
46Writer: Palmyra X583.8%$0.01122.0s43%
47Laguna S 2.181.8%$0.000522.1s40%
48Z.AI GLM 4.5 Air85.4%$0.002958.2s44%
49GPT-5.6 Sol94.7%$0.1051.2m76%
50Muse Spark 1.1 (Reasoning, Minimal)82.6%$0.01219.2s41%
51Thinking Machines Inkling86.0%$0.00751.5m50%
52Laguna XS 2.179.2%$0.000314.4s38%
53GPT-5.5 (Reasoning, Low)98.4%$0.1391.8m89%
54Z.AI GLM 5.187.3%$0.0141.5m48%
55Qwen 3 32B81.1%$0.001554.6s41%
56Grok 4.3 (Reasoning)87.0%$0.0212.3m58%
57Aion 3.083.1%$0.0241.0m47%
58GPT-4.1 Mini78.4%$0.002719.0s35%
59Gemini 3.6 Flash (Reasoning, Minimal)78.1%$0.01714.3s39%
60Claude Opus 4.588.6%$0.07053.4s56%
61Qwen3 235B A22B Instruct 250781.3%$0.001159.2s38%
62GPT-5 Nano80.9%$0.00421.4m43%
63DeepSeek V4 Flash78.5%$0.000631.6s33%
64GPT-4o, Aug. 6th (temp=1)78.4%$0.01824.4s38%
65GPT-5.596.6%$0.1391.7m81%
66Aion 3.0 Mini79.4%$0.00531.2m39%
67Gemini 3.6 Flash (Reasoning)81.6%$0.04432.5s44%
68MiniMax M2.779.4%$0.00401.1m38%
69Hermes 3 405B77.8%$0.003253.2s36%
70Inception Mercury 275.7%$0.00327.0s28%
71MiniMax M2.580.5%$0.00341.3m37%
72Gemini 3.5 Flash (Reasoning, Minimal)74.2%$0.01812.0s36%
73ByteDance Seed 1.6 Flash75.8%$0.001327.3s31%
74GPT-5.5 (Reasoning)97.1%$0.1421.8m79%
75DeepSeek V4 Flash (Reasoning)75.5%$0.000731.1s30%
76Hermes 3 70B76.7%$0.00101.2m33%
77Cohere Command R+ (Aug. 2024)77.8%$0.02052.5s36%
78GPT-4o, Aug. 6th (temp=0)75.1%$0.02322.7s32%
79MoonshotAI: Kimi K3 (Reasoning, High)83.1%$0.0441.8m49%
80DeepSeek V4 Pro (Reasoning)84.2%$0.0153.1m53%
81GPT-5.4 (Reasoning)91.8%$0.0892.6m64%
82Gemma 3 12B70.5%$0.000441.3s26%
83Nemotron 3 Nano72.6%$0.00101.1m28%
84Claude Sonnet 5 (Reasoning, Low)74.5%$0.03138.4s31%
85Qwen 3.6 Flash71.0%$0.01041.4s27%
86Claude Opus 4.681.7%$0.0781.2m48%
87GPT-4o Mini (temp=1)68.7%$0.001234.8s23%
88Xiaomi MIMO v2.5 Pro71.3%$0.008553.5s27%
89Gemini 3 Flash (Preview)63.9%$0.007819.6s27%
90DeepSeek V3 (2024-12-26)70.7%$0.002154.6s25%
91Claude Opus 4.6 (Reasoning)83.1%$0.0881.4m49%
92MoonshotAI: Kimi K2.581.0%$0.0193.2m48%
93MoonshotAI: Kimi K3 (Reasoning, Low)75.2%$0.0281.1m31%
94Gemini 2.5 Flash (Reasoning)67.3%$0.01121.5s24%
95Gemini 2.5 Flash66.9%$0.005210.6s19%
96Xiaomi MIMO v2.563.9%$0.005431.8s25%
97Gemini 2.5 Flash Lite61.6%$0.00099.5s21%
98DeepSeek-V2 Chat68.9%$0.002153.3s22%
99Gemini 3 Flash (Preview, Reasoning)62.3%$0.01230.1s27%
100Claude Sonnet 4.670.1%$0.03139.3s26%
101GPT-OSS 120B71.6%$0.00151.8m27%
102Gemini 3.5 Flash (Reasoning)74.0%$0.07137.6s37%
103GPT-4.169.0%$0.01844.7s23%
104WizardLM 2 8x22b70.3%$0.00261.8m29%
105Claude Opus 5 (Reasoning, Low)79.2%$0.0971.0m44%
106GPT-5.179.1%$0.0541.8m36%
107Gemma 4 31B64.2%$0.00101.6m29%
108Arcee AI: Trinity Mini57.4%$0.00039.2s17%
109Claude Sonnet 566.8%$0.02733.5s21%
110Claude Sonnet 5 (Reasoning)68.1%$0.03038.9s21%
111Qwen 3.5 Plus (2026-04-20)71.3%$0.0171.8m27%
112Claude Opus 5 (Reasoning)78.1%$0.0981.0m40%
113Gemma 3 27B61.1%$0.000652.6s18%
114Nemotron 3 Super63.8%$0.00001.4m21%
115Gemini 2.5 Flash Lite (Reasoning)57.3%$0.002830.8s18%
116o4 Mini61.2%$0.01525.7s17%
117Qwen 3.6 27B73.8%$0.0252.3m30%
118Claude Opus 4.771.2%$0.06930.4s27%
119Gemma 4 31B (Reasoning)65.9%$0.00142.2m27%
120Claude Opus 575.0%$0.08250.1s31%
121Claude Opus 4.8 (Reasoning)72.3%$0.07141.7s27%
122Z.AI GLM 4.657.8%$0.006551.5s21%
123Claude Opus 4.8 (Reasoning, Low)73.3%$0.07141.9s26%
124Aion 2.063.0%$0.00641.3m19%
125GPT-5 Mini59.6%$0.010057.4s20%
126GPT-4o Mini (temp=0)56.7%$0.001234.8s14%
127DeepSeek V3.263.0%$0.00141.9m22%
128Claude Opus 4.7 (Reasoning)69.0%$0.07632.0s25%
129Thinking Machines Inkling (Reasoning)82.0%$0.0255.1m49%
130Gemma 3 4B52.5%$0.000220.0s11%
131Qwen 3.6 35B57.6%$0.00831.0m16%
132MiniMax M371.3%$0.00603.1m26%
133GPT-4.1 Nano46.4%$0.000713.3s15%
134o4 Mini High59.5%$0.02547.2s16%
135Gemma 4 26B49.4%$0.000955.1s18%
136Qwen 3.5 Flash48.5%$0.002547.5s17%
137Claude Sonnet 4.6 (Reasoning)65.6%$0.0601.2m22%
138Gemini 3.1 Pro (Preview)75.8%$0.1071.8m36%
139Mistral NeMO38.9%$0.000510.1s16%
140Qwen 3.5 397B A17B65.1%$0.0143.0m24%
141Qwen3.7 Max71.9%$0.0682.3m29%
142Z.AI GLM 4.7 Flash47.9%$0.00171.2m16%
143Gemma 4 26B (Reasoning)54.8%$0.00132.0m17%
144Z.AI GLM 4.749.8%$0.0101.4m16%
145Gemini 2.5 Pro49.0%$0.03636.2s16%
146DeepSeek V3.151.7%$0.00201.8m15%
147Gemini 3.1 Flash Lite (Preview)36.1%$0.00308.4s11%
148Qwen3.6 Max Preview72.5%$0.0503.5m29%
149Qwen 3.5 9B45.8%$0.00111.4m11%
150Qwen 3.5 35B43.3%$0.0181.0m16%
151Claude Opus 487.3%$0.2091.4m44%
152ByteDance Seed 1.655.5%$0.0132.5m17%
153Qwen 3.5 122B44.3%$0.0251.1m13%
154Qwen 3.5 27B46.4%$0.0201.6m15%
155Gemini 3.1 Flash Lite (Reasoning)30.1%$0.003011.9s8%
156ByteDance Seed 2.0 Lite50.7%$0.0122.2m13%
157Gemini 3.1 Flash Lite27.5%$0.003012.1s5%
158GPT-551.6%$0.0652.8m17%
159MoonshotAI: Kimi K2.672.1%$0.0586.5m31%
160ByteDance Seed 2.0 Mini43.3%$0.00454.9m15%
161Mistral Small 3.2 24B42.5%$0.00695.7m10%
74.69%

Individual Scenarios

Detailed Writing Rules

Model # 1 # 2 # 3 # 4 # 5 Avg ▼
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, High)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
MoonshotAI: Kimi K2.6100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
MoonshotAI: Kimi K3 (Reasoning, Low)100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100.0%
MoonshotAI: Kimi K2.5100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.1100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
MiniMax M3100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100.0%
Claude Opus 5100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Claude Opus 4.5100100100100100100.0%
Z.AI GLM 5100100100100100100.0%
GPT-5.5100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100.0%
Aion 3.0100100100100100100.0%
o4 Mini High100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
DeepSeek V4 Flash (Reasoning)100100100100100100.0%
Claude Sonnet 4100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Claude Sonnet 5100100100100100100.0%
Claude Opus 4100100100100100100.0%
GPT-4.1100100100100100100.0%
MiniMax M2.5100100100100100100.0%
o4 Mini100100100100100100.0%
MiniMax M2.7100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Z.AI GLM 4.5100100100100100100.0%
GPT-OSS 120B100100100100100100.0%
GPT-5.4100100100100100100.0%
Mistral Large 3100100100100100100.0%
DeepSeek-V2 Chat100100100100100100.0%
Aion 3.0 Mini100100100100100100.0%
GPT-5.4 Mini (Reasoning, Low)100100100100100100.0%
Claude Haiku 4.5100100100100100100.0%
DeepSeek V3 (2024-12-26)100100100100100100.0%
GPT-4o, Aug. 6th (temp=0)100100100100100100.0%
DeepSeek V4 Pro100100100100100100.0%
DeepSeek V4 Flash100100100100100100.0%
Inception Mercury 2100100100100100100.0%
Nemotron 3 Super100100100100100100.0%
Mistral Large 2100100100100100100.0%
GPT-4o, Aug. 6th (temp=1)100100100100100100.0%
Grok 4.20100100100100100100.0%
Z.AI GLM 4.5 Air100100100100100100.0%
GPT-5.4 Mini100100100100100100.0%
GPT-5 Nano100100100100100100.0%
Laguna S 2.1100100100100100100.0%
DeepSeek V3 (2025-03-24)100100100100100100.0%
Gemini 2.5 Flash Lite100100100100100100.0%
Mistral Small 4 (Reasoning)100100100100100100.0%
Writer: Palmyra X5100100100100100100.0%
Qwen3 235B A22B Instruct 2507100100100100100100.0%
Grok 4.3100100100100100100.0%
GPT-4o Mini (temp=1)100100100100100100.0%
GPT-5.4 Nano (Reasoning, Low)100100100100100100.0%
Llama 3.1 70B100100100100100100.0%
GPT-4o Mini (temp=0)100100100100100100.0%
Mistral Medium 3.1100100100100100100.0%
Gemma 3 12B100100100100100100.0%
Laguna XS 2.1100100100100100100.0%
Mistral Small 4100100100100100100.0%
Nemotron 3 Nano100100100100100100.0%
Thinking Machines Inkling100100100100100100.0%
Qwen 2.5 72B100100100100100100.0%
Cydonia 24B V4.1100100100100100100.0%
GPT-5.4 Nano100100100100100100.0%
Ministral 3 14B100100100100100100.0%
Ministral 3 8B100100100100100100.0%
Hermes 3 70B100100100100100100.0%
Ministral 3B100100100100100100.0%
Ministral 3 3B1001001001009999.8%
Qwen 3.6 Flash1001001001009899.6%
Claude Sonnet 4.61001001001009899.6%
Qwen 3.5 Plus (2026-02-15)1001001001009899.5%
GPT-5.4 Nano (Reasoning)1001001001009799.5%
Gemini 2.5 Flash1001001001009699.2%
Qwen3.6 Max Preview1001001001009599.0%
GPT-4.1 Mini1001001001009598.9%
Aion 2.0100100100999598.8%
Gemini 2.5 Pro100100100979698.6%
Gemma 4 26B (Reasoning)1001001001009198.3%
Gemini 3.5 Flash Lite (Reasoning)1001001001009198.3%
DeepSeek V3.110010097979798.2%
Gemma 4 31B (Reasoning)1001001001009198.2%
Gemini 2.5 Flash Lite (Reasoning)1001001001008997.8%
Arcee AI: Trinity Mini1001001001008997.8%
Gemma 3 4B1001001001008897.7%
GPT-4.1 Nano100100100959397.5%
Qwen 3 32B1001001001008897.5%
Gemini 3.6 Flash (Reasoning)1001001001008797.3%
Xiaomi MIMO v2.5 Pro1001001001008597.0%
Hermes 3 405B1001001001008496.9%
Claude Opus 5 (Reasoning, Low)1001001001008396.6%
Gemma 4 31B100100100998396.5%
Thinking Machines Inkling (Reasoning)1001001001008296.3%
ByteDance Seed 1.6 Flash1001001001007294.5%
Cohere Command R+ (Aug. 2024)100100100937994.4%
Ministral 8B1001001001007294.4%
GPT-5.21001001001007094.1%
DeepSeek V3.210010095958093.9%
Gemini 3 Flash (Preview, Reasoning)1001001001006793.4%
Qwen 3.6 27B1001001001006793.4%
Gemini 3 Flash (Preview)1001001001006693.3%
MoonshotAI: Kimi K3 (Reasoning, High)1001001001006693.2%
Muse Spark 1.1 (Reasoning, Medium)1001001001006492.9%
WizardLM 2 8x22b1001001001006392.7%
Xiaomi MIMO v2.510010099927292.5%
GPT-51001001001005691.2%
Gemini 3.6 Flash (Reasoning, Minimal)100100100876890.9%
Gemma 3 27B100100100876890.9%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100777690.7%
Qwen 3.5 122B10010090897390.6%
Z.AI GLM 4.6100100100975490.1%
Gemini 3.5 Flash (Reasoning)100100100777490.1%
Qwen 3.6 35B100100100955389.6%
Gemini 2.5 Flash (Reasoning)1001001001004689.2%
ByteDance Seed 1.610010093787589.2%
GPT-5 Mini10010097757188.8%
Gemini 3.5 Flash (Reasoning, Minimal)10010088797287.9%
ByteDance Seed 2.0 Lite1001001001002785.5%
Gemma 4 26B100100100853483.8%
Qwen3.7 Max100100100734182.9%
Qwen 3.5 9B10010085595579.9%
Gemini 3.1 Flash Lite (Preview)100100100464377.7%
Qwen 3.5 Flash10010093454376.2%
Qwen 3.5 35B1009672664074.7%
Z.AI GLM 4.7 Flash10010081472470.4%
Gemini 3.1 Pro (Preview)858172555168.7%
Qwen 3.5 27B988474492365.7%
Mistral Small 3.2 24B938566222057.1%
Mistral NeMO1001002011647.5%
Gemini 3.1 Flash Lite (Reasoning)695348322746.0%
Z.AI GLM 4.71004233282645.8%
ByteDance Seed 2.0 Mini794234333043.6%
Gemini 3.1 Flash Lite33271410818.6%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
MiniMax M3100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
GPT-5.5100100100100100100.0%
Aion 3.0100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
DeepSeek V4 Flash (Reasoning)100100100100100100.0%
Claude Sonnet 4100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Claude Opus 4100100100100100100.0%
MiniMax M2.5100100100100100100.0%
MiniMax M2.7100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Z.AI GLM 4.5100100100100100100.0%
GPT-OSS 120B100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100100100100.0%
GPT-5.4100100100100100100.0%
Mistral Large 3100100100100100100.0%
Aion 3.0 Mini100100100100100100.0%
Claude Haiku 4.5100100100100100100.0%
DeepSeek V4 Pro100100100100100100.0%
DeepSeek V4 Flash100100100100100100.0%
Mistral Large 2100100100100100100.0%
GPT-4.1 Mini100100100100100100.0%
GPT-5.4 Mini100100100100100100.0%
DeepSeek V3 (2025-03-24)100100100100100100.0%
Qwen3 235B A22B Instruct 2507100100100100100100.0%
GPT-4o Mini (temp=1)100100100100100100.0%
Mistral Medium 3.1100100100100100100.0%
Laguna XS 2.1100100100100100100.0%
Thinking Machines Inkling100100100100100100.0%
Cydonia 24B V4.1100100100100100100.0%
Writer: Palmyra X51001001001009999.7%
Z.AI GLM 51001001001009899.7%
MoonshotAI: Kimi K2.51001001001009799.3%
Z.AI GLM 5 Turbo1001001001009598.9%
Claude Opus 4.51001001001009498.9%
Claude Opus 4.61001001001009498.7%
ByteDance Seed 1.6 Flash100100100999498.6%
Gemini 3.5 Flash (Reasoning, Minimal)1001001001009298.3%
GPT-5.4 Mini (Reasoning, Low)1001001001009198.2%
Ministral 3 3B1001001001009098.1%
Qwen 3 32B1001001001008997.9%
Hermes 3 405B1001001001008997.8%
Ministral 3 14B100100100969397.7%
GPT-5.2100100100988797.2%
Inception Mercury 2100100100978897.1%
Ministral 8B100100100978897.0%
Muse Spark 1.1 (Reasoning, Medium)1001001001008596.9%
Ministral 3B100100100978796.7%
Qwen 3.6 27B1001001001008396.7%
Z.AI GLM 4.5 Air1001001001008396.6%
MoonshotAI: Kimi K3 (Reasoning, Low)100100100919196.3%
Xiaomi MIMO v2.5 Pro100100100928896.2%
Mistral Small 4 (Reasoning)100100100928996.1%
Claude Opus 5 (Reasoning)1001001001007795.4%
Claude Sonnet 5 (Reasoning, Low)1001001001007695.1%
Claude Sonnet 5100100100918595.1%
Qwen 3.5 Plus (2026-02-15)100100100888494.5%
Claude Opus 510010096928193.9%
Grok 4.3 (Reasoning)100100100878293.6%
Mistral Small 4100100100888093.5%
Grok 4.5 (Reasoning, High)1001001001006793.4%
Qwen 3.5 397B A17B999893918793.4%
WizardLM 2 8x22b10010095908393.4%
GPT-5.4 Nano10010095947693.1%
Gemini 3.6 Flash (Reasoning, Minimal)100100100966993.0%
DeepSeek V4 Pro (Reasoning)100100100927392.9%
Thinking Machines Inkling (Reasoning)10010098927392.7%
GPT-5.4 Nano (Reasoning, Low)100100100887692.7%
GPT-4o, Aug. 6th (temp=1)100100100887692.7%
Ministral 3 8B10010097858192.6%
Muse Spark 1.1 (Reasoning, Minimal)1001001001006292.2%
Llama 3.1 70B100100100946792.2%
Claude Opus 4.71009793888191.7%
Claude Opus 4.7 (Reasoning)10010094936991.4%
GPT-4.1100100100877091.3%
Claude Opus 5 (Reasoning, Low)100100100827491.1%
Laguna S 2.11001001001005390.7%
DeepSeek V3 (2024-12-26)100100100806889.4%
Grok 4.20 (Reasoning)1009587848289.4%
Cohere Command R+ (Aug. 2024)10010096965589.3%
Grok 4.20100100100796789.2%
Aion 2.010010086787788.1%
GPT-5 Nano10010088826687.2%
GPT-5.11008484848387.0%
Gemini 2.5 Flash1009994746787.0%
Gemma 3 27B10010084767086.0%
Gemini 3.5 Flash Lite (Reasoning)10010083766785.1%
Claude Sonnet 4.610010080796584.6%
Grok 4.31009783776384.0%
Gemini 3.1 Pro (Preview)1009892755584.0%
Gemini 3 Flash (Preview)918585837583.8%
MoonshotAI: Kimi K2.61009783766283.6%
Qwen 2.5 72B1009385805983.5%
DeepSeek V3.21009078757383.1%
Qwen 3.5 Plus (2026-04-20)10010081726182.8%
DeepSeek-V2 Chat10010087646282.6%
Hermes 3 70B10010098921781.3%
Nemotron 3 Super1008985676180.4%
Claude Sonnet 5 (Reasoning)10010087724480.4%
GPT-5.4 Nano (Reasoning)989785615880.1%
Arcee AI: Trinity Mini10010080606080.1%
Claude Opus 4.8 (Reasoning)10010090713479.1%
Qwen 3.6 Flash1007876766378.7%
Xiaomi MIMO v2.51008685645678.0%
o4 Mini10010088772177.2%
Gemini 2.5 Flash Lite (Reasoning)958580774676.5%
o4 Mini High1007573706576.3%
Gemma 4 31B1009280535275.2%
GPT-4o Mini (temp=0)927473676674.3%
Claude Sonnet 4.6 (Reasoning)1008079595274.0%
GPT-5 Mini1008071655073.3%
Qwen3.6 Max Preview1009880513773.2%
Gemma 4 31B (Reasoning)1008785791573.1%
Gemini 2.5 Flash (Reasoning)968379713572.7%
Z.AI GLM 4.6937968675472.5%
Gemma 3 4B988564545470.9%
Gemma 3 12B989573454370.8%
DeepSeek V3.11007570664170.5%
GPT-4o, Aug. 6th (temp=0)888762595169.5%
MoonshotAI: Kimi K3 (Reasoning, High)797973664868.9%
Qwen3.7 Max1008357564668.4%
Gemini 2.5 Pro887268595067.5%
GPT-4.1 Nano1007361594467.4%
Gemini 3.5 Flash (Reasoning)1008558393663.6%
Gemini 3 Flash (Preview, Reasoning)100887254062.8%
Nemotron 3 Nano100827551562.5%
GPT-5767462515062.4%
ByteDance Seed 1.6847160573862.1%
Gemma 4 26B (Reasoning)786559544961.2%
Gemini 2.5 Flash Lite896060514460.6%
Qwen 3.6 35B1008952342559.9%
Z.AI GLM 4.7 Flash757157551454.4%
Gemma 4 26B676556502652.9%
Qwen 3.5 122B784947393249.1%
Qwen 3.5 9B100100450049.0%
Qwen 3.5 Flash615949482347.9%
Qwen 3.5 35B79746125047.8%
Mistral NeMO72575444045.6%
Qwen 3.5 27B645043382243.4%
Z.AI GLM 4.768554641042.0%
ByteDance Seed 2.0 Mini40232013620.3%
Mistral Small 3.2 24B5430160020.0%
ByteDance Seed 2.0 Lite4428145018.3%
Gemini 3.1 Flash Lite (Preview)36201511016.4%
Gemini 3.1 Flash Lite27221715016.2%
Gemini 3.1 Flash Lite (Reasoning)3220180014.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
GPT-5.6 Sol (Reasoning)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
GPT-5.2100100100100100100.0%
GPT-5.5100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
GPT-5.4 Mini (Reasoning, Low)100100100100100100.0%
Inception Mercury 2100100100100100100.0%
GPT-5.6 Terra (Reasoning)1001001001009999.9%
GPT-5.4 Mini (Reasoning)1001001001009899.6%
Llama 3.1 70B1001001001009899.5%
Gemini 3.5 Flash Lite (Reasoning, Minimal)1001001001009699.2%
GPT-5.4 (Reasoning, Low)1001001001009498.8%
Gemini 3.5 Flash Lite (Reasoning)1001001001009098.0%
GPT-5.6 Terra10010099989398.0%
Claude Opus 4.7 (Reasoning)1001001001008997.8%
Thinking Machines Inkling1001001001008797.3%
Mistral Large 31001001001008296.5%
Gemini 2.5 Flash (Reasoning)1001001001008296.4%
GPT-5.4 Nano (Reasoning)1001001001008296.3%
Xiaomi MIMO v2.5 Pro100100100988195.9%
Claude Sonnet 41001001001007695.2%
GPT-5.6 Sol100100100908494.8%
Grok 4.5 (Reasoning, Low)1001001001007394.7%
GPT-5.4 Nano10010096908794.6%
GPT-5.4 Nano (Reasoning, Low)1009898908394.0%
Qwen3 235B A22B Instruct 25071001001001006893.6%
Z.AI GLM 4.51001001001006593.1%
Ministral 3 14B10010097848092.3%
Claude Sonnet 4.51001001001005891.5%
Qwen 2.5 72B1001001001005791.3%
Writer: Palmyra X5100100100975991.2%
GPT-4o, Aug. 6th (temp=0)100100100995691.1%
Grok 4.20 (Reasoning)10010090907290.5%
Claude Opus 4.61001001001004989.8%
DeepSeek V3 (2025-03-24)10010096936089.7%
GPT-5.410010098866589.7%
Claude Sonnet 4.6 (Reasoning)100100100925589.4%
DeepSeek V4 Pro (Reasoning)1001001001004789.4%
Claude Opus 5 (Reasoning, Low)1001001001004789.3%
Mistral Small 4 (Reasoning)100100100826389.1%
Ministral 3 3B10010092787388.7%
MoonshotAI: Kimi K3 (Reasoning, High)100100100895488.6%
Ministral 3B1001001001004288.4%
Thinking Machines Inkling (Reasoning)10010099776688.2%
MiniMax M2.510010096885687.9%
GPT-OSS 120B100100100875187.6%
Grok 4.3100100100835487.4%
MoonshotAI: Kimi K2.5100100100696486.6%
Muse Spark 1.1 (Reasoning, Minimal)100100100933686.0%
Claude Haiku 4.51001001001002584.9%
Claude Opus 4.510010087726384.5%
Grok 4.5 (Reasoning, High)10010078766984.4%
Grok 4.2010010075737284.0%
Grok 4.3 (Reasoning)1009289815783.9%
Z.AI GLM 5 Turbo100100100803983.9%
Mistral Small 4100100100843383.5%
Qwen 3.6 Flash100100100902783.3%
Claude Sonnet 5 (Reasoning, Low)1001001001001683.2%
Ministral 8B100100100852882.6%
Mistral Medium 3.1100100100595482.6%
Claude Opus 5100100100100881.6%
GPT-5.4 Mini10010072706581.2%
Gemini 3.6 Flash (Reasoning)100100100743080.8%
ByteDance Seed 1.6 Flash100100100881380.2%
Claude Opus 4100100100100079.9%
DeepSeek V4 Pro1009588674979.7%
o4 Mini High10010010096079.2%
Ministral 3 8B1009379744979.1%
Qwen 3.6 27B1009391842578.6%
Gemma 4 31B (Reasoning)10010087565078.5%
Qwen 3.5 Plus (2026-04-20)1009991544678.1%
Claude Opus 4.710010096692377.6%
Qwen 3 32B1009895821377.5%
Claude Sonnet 510010010083377.1%
GPT-4.1 Mini988582605676.2%
Nemotron 3 Nano1008570626175.4%
Laguna S 2.110010085543775.2%
Muse Spark 1.1 (Reasoning, Medium)100100100492775.2%
ByteDance Seed 1.610010066604674.4%
Z.AI GLM 5.110010095453274.4%
Gemini 3.5 Flash (Reasoning)1008382565274.4%
Qwen 3.5 Plus (2026-02-15)1008479683873.8%
MiniMax M2.7100100100462273.6%
Claude Opus 4.6 (Reasoning)1007965635271.8%
Aion 3.010010010056071.1%
Claude Opus 4.8 (Reasoning, Low)10010010044369.4%
Z.AI GLM 4.5 Air10010010044068.8%
GPT-5 Nano988263633568.3%
Z.AI GLM 5.2 (Reasoning, High)1001007465067.8%
Cydonia 24B V4.11009869423067.8%
Gemini 3.5 Flash (Reasoning, Minimal)857270634967.5%
Gemini 3.6 Flash (Reasoning, Minimal)1007770671665.9%
Laguna XS 2.11001009433065.4%
WizardLM 2 8x22b1009440393762.1%
Mistral Small 3.2 24B10010061222160.7%
Z.AI GLM 51006653463860.5%
GPT-4.11001001001060.3%
GPT-4o, Aug. 6th (temp=1)10010045391760.2%
Mistral Large 21009344362960.2%
Aion 3.0 Mini1009260331660.2%
GPT-5.11001001000060.0%
o4 Mini100100971059.6%
MoonshotAI: Kimi K3 (Reasoning, Low)10010065201259.5%
GPT-4o Mini (temp=1)1001007417659.4%
Qwen 3.5 397B A17B896253433857.0%
ByteDance Seed 2.0 Mini100100810056.2%
Cohere Command R+ (Aug. 2024)100964930055.2%
DeepSeek-V2 Chat100856526055.2%
Qwen3.6 Max Preview1007466171253.8%
ByteDance Seed 2.0 Lite100846417053.1%
DeepSeek V4 Flash (Reasoning)1001004816052.9%
DeepSeek V3 (2024-12-26)100100610052.3%
MoonshotAI: Kimi K2.610080729052.2%
Qwen3.7 Max706763392051.9%
DeepSeek V4 Flash100874416750.7%
DeepSeek V3.210088640050.5%
Hermes 3 405B676450353249.6%
Gemma 4 26B (Reasoning)96893525249.6%
Qwen 3.5 9B96844816048.8%
Gemini 3.1 Pro (Preview)100554937048.2%
Gemma 4 31B1005832281647.0%
MiniMax M310076496346.7%
Gemma 4 26B8781600045.5%
Z.AI GLM 4.61007720201045.4%
Hermes 3 70B99583831045.1%
Gemini 3 Flash (Preview)83603736043.1%
Gemini 3 Flash (Preview, Reasoning)797530151142.0%
Z.AI GLM 4.7 Flash81645212041.9%
Gemini 2.5 Flash10010080041.6%
Qwen 3.6 35B100452624039.0%
GPT-5 Mini10057305138.5%
Mistral NeMO9452332036.3%
Qwen 3.5 122B52453835735.4%
GPT-573422820834.2%
Qwen 3.5 27B10037300033.4%
Gemini 2.5 Flash Lite (Reasoning)100252018333.2%
Gemini 2.5 Flash Lite9542158032.1%
Xiaomi MIMO v2.510030206031.1%
Qwen 3.5 Flash702618151428.8%
Nemotron 3 Super695030024.4%
Qwen 3.5 35B615720023.9%
Aion 2.0981530023.4%
Gemini 2.5 Pro691100016.0%
Gemini 3.1 Flash Lite431300011.1%
Gemma 3 12B23155008.6%
Gemma 3 27B2498008.2%
Arcee AI: Trinity Mini1777006.1%
GPT-4o Mini (temp=0)2400004.9%
Gemini 3.1 Flash Lite (Preview)2030004.6%
DeepSeek V3.11400002.9%
Z.AI GLM 4.7700001.4%
GPT-4.1 Nano220000.9%
Gemini 3.1 Flash Lite (Reasoning)300000.6%
Gemma 3 4B000000.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, High)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Qwen3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
MoonshotAI: Kimi K3 (Reasoning, High)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100.0%
MoonshotAI: Kimi K2.5100100100100100100.0%
Thinking Machines Inkling (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
MiniMax M3100100100100100100.0%
Claude Opus 4.5100100100100100100.0%
Z.AI GLM 5100100100100100100.0%
GPT-5.2100100100100100100.0%
GPT-5.5100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100.0%
Aion 3.0100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
DeepSeek V4 Flash (Reasoning)100100100100100100.0%
Claude Sonnet 4100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Claude Opus 4100100100100100100.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100100.0%
Qwen 3.5 Plus (2026-02-15)100100100100100100.0%
Xiaomi MIMO v2.5 Pro100100100100100100.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Z.AI GLM 4.5100100100100100100.0%
GPT-OSS 120B100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning)100100100100100100.0%
GPT-5.4100100100100100100.0%
DeepSeek-V2 Chat100100100100100100.0%
GPT-5.4 Mini (Reasoning, Low)100100100100100100.0%
Claude Haiku 4.5100100100100100100.0%
DeepSeek V3 (2024-12-26)100100100100100100.0%
DeepSeek V4 Flash100100100100100100.0%
Inception Mercury 2100100100100100100.0%
GPT-4.1 Mini100100100100100100.0%
Grok 4.20100100100100100100.0%
Z.AI GLM 4.5 Air100100100100100100.0%
GPT-5.4 Mini100100100100100100.0%
GPT-5 Nano100100100100100100.0%
GPT-5.4 Nano (Reasoning)100100100100100100.0%
Laguna S 2.1100100100100100100.0%
DeepSeek V3 (2025-03-24)100100100100100100.0%
Mistral Small 4 (Reasoning)100100100100100100.0%
Qwen 3 32B100100100100100100.0%
Writer: Palmyra X5100100100100100100.0%
Qwen3 235B A22B Instruct 2507100100100100100100.0%
Grok 4.3100100100100100100.0%
GPT-5.4 Nano (Reasoning, Low)100100100100100100.0%
Llama 3.1 70B100100100100100100.0%
Mistral Medium 3.1100100100100100100.0%
Mistral Small 4100100100100100100.0%
Nemotron 3 Nano100100100100100100.0%
GPT-5.4 Nano100100100100100100.0%
ByteDance Seed 1.6 Flash100100100100100100.0%
Ministral 3 14B100100100100100100.0%
Ministral 3 8B100100100100100100.0%
Ministral 3 3B100100100100100100.0%
Ministral 8B100100100100100100.0%
Ministral 3B100100100100100100.0%
Qwen3.7 Max1001001001009999.9%
Qwen 3.6 27B1001001001009699.1%
DeepSeek V4 Pro1001001001009598.9%
Claude Opus 51001001001009498.8%
MiniMax M2.71001001001009398.6%
Claude Opus 5 (Reasoning, Low)100100100979498.3%
GPT-5 Mini100100100999298.2%
GPT-5.11001001001009198.1%
MoonshotAI: Kimi K3 (Reasoning, Low)100100100969498.0%
Nemotron 3 Super1001001001008997.8%
GPT-4o, Aug. 6th (temp=1)1001001001008997.8%
Aion 3.0 Mini100100100988997.4%
Grok 4.3 (Reasoning)1001001001008797.3%
Claude Sonnet 5 (Reasoning)1001001001008797.3%
GPT-4o, Aug. 6th (temp=0)1001001001008797.3%
Thinking Machines Inkling1001001001008596.9%
GPT-5.4 Mini (Reasoning)1001001001008396.6%
Aion 2.0100100100929096.5%
Claude Opus 4.61001001001008095.9%
MoonshotAI: Kimi K2.61001001001007995.9%
Cydonia 24B V4.1100100100908795.3%
Xiaomi MIMO v2.510010099948495.3%
Gemini 2.5 Flash Lite100100100918494.9%
Laguna XS 2.1100100100898494.5%
Mistral Small 3.2 24B1001001001007194.3%
MiniMax M2.51001001001007194.3%
DeepSeek V3.11001001001007194.1%
Hermes 3 70B100100100947593.6%
Qwen 3.5 397B A17B10010096927793.0%
GPT-4o Mini (temp=0)100100100857892.5%
Qwen 2.5 72B100100100807891.7%
Claude Sonnet 4.610010096927091.7%
Claude Opus 4.8 (Reasoning)100100100956291.5%
o4 Mini High1001001001005791.4%
Claude Sonnet 4.6 (Reasoning)1001001001005691.2%
Gemini 2.5 Flash100100100827591.2%
WizardLM 2 8x22b1009896926991.2%
Qwen 3.6 Flash1001001001005591.0%
Gemini 2.5 Flash (Reasoning)1009788817788.6%
ByteDance Seed 2.0 Lite1009791837388.6%
Qwen 3.5 Plus (2026-04-20)100100100707088.1%
Claude Opus 5 (Reasoning)10010092806787.9%
Claude Opus 4.8 (Reasoning, Low)10010083827487.6%
o4 Mini100100100736086.7%
Claude Opus 4.710010087786886.5%
DeepSeek V3.2989388767586.1%
Cohere Command R+ (Aug. 2024)10010096785685.9%
Gemma 4 31B1009281757283.9%
Gemini 3 Flash (Preview)1009979766583.8%
Claude Sonnet 5 (Reasoning, Low)10010079766283.5%
Claude Opus 4.7 (Reasoning)10010090695783.4%
Gemma 3 12B10010099605182.0%
Hermes 3 405B10010098703780.9%
GPT-51008980775980.9%
Z.AI GLM 4.71009181745580.2%
ByteDance Seed 1.610010080713777.6%
Gemini 3.5 Flash (Reasoning)10010010085177.3%
Z.AI GLM 4.7 Flash908884843776.5%
GPT-4o Mini (temp=1)918971665774.7%
Qwen 3.5 122B1009291672274.5%
Gemini 3 Flash (Preview, Reasoning)1008278753373.4%
Mistral Large 2100100100452073.0%
Qwen 3.6 35B1009075623772.7%
Qwen 3.5 Flash10010079602372.3%
Mistral NeMO937271645671.2%
Arcee AI: Trinity Mini10010070444171.0%
Z.AI GLM 4.6968782454470.8%
GPT-4.1888072594969.6%
Gemma 4 31B (Reasoning)878560545067.1%
Claude Sonnet 5757168625365.7%
ByteDance Seed 2.0 Mini908058524565.1%
Gemini 3.1 Pro (Preview)10010042414064.6%
Gemma 3 4B1007263454264.3%
Gemini 3.1 Flash Lite100937144061.6%
Gemini 2.5 Flash Lite (Reasoning)1008174312061.3%
Mistral Large 3886865473660.8%
Qwen 3.5 9B1001001000060.0%
Gemini 2.5 Pro806855494759.7%
Qwen 3.5 35B1006457413459.1%
Gemma 3 27B1007849431256.4%
Gemini 3.1 Flash Lite (Preview)1009042291555.3%
Gemma 4 26B755353483452.6%
Gemma 4 26B (Reasoning)85695449652.4%
Qwen 3.5 27B78625747048.7%
GPT-4.1 Nano655044332643.7%
Gemini 3.1 Flash Lite (Reasoning)79604120039.9%