Dialogue tag variety (said vs. fancy)

Test: Bad Writing Habits

Avg. Score
72.3%
Scenarios
18

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1Claude Sonnet 4.699.4%$0.03139.3s95%
2Claude Sonnet 4.6 (Reasoning)99.4%$0.0601.2m93%
3DeepSeek V4.1 Flash (Reasoning, High)94.7%$0.002935.4s62%
4Grok 4.6 (Reasoning, High)99.8%$0.0422.5m98%
5Z.AI GLM 5 Turbo93.9%$0.008133.2s56%
6Muse Glimmer 30B (Reasoning, Medium)93.5%$0.003843.4s55%
7DeepSeek V4 Flash90.5%$0.000631.6s54%
8Aion 3.0 Mini93.9%$0.00531.2m59%
9MiniMax M2.592.4%$0.00341.3m60%
10Z.AI GLM 5.2 (Reasoning, High)93.4%$0.0111.0m54%
11MiniMax M2.789.5%$0.00401.1m54%
12Z.AI GLM 5.3 Flash (Reasoning, Low)89.8%$0.00051.1m47%
13Z.AI GLM 5.194.1%$0.0141.5m54%
14DeepSeek V4 Flash (Reasoning)86.9%$0.000731.1s41%
15Qwen 3.8 Flash (Reasoning)95.4%$0.00643.1m66%
16Qwen 3.6 35B89.5%$0.00831.0m45%
17Qwen 3.5 397B A17B95.7%$0.0143.0m66%
18GPT-5.6 Terra88.4%$0.04636.9s56%
19Muse Spark 1.3 (Reasoning, Medium)93.2%$0.0251.8m55%
20Mistral Large 286.8%$0.01329.4s39%
21MiniMax M393.7%$0.00603.1m63%
22DeepSeek V4 Pro86.3%$0.00481.3m46%
23Ministral 8B80.0%$0.000410.4s35%
24Z.AI GLM 588.4%$0.00841.2m42%
25Aion 3.090.4%$0.0241.0m45%
26Claude Sonnet 4.588.4%$0.03538.1s45%
27Claude Opus 5 (Reasoning)95.4%$0.0981.0m70%
28GPT-5.6 Luna83.6%$0.01515.8s35%
29Mistral Large 382.1%$0.003330.3s35%
30GPT-5 Mini81.8%$0.010057.4s44%
31Qwen 3.5 9B85.3%$0.00111.4m40%
32Claude Sonnet 5 (Reasoning)86.8%$0.03038.9s42%
33Qwen 3.5 35B86.5%$0.0181.0m41%
34Claude Sonnet 585.9%$0.02733.5s39%
35Muse Spark 1.1 (Reasoning, Medium)82.7%$0.01523.9s34%
36Ministral 3 3B79.1%$0.000511.1s29%
37Qwen 3.8 27B (Reasoning, XHigh)98.5%$0.0404.7m85%
38Claude Opus 4.591.0%$0.07053.4s56%
39GPT-5.6 Luna (Reasoning)81.2%$0.01718.0s34%
40Ministral 3B77.5%$0.00018.1s28%
41Grok 4.5 (Reasoning, Low)85.9%$0.0181.1m38%
42Qwen 3.6 Max Preview97.2%$0.0503.5m73%
43Qwen 3.5 Flash82.4%$0.002547.5s30%
44Qwen 3.7 Flash (Reasoning)82.1%$0.001055.2s31%
45DeepSeek V4 Flash 0731 (Reasoning, High)88.6%$0.00222.6m47%
46GPT-5.6 Terra (Reasoning)84.5%$0.04435.2s42%
47Muse Spark 1.2 (Reasoning, Medium)83.2%$0.01838.3s32%
48Qwen 3.6 Flash82.6%$0.01041.4s30%
49ByteDance Seed 1.6 Flash77.0%$0.001327.3s29%
50Grok 4.380.8%$0.006930.5s28%
51Claude Haiku 4.577.2%$0.01121.6s32%
52GPT-5.4 Nano (Reasoning)75.3%$0.006124.5s32%
53Mistral Small 4 (Reasoning)76.3%$0.002230.2s30%
54Ministral 3 8B75.1%$0.000819.6s27%
55GPT-5.4 Mini (Reasoning, Low)77.8%$0.01516.8s30%
56Thinking Machines Inkling83.7%$0.00751.5m35%
57Mistral Small 474.4%$0.001418.2s26%
58Writer: Palmyra X577.5%$0.01122.0s28%
59Qwen 3.5 27B84.3%$0.0201.6m40%
60GPT-5.4 Mini76.8%$0.01516.8s27%
61Grok 4.5 (Reasoning, High)86.4%$0.0301.6m40%
62Grok 4.3 (Reasoning)87.6%$0.0212.3m44%
63Qwen 3 235B A22B Instruct 250777.6%$0.001159.2s29%
64GPT-5.4 Nano (Reasoning, Low)72.6%$0.005520.6s28%
65Claude Sonnet 5 (Reasoning, Low)82.7%$0.03138.4s32%
66GPT-5.487.7%$0.0491.4m44%
67Claude Opus 589.1%$0.08250.1s50%
68GPT-5.6 Sol93.8%$0.1051.2m59%
69GPT-5.6 Sol (Reasoning)93.7%$0.1081.2m60%
70Claude Opus 5 (Reasoning, Low)92.0%$0.0971.0m54%
71Mistral Medium 3.175.6%$0.004836.5s25%
72Muse Spark 1.1 (Reasoning, Minimal)75.9%$0.01219.2s24%
73Ministral 3 14B69.6%$0.000711.7s22%
74Claude Sonnet 480.1%$0.03243.7s31%
75GPT-5.4 (Reasoning, Low)85.1%$0.0551.4m41%
76GPT-5.4 Nano69.9%$0.005726.3s23%
77Kimi K3 (Reasoning, Low)78.7%$0.0281.1m32%
78Qwen 3.5 122B80.3%$0.0251.1m28%
79DeepSeek V4 Pro 0813 (Reasoning, High)82.9%$0.0251.8m34%
80GPT-5.4 Mini (Reasoning)75.3%$0.02228.1s24%
81Gemini 3.1 Flash Lite (Reasoning)70.9%$0.003011.9s16%
82 Kimi K3 (Reasoning, High)85.4%$0.0441.8m39%
83ByteDance Seed 1.685.2%$0.0132.5m34%
84GPT-590.2%$0.0652.8m55%
85Thinking Machines Inkling Small (Reasoning, High)75.9%$0.00881.7m29%
86Claude Opus 4.6 (Reasoning)88.5%$0.0881.4m43%
87DeepSeek V3 (2025-03-24)68.8%$0.001439.4s17%
88Gemini 3.5 Flash Lite (Reasoning, Minimal)67.7%$0.00356.3s11%
89Z.AI GLM 5.3 Flash (Reasoning, Max)94.9%$0.00316.5m64%
90Aion 2.070.8%$0.00641.3m24%
91Gemini 3.5 Flash Lite (Reasoning)65.4%$0.00356.6s13%
92Gemini 3.1 Flash Lite66.7%$0.003012.1s12%
93Claude Opus 4.686.0%$0.0781.2m37%
94Claude Opus 4.781.3%$0.06930.4s29%
95Mistral NeMO62.9%$0.000510.1s14%
96Xiaomi MIMO v2.566.9%$0.005431.8s17%
97Gemini 2.5 Pro73.3%$0.03636.2s23%
98Claude Opus 4.8 (Reasoning, Low)78.8%$0.07141.9s31%
99Laguna XS 2.161.2%$0.000314.4s12%
100ByteDance Seed 2.0 Lite77.4%$0.0122.2m24%
101DeepSeek V4 Pro (Reasoning)80.4%$0.0153.1m34%
102Llama 3.1 70B64.3%$0.001529.4s11%
103Gemini 3.1 Flash Lite (Preview)61.5%$0.00308.4s9%
104Gemini 3.7 Flash (Reasoning, Medium)63.3%$0.01218.2s13%
105Qwen 3 32B61.9%$0.001554.6s18%
106Qwen 3.7 Max87.2%$0.0682.3m37%
107Xiaomi MIMO v2.5 Pro66.0%$0.008553.5s15%
108Claude Opus 4.7 (Reasoning)78.8%$0.07632.0s26%
109Z.AI GLM 4.665.4%$0.006551.5s14%
110GPT-5.589.8%$0.1391.7m58%
111DeepSeek V3 (2024-12-26)63.6%$0.002154.6s14%
112Laguna S 2.158.5%$0.000522.1s10%
113GPT-5.4 (Reasoning)87.7%$0.0892.6m47%
114GPT-5.5 (Reasoning, Low)89.8%$0.1391.8m55%
115Gemma 4 26B (Reasoning)72.3%$0.00132.0m14%
116GPT-4.163.7%$0.01844.7s15%
117Gemini 2.5 Flash56.9%$0.005210.6s9%
118Qwen 3.5 Plus (2026-04-20)72.7%$0.0171.8m16%
119WizardLM 2 8x22b66.5%$0.00261.8m16%
120Claude Opus 4.8 (Reasoning)74.9%$0.07141.7s23%
121Kimi K2.577.1%$0.0193.2m29%
122Z.AI GLM 4.559.4%$0.005142.1s10%
123o4 Mini59.3%$0.01525.7s11%
124Qwen 2.5 72B56.5%$0.001036.7s10%
125Grok 4.20 (Reasoning)67.7%$0.0181.5m16%
126Gemini 3.8 Flash (Reasoning, Medium)56.6%$0.01418.0s11%
127Thinking Machines Inkling (Reasoning)86.0%$0.0255.1m46%
128Gemma 4 26B59.6%$0.000955.1s8%
129Grok 4.2056.9%$0.009345.7s12%
130GPT-4.1 Nano51.8%$0.000713.3s7%
131DeepSeek V3.264.4%$0.00141.9m14%
132Gemma 3 27B56.7%$0.000652.6s9%
133Hy4 Preview (Reasoning, High)86.5%$0.0404.4m39%
134Gemma 4 31B (Reasoning)66.9%$0.00142.2m14%
135Arcee AI: Trinity Mini50.0%$0.00039.2s5%
136GPT-4o, Aug. 6th (temp=0)54.9%$0.02322.7s13%
137Z.AI GLM 5.3 (Reasoning, Max)97.4%$0.0667.3m75%
138DeepSeek-V2 Chat55.7%$0.002153.3s8%
139o4 Mini High61.2%$0.02547.2s10%
140GPT-5.172.0%$0.0541.8m23%
141DeepSeek V3.160.6%$0.00201.8m13%
142Qwen 3.8 Max (Reasoning, XHigh)94.4%$0.0835.9m62%
143GPT-5.5 (Reasoning)87.2%$0.1421.8m42%
144GPT-4.1 Mini43.7%$0.002719.0s8%
145Nemotron 3 Super52.7%$0.00001.4m8%
146Hermes 3 405B48.9%$0.003253.2s5%
147Gemini 3.1 Pro (Preview)79.9%$0.1071.8m28%
148Z.AI GLM 4.7 Flash49.2%$0.00171.2m8%
149Z.AI GLM 4.5 Air46.6%$0.002958.2s8%
150Gemini 2.5 Flash Lite40.0%$0.00099.5s4%
151ByteDance Seed 2.0 Mini77.8%$0.00454.9m23%
152Gemini 3 Flash (Preview, Reasoning)45.3%$0.01230.1s5%
153Gemini 2.5 Flash Lite (Reasoning)43.3%$0.002830.8s3%
154Inception Mercury 238.2%$0.00327.0s4%
155Z.AI GLM 4.751.7%$0.0101.4m8%
156GPT-5 Nano47.2%$0.00421.4m9%
157GPT-5.261.4%$0.0561.5m17%
158Gemini 2.5 Flash (Reasoning)41.7%$0.01121.5s2%
159Gemini 3 Flash (Preview)37.4%$0.007819.6s3%
160Gemini 3.6 Flash (Reasoning)50.3%$0.04432.5s7%
161Qwen 3.6 27B58.5%$0.0252.3m8%
162GPT-4o Mini (temp=0)34.6%$0.001234.8s0%
163Gemma 4 31B44.1%$0.00101.6m3%
164Gemini 3.5 Flash (Reasoning, Minimal)36.2%$0.01812.0s0%
165Kimi K2.687.6%$0.0586.5m42%
166Gemma 3 12B31.2%$0.000441.3s3%
167Cydonia 24B V4.132.5%$0.001444.8s0%
168Cohere Command R+ (Aug. 2024)38.6%$0.02052.5s3%
169Qwen 3.5 Plus (2026-02-15)30.5%$0.006031.5s0%
170Gemini 3.6 Flash (Reasoning, Minimal)30.8%$0.01714.3s0%
171Nemotron 3 Nano30.7%$0.00101.1m2%
172Claude Opus 485.3%$0.2091.4m36%
173Hermes 3 70B30.8%$0.00101.2m0%
174Gemma 3 4B19.7%$0.000220.0s0%
175Mistral Small 3.2 24B68.9%$0.00695.7m15%
176Gemini 3.5 Flash (Reasoning)42.9%$0.07137.6s7%
177GPT-4o Mini (temp=1)20.1%$0.001234.8s0%
178GPT-4o, Aug. 6th (temp=1)19.5%$0.01824.4s0%
179GPT-OSS 120B19.7%$0.00151.8m0%
72.31%

Individual Scenarios

Detailed Writing Rules

Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Kimi K2.6100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
MiniMax M3100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
Claude Opus 4.5100100100100100100.0%
Aion 3.0100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)1001001001009799.5%
GPT-5.5 (Reasoning, Low)1001001001009298.3%
MiniMax M2.71001001001009198.2%
Claude Opus 5 (Reasoning)1001001001008997.9%
Z.AI GLM 5.2 (Reasoning, High)1001001001008897.5%
ByteDance Seed 1.6100100100978897.0%
Qwen 3.8 Flash (Reasoning)1001001001008396.7%
Claude Sonnet 51001001001008396.7%
Claude Opus 4.6 (Reasoning)100100100919196.5%
GPT-5.4 (Reasoning, Low)100100100968496.0%
Claude Opus 41001001001007995.9%
Z.AI GLM 5.3 Flash (Reasoning, Low)1001001001007995.7%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100918595.2%
Claude Opus 51001001001007595.0%
Claude Opus 4.7 (Reasoning)100100100918394.9%
Claude Sonnet 4.5100100100947994.6%
GPT-5.4 Mini (Reasoning)100100100966993.0%
GPT-5.6 Luna100100100947092.9%
Kimi K3 (Reasoning, High)10010099976592.2%
GPT-5.4 Mini (Reasoning, Low)100100100966492.0%
GPT-5.5 (Reasoning)1001001001005991.8%
GPT-5.4100100100965890.8%
ByteDance Seed 2.0 Lite100100100836790.0%
GPT-5.6 Sol100100100876389.9%
GPT-5.6 Terra1009892797989.5%
Qwen 3.5 35B1001001001004789.5%
Claude Sonnet 5 (Reasoning, Low)1001001001004789.3%
GPT-510010086827789.0%
Qwen 3.5 397B A17B1001001001004288.4%
Muse Glimmer 30B (Reasoning, Medium)10010099885387.9%
Qwen 3.6 35B1001001001003787.4%
DeepSeek V4 Flash (Reasoning)10010093835987.2%
Grok 4.5 (Reasoning, Low)100100100913986.0%
Aion 3.0 Mini1001001001002585.0%
GPT-5.510010085756484.8%
GPT-5.6 Luna (Reasoning)10010090884484.4%
DeepSeek V4 Pro100100100675384.0%
Gemini 3.1 Pro (Preview)10010083825083.0%
Claude Opus 4.71001001001001082.1%
Claude Opus 4.8 (Reasoning)100100100100080.0%
Gemma 4 26B (Reasoning)100100100100080.0%
DeepSeek V4 Flash 0731 (Reasoning, High)10010096614279.8%
MiniMax M2.5100100100791879.4%
Claude Opus 4.6100100100801579.0%
Z.AI GLM 5100100100504378.6%
ByteDance Seed 2.0 Mini10010010091078.2%
Mistral Large 210010010079075.7%
GPT-5.4 Mini10010070623673.6%
Grok 4.5 (Reasoning, High)1008363595972.9%
Kimi K3 (Reasoning, Low)1001008973072.5%
DeepSeek V4 Pro (Reasoning)10010088472070.7%
Ministral 8B1001007973070.3%
DeepSeek V4 Flash1001009059069.8%
Writer: Palmyra X594938864067.9%
Claude Opus 4.8 (Reasoning, Low)969171641166.7%
Mistral Medium 3.11009995211265.4%
Qwen 3.5 9B1009667352865.1%
GPT-5.6 Terra (Reasoning)1007567473464.4%
Qwen 3 235B A22B Instruct 2507100998825062.2%
GPT-5.4 Nano89777667061.6%
DeepSeek V4 Pro 0813 (Reasoning, High)948559432561.2%
Qwen 3.5 27B1009362371260.9%
Qwen 3.6 Max Preview1001007032060.5%
Qwen 3.5 122B100100984060.3%
GPT-4o, Aug. 6th (temp=0)100100947060.3%
Gemma 4 31B (Reasoning)1001001000060.0%
Qwen 3.7 Flash (Reasoning)1001001000060.0%
Ministral 3 14B767059454558.9%
Thinking Machines Inkling (Reasoning)100736350758.7%
Mistral Large 3917867421157.7%
Qwen 3.5 Flash100100840056.8%
GPT-5.11001004737056.7%
GPT-5.2817168312955.9%
ByteDance Seed 1.6 Flash1007367211054.1%
Qwen 2.5 72B716353503354.1%
Qwen 3 32B10094760054.1%
Claude Sonnet 4100100700054.0%
Xiaomi MIMO v2.5 Pro100100700054.0%
Ministral 3 8B76696755053.3%
Kimi K2.5100100590051.8%
GPT-4.19383810051.4%
Mistral Small 497895021051.4%
GPT-5 Mini85846817051.0%
Mistral Small 3.2 24B10077690049.3%
Gemini 3.5 Flash Lite (Reasoning)10079670049.0%
GPT-5.4 Nano (Reasoning)1005041351447.9%
Qwen 3.6 27B10093390046.3%
Qwen 3.7 Max100100253045.6%
Mistral NeMO100673025044.3%
Grok 4.3 (Reasoning)67505050043.3%
Grok 4.20 (Reasoning)100100170043.3%
Muse Spark 1.1 (Reasoning, Medium)73594339042.8%
Thinking Machines Inkling Small (Reasoning, High)8870457041.9%
Qwen 3.5 Plus (2026-04-20)10010000040.0%
Qwen 3.6 Flash10010000040.0%
Muse Spark 1.2 (Reasoning, Medium)10080180039.7%
o4 Mini64503932738.5%
Gemini 2.5 Flash8369320036.9%
Mistral Small 4 (Reasoning)7362470036.5%
GPT-5.4 Nano (Reasoning, Low)1007720035.9%
Thinking Machines Inkling10050250035.0%
WizardLM 2 8x22b7667310034.6%
Ministral 3 3B887900033.2%
Ministral 3B835900028.5%
Aion 2.0944700028.4%
Hermes 3 70B5353250026.3%
Grok 4.31002500025.0%
Nemotron 3 Super5932250023.3%
Gemma 4 26B793600022.9%
Claude Haiku 4.54747120021.2%
Gemini 3 Flash (Preview, Reasoning)100000020.0%
o4 Mini High100000020.0%
Gemma 4 31B100000020.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100000020.0%
DeepSeek-V2 Chat100000020.0%
DeepSeek V3 (2024-12-26)791700019.0%
DeepSeek V3 (2025-03-24)672500018.3%
DeepSeek V3.1592570018.2%
Muse Spark 1.1 (Reasoning, Minimal)532270016.4%
Grok 4.202825182014.8%
GPT-4o, Aug. 6th (temp=1)73000014.6%
Z.AI GLM 4.7 Flash67000013.3%
Z.AI GLM 4.5 Air61400013.0%
Hermes 3 405B353000012.9%
DeepSeek V3.264000012.9%
Gemini 2.5 Pro63000012.6%
Gemini 3 Flash (Preview)59300012.4%
Laguna XS 2.159200012.2%
Gemini 3.7 Flash (Reasoning, Medium)56000011.3%
GPT-5 Nano52000010.3%
GPT-4.1 Mini43700010.0%
Llama 3.1 70B50000010.0%
Z.AI GLM 4.728174009.7%
Z.AI GLM 4.53170007.6%
Laguna S 2.13000006.0%
Z.AI GLM 4.62500005.0%
Gemini 3.1 Flash Lite (Preview)1700003.3%
Cohere Command R+ (Aug. 2024)1700003.3%
Gemini 3.5 Flash (Reasoning)1000002.1%
Gemini 2.5 Flash Lite (Reasoning)700001.4%
Cydonia 24B V4.1700001.4%
Gemma 3 12B200000.4%
Gemini 3.8 Flash (Reasoning, Medium)000000.0%
Gemini 3.6 Flash (Reasoning)000000.0%
Gemini 3.6 Flash (Reasoning, Minimal)000000.0%
Qwen 3.5 Plus (2026-02-15)000000.0%
Gemini 3.1 Flash Lite (Reasoning)000000.0%
Gemini 3.5 Flash (Reasoning, Minimal)000000.0%
Gemini 3.1 Flash Lite000000.0%
GPT-OSS 120B000000.0%
Gemini 2.5 Flash (Reasoning)000000.0%
Xiaomi MIMO v2.5000000.0%
Inception Mercury 2000000.0%
Gemini 2.5 Flash Lite000000.0%
GPT-4o Mini (temp=1)000000.0%
GPT-4o Mini (temp=0)000000.0%
Gemma 3 27B000000.0%
Nemotron 3 Nano000000.0%
GPT-4.1 Nano000000.0%
Arcee AI: Trinity Mini000000.0%
Gemma 3 4B000000.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Grok 4.5 (Reasoning, High)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
GPT-5.5100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100100100100.0%
Gemini 2.5 Pro100100100100100100.0%
ByteDance Seed 2.0 Mini100100100100100100.0%
Aion 3.0 Mini100100100100100100.0%
Claude Haiku 4.5100100100100100100.0%
Mistral Large 2100100100100100100.0%
Qwen 3 235B A22B Instruct 2507100100100100100100.0%
Ministral 3 3B100100100100100100.0%
GPT-5.5 (Reasoning, Low)1001001001009799.5%
Qwen 3.5 9B1001001001009799.5%
Muse Glimmer 30B (Reasoning, Medium)1001001001009198.2%
Z.AI GLM 5.11001001001008897.5%
GPT-5.6 Sol1001001001008597.1%
GPT-51001001001008396.7%
Qwen 3.5 397B A17B1001001001008396.7%
Claude Opus 5 (Reasoning)1001001001007995.7%
Grok 4.5 (Reasoning, Low)1001001001007995.7%
Claude Sonnet 41001001001007695.2%
Z.AI GLM 5.3 (Reasoning, Max)1001001001005991.8%
GPT-5.5 (Reasoning)1001001001005991.8%
Claude Opus 4.510010097886790.3%
Claude Opus 5 (Reasoning, Low)1001001001005090.0%
GPT-5.41009794945989.1%
Claude Sonnet 4.51001001001003987.8%
Kimi K2.61001001001002585.0%
GPT-5.6 Luna1009797973284.9%
GPT-5.4 Nano (Reasoning)100100100675083.3%
GPT-5 Mini100100100892382.5%
Qwen 3.5 Flash100100100991282.2%
DeepSeek V4 Pro100100100100781.4%
DeepSeek V4 Flash100100100100781.4%
GPT-5.6 Terra1008988854380.9%
Muse Spark 1.2 (Reasoning, Medium)100100100792580.7%
Qwen 3.8 Max (Reasoning, XHigh)100100100100080.0%
Z.AI GLM 5 Turbo100100100100080.0%
Thinking Machines Inkling (Reasoning)100100100100080.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100080.0%
Qwen 3.5 Plus (2026-04-20)100100100100080.0%
Aion 3.0100100100100080.0%
Z.AI GLM 4.6100100100100080.0%
Mistral Large 3100100100100080.0%
Grok 4.3100100100100080.0%
Llama 3.1 70B100100100100080.0%
Arcee AI: Trinity Mini100100100100080.0%
Qwen 3.6 Flash100100100732579.6%
Claude Opus 41001009994078.8%
GPT-5.4 (Reasoning)1007973676777.0%
GPT-5.4 (Reasoning, Low)1001009779075.2%
MiniMax M2.710010010067774.8%
Qwen 3.8 Flash (Reasoning)10010010073074.6%
MiniMax M2.510010010071074.2%
DeepSeek V4 Flash (Reasoning)10010010067073.3%
DeepSeek V4 Flash 0731 (Reasoning, High)10010010059773.2%
Muse Spark 1.1 (Reasoning, Minimal)10010010059071.8%
Qwen 3.6 35B10010010050070.0%
Writer: Palmyra X510010010050070.0%
Qwen 3.6 27B10010010039067.8%
Qwen 3 32B908973572566.9%
GPT-5.6 Terra (Reasoning)10010067323266.3%
Ministral 3B10010010025065.0%
Qwen 3.5 35B10010010012062.4%
Gemini 3.5 Flash Lite (Reasoning)10010045392561.7%
Z.AI GLM 5.2 (Reasoning, High)1001001007061.4%
DeepSeek V3.11001001007061.4%
Gemini 3.5 Flash Lite (Reasoning, Minimal)1001006739061.1%
GPT-5.110010050391761.1%
Qwen 3.7 Max1001001000060.0%
Gemini 3.1 Pro (Preview)1001001000060.0%
Kimi K2.51001001000060.0%
MiniMax M31001001000060.0%
Z.AI GLM 51001001000060.0%
ByteDance Seed 1.61001001000060.0%
Gemini 2.5 Flash (Reasoning)1001001000060.0%
Gemini 2.5 Flash Lite (Reasoning)1001001000060.0%
Hermes 3 405B1001001000060.0%
Thinking Machines Inkling1001001000060.0%
Gemma 4 31B (Reasoning)100100837058.1%
Claude Opus 51001005039057.8%
GPT-5.4 Nano (Reasoning, Low)100100880057.5%
GPT-5.4 Mini (Reasoning, Low)969139391756.3%
GPT-5.294797925055.3%
Thinking Machines Inkling Small (Reasoning, High)1001005025055.0%
Claude Opus 4.7 (Reasoning)100100590051.8%
Claude Sonnet 5 (Reasoning, Low)100100590051.8%
Qwen 3.7 Flash (Reasoning)100676725051.7%
Gemini 3.8 Flash (Reasoning, Medium)100100500050.0%
Gemma 4 26B (Reasoning)100100500050.0%
GPT-5.6 Luna (Reasoning)100884517049.8%
Laguna S 2.1100793625047.9%
Muse Spark 1.1 (Reasoning, Medium)100100390047.8%
Claude Opus 4.71005039252547.8%
Kimi K3 (Reasoning, Low)100100250045.0%
o4 Mini100100250045.0%
ByteDance Seed 2.0 Lite100100250045.0%
Z.AI GLM 4.7 Flash88735014044.8%
DeepSeek V4 Pro (Reasoning)10085390044.7%
GPT-5.4 Nano10079327043.6%
Mistral Small 4 (Reasoning)10059500041.8%
Ministral 3 14B10059500041.8%
GPT-5.4 Mini (Reasoning)1009477041.7%
DeepSeek V3 (2025-03-24)10010070041.4%
Gemini 3.7 Flash (Reasoning, Medium)10010000040.0%
Claude Opus 4.610010000040.0%
Gemma 4 26B10010000040.0%
Mistral Small 3.2 24B10010000040.0%
Mistral NeMO10010000040.0%
Qwen 3.5 122B1009400038.9%
Z.AI GLM 4.51009100038.2%
Kimi K3 (Reasoning, High)10050250035.0%
Hermes 3 70B1006770034.8%
Claude Sonnet 5 (Reasoning)1005077734.3%
DeepSeek V3.21006300032.6%
Claude Sonnet 51005900031.8%
WizardLM 2 8x22b1005000030.0%
Ministral 8B10025250030.0%
Cydonia 24B V4.19439140029.4%
GPT-4o, Aug. 6th (temp=0)1003900027.8%
Ministral 3 8B1003900027.8%
Mistral Small 41002570026.4%
GPT-5.4 Mini7043140025.3%
Claude Opus 4.6 (Reasoning)1002500025.0%
Grok 4.20 (Reasoning)1002500025.0%
GPT-4.11002500025.0%
Aion 2.01002500025.0%
Claude Opus 4.8 (Reasoning, Low)675500024.3%
Mistral Medium 3.11001700023.3%
Gemini 3 Flash (Preview)7620170022.4%
Gemma 4 31B100000020.0%
DeepSeek-V2 Chat100000020.0%
DeepSeek V3 (2024-12-26)100000020.0%
GPT-4o, Aug. 6th (temp=1)100000020.0%
ByteDance Seed 1.6 Flash100000020.0%
GPT-4.1 Nano100000020.0%
Gemini 3.1 Flash Lite (Reasoning)593200018.3%
GPT-4.1 Mini83000016.7%
Gemini 3.6 Flash (Reasoning)59000011.8%
Grok 4.2059000011.8%
Laguna XS 2.1252500010.0%
Gemini 3.5 Flash (Reasoning, Minimal)4500008.9%
Gemini 3.6 Flash (Reasoning, Minimal)3900007.8%
GPT-5 Nano3900007.8%
Gemini 3.1 Flash Lite21140006.9%
Qwen 2.5 72B17170006.7%
Claude Opus 4.8 (Reasoning)2500005.0%
Gemini 3 Flash (Preview, Reasoning)2500005.0%
Gemma 3 27B2500005.0%
Gemma 3 4B2500005.0%
Gemini 3.5 Flash (Reasoning)000000.0%
o4 Mini High000000.0%
Z.AI GLM 4.7000000.0%
Qwen 3.5 Plus (2026-02-15)000000.0%
Xiaomi MIMO v2.5 Pro000000.0%
Gemini 3.1 Flash Lite (Preview)000000.0%
GPT-OSS 120B000000.0%
Xiaomi MIMO v2.5000000.0%
Inception Mercury 2000000.0%
Nemotron 3 Super000000.0%
Z.AI GLM 4.5 Air000000.0%
Gemini 2.5 Flash000000.0%
Gemini 2.5 Flash Lite000000.0%
GPT-4o Mini (temp=1)000000.0%
GPT-4o Mini (temp=0)000000.0%
Gemma 3 12B000000.0%
Nemotron 3 Nano000000.0%
Cohere Command R+ (Aug. 2024)000000.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Kimi K3 (Reasoning, High)100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Kimi K2.6100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100.0%
GPT-5100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Grok 4.3 (Reasoning)100100100100</