Adverbs in dialogue tags

Test: Bad Writing Habits

Avg. Score
91.7%
Scenarios
18

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1Inception Mercury 2100.0%$0.00327.0s100%
2Gemini 3.1 Flash Lite (Reasoning)99.7%$0.003011.9s96%
3Gemini 3.1 Flash Lite (Preview)98.9%$0.00308.4s89%
4Gemini 3.1 Flash Lite99.3%$0.003012.1s86%
5ByteDance Seed 1.6 Flash99.2%$0.001327.3s88%
6GPT-5.6 Luna99.4%$0.01515.8s91%
7Qwen 3.6 35B99.2%$0.00831.0m91%
8GPT-5.6 Terra100.0%$0.04636.9s100%
9GPT-5.6 Luna (Reasoning)98.7%$0.01718.0s83%
10Ministral 8B97.6%$0.000410.4s76%
11GPT-5.4 Nano97.2%$0.005726.3s81%
12Gemini 3 Flash (Preview)98.4%$0.007819.6s78%
13DeepSeek V4 Flash97.8%$0.000631.6s78%
14Qwen 3.5 Flash98.1%$0.002547.5s77%
15Ministral 3 3B96.8%$0.000511.1s70%
16Gemini 3 Flash (Preview, Reasoning)97.8%$0.01230.1s77%
17Gemma 4 26B97.5%$0.000955.1s78%
18GPT-5.4 Mini97.8%$0.01516.8s74%
19Qwen 2.5 72B97.7%$0.001036.7s71%
20Qwen 3.5 35B98.5%$0.0181.0m78%
21Mistral NeMO95.6%$0.000510.1s64%
22DeepSeek V4 Flash (Reasoning)96.2%$0.000731.1s67%
23Muse Spark 1.1 (Reasoning, Minimal)96.1%$0.01219.2s70%
24Z.AI GLM 4.696.6%$0.006551.5s73%
25DeepSeek V4 Pro97.6%$0.00481.3m76%
26Qwen 3.5 27B98.9%$0.0201.6m85%
27Muse Spark 1.1 (Reasoning, Medium)96.2%$0.01523.9s70%
28o4 Mini95.8%$0.01525.7s71%
29GPT-5.4 Mini (Reasoning, Low)96.8%$0.01516.8s66%
30Muse Glimmer 30B (Reasoning, Medium)96.0%$0.003843.4s68%
31Ministral 3B94.3%$0.00018.1s61%
32Qwen 3.6 Flash96.3%$0.01041.4s68%
33Qwen 3.5 Plus (2026-02-15)94.6%$0.006031.5s65%
34Nemotron 3 Nano96.2%$0.00101.1m67%
35Aion 3.0 Mini96.0%$0.00531.2m70%
36Mistral Small 4 (Reasoning)92.5%$0.002230.2s65%
37Gemma 4 31B97.4%$0.00101.6m70%
38Grok 4.5 (Reasoning, Low)95.9%$0.0181.1m73%
39Z.AI GLM 5 Turbo95.2%$0.008133.2s63%
40GPT-OSS 120B96.5%$0.00151.8m73%
41Gemma 4 26B (Reasoning)97.8%$0.00132.0m74%
42GPT-5.4 Nano (Reasoning)94.2%$0.006124.5s61%
43GPT-5.4 Nano (Reasoning, Low)94.1%$0.005520.6s59%
44Qwen 3.5 Plus (2026-04-20)98.0%$0.0171.8m76%
45DeepSeek V4.1 Flash (Reasoning, High)95.0%$0.002935.4s58%
46Muse Spark 1.3 (Reasoning, Medium)97.6%$0.0251.8m79%
47GPT-4o Mini (temp=0)93.4%$0.001234.8s60%
48Nemotron 3 Super95.4%$0.00001.4m66%
49Gemini 3.8 Flash (Reasoning, Medium)92.4%$0.01418.0s62%
50WizardLM 2 8x22b94.7%$0.00261.8m73%
51Gemini 3.5 Flash Lite (Reasoning)92.7%$0.00356.6s54%
52GPT-5.4 Mini (Reasoning)95.6%$0.02228.1s62%
53Qwen 3.7 Flash (Reasoning)94.5%$0.001055.2s60%
54Xiaomi MIMO v2.5 Pro94.8%$0.008553.5s62%
55Aion 3.096.7%$0.0241.0m67%
56Mistral Medium 3.193.4%$0.004836.5s58%
57GPT-5.6 Sol100.0%$0.1051.2m100%
58Qwen 3.5 122B96.2%$0.0251.1m69%
59Muse Spark 1.2 (Reasoning, Medium)94.2%$0.01838.3s62%
60Gemma 4 31B (Reasoning)97.2%$0.00142.2m69%
61Gemini 3.5 Flash Lite (Reasoning, Minimal)91.9%$0.00356.3s52%
62GPT-5.6 Terra (Reasoning)97.0%$0.04435.2s68%
63GPT-5.498.4%$0.0491.4m79%
64Qwen 3 235B A22B Instruct 250793.5%$0.001159.2s59%
65Gemini 3.5 Flash (Reasoning, Minimal)93.1%$0.01812.0s56%
66Gemini 2.5 Pro94.8%$0.03636.2s65%
67Grok 4.392.6%$0.006930.5s54%
68Qwen 3.5 9B94.6%$0.00111.4m59%
69Qwen 3.5 397B A17B98.9%$0.0143.0m79%
70Ministral 3 8B90.8%$0.000819.6s52%
71Writer: Palmyra X592.3%$0.01122.0s54%
72Cohere Command R+ (Aug. 2024)93.8%$0.02052.5s62%
73Qwen 3.6 Max Preview100.0%$0.0503.5m100%
74Z.AI GLM 5.2 (Reasoning, High)94.5%$0.0111.0m57%
75Grok 4.6 (Reasoning, High)98.7%$0.0422.5m83%
76Gemini 2.5 Flash Lite89.1%$0.00099.5s50%
77Qwen 3 32B92.7%$0.001554.6s54%
78GPT-4.193.4%$0.01844.7s58%
79Gemini 2.5 Flash89.8%$0.005210.6s49%
80Gemma 3 4B89.6%$0.000220.0s49%
81Z.AI GLM 4.589.3%$0.005142.1s56%
82Z.AI GLM 4.5 Air91.8%$0.002958.2s54%
83Grok 4.3 (Reasoning)96.9%$0.0212.3m69%
84Aion 2.092.8%$0.00641.3m55%
85Qwen 3.8 Flash (Reasoning)97.7%$0.00643.1m70%
86GPT-4o, Aug. 6th (temp=0)90.5%$0.02322.7s54%
87Laguna XS 2.187.8%$0.000314.4s47%
88Xiaomi MIMO v2.590.6%$0.005431.8s48%
89DeepSeek V4 Pro 0813 (Reasoning, High)95.6%$0.0251.8m65%
90Grok 4.5 (Reasoning, High)94.8%$0.0301.6m65%
91Ministral 3 14B88.8%$0.000711.7s43%
92Claude Sonnet 591.9%$0.02733.5s54%
93MiniMax M2.790.6%$0.00401.1m53%
94Qwen 3.8 27B (Reasoning, XHigh)100.0%$0.0404.7m100%
95Z.AI GLM 4.792.0%$0.0101.4m57%
96o4 Mini High91.8%$0.02547.2s56%
97Mistral Large 290.1%$0.01329.4s47%
98DeepSeek V3.291.7%$0.00141.9m56%
99Gemini 3.5 Flash (Reasoning)95.3%$0.07137.6s65%
100Gemma 3 27B87.8%$0.000652.6s49%
101Kimi K3 (Reasoning, Low)91.7%$0.0281.1m57%
102Z.AI GLM 4.7 Flash89.9%$0.00171.2m49%
103Thinking Machines Inkling90.6%$0.00751.5m53%
104Mistral Large 388.9%$0.003330.3s41%
105Claude Sonnet 4.591.7%$0.03538.1s52%
106GPT-5.5 (Reasoning, Low)100.0%$0.1391.8m100%
107GPT-5.6 Sol (Reasoning)98.9%$0.1081.2m79%
108Z.AI GLM 5.3 Flash (Reasoning, Low)88.7%$0.00051.1m46%
109Qwen 3.7 Max98.2%$0.0682.3m76%
110Gemini 3.7 Flash (Reasoning, Medium)87.2%$0.01218.2s43%
111GPT-5.295.2%$0.0561.5m65%
112MiniMax M394.8%$0.00603.1m64%
113ByteDance Seed 1.694.4%$0.0132.5m59%
114Thinking Machines Inkling Small (Reasoning, High)90.5%$0.00881.7m50%
115Z.AI GLM 587.7%$0.00841.2m48%
116Z.AI GLM 5.191.2%$0.0141.5m48%
117Mistral Small 484.2%$0.001418.2s38%
118Claude Opus 594.9%$0.08250.1s62%
119Gemini 2.5 Flash Lite (Reasoning)85.4%$0.002830.8s39%
120Gemini 2.5 Flash (Reasoning)85.8%$0.01121.5s39%
121Grok 4.2085.2%$0.009345.7s44%
122Claude Opus 4.7 (Reasoning)93.9%$0.07632.0s55%
123Claude Sonnet 4.689.0%$0.03139.3s45%
124Grok 4.20 (Reasoning)89.4%$0.0181.5m47%
125DeepSeek V4 Flash 0731 (Reasoning, High)91.6%$0.00222.6m51%
126DeepSeek V3 (2025-03-24)85.0%$0.001439.4s36%
127GPT-5.4 (Reasoning, Low)93.0%$0.0551.4m55%
128GPT-5 Mini86.1%$0.010057.4s41%
129Claude Opus 5 (Reasoning, Low)95.3%$0.0971.0m65%
130 Kimi K3 (Reasoning, High)92.7%$0.0441.8m54%
131Claude Opus 4.693.4%$0.0781.2m59%
132Gemma 3 12B82.5%$0.000441.3s36%
133Qwen 3.6 27B91.3%$0.0252.3m53%
134Llama 3.1 70B83.2%$0.001529.4s32%
135ByteDance Seed 2.0 Lite90.8%$0.0122.2m45%
136Claude Sonnet 5 (Reasoning, Low)86.5%$0.03138.4s41%
137MiniMax M2.582.7%$0.00341.3m42%
138GPT-5.190.8%$0.0541.8m58%
139Arcee AI: Trinity Mini80.1%$0.00039.2s30%
140Claude Opus 4.6 (Reasoning)93.8%$0.0881.4m60%
141Claude Opus 5 (Reasoning)94.3%$0.0981.0m60%
142DeepSeek V3 (2024-12-26)82.4%$0.002154.6s34%
143GPT-4o Mini (temp=1)78.2%$0.001234.8s36%
144Gemini 3.6 Flash (Reasoning, Minimal)80.3%$0.01714.3s35%
145Claude Sonnet 4.6 (Reasoning)90.1%$0.0601.2m48%
146Kimi K2.591.8%$0.0193.2m52%
147DeepSeek V3.184.8%$0.00201.8m37%
148GPT-5.5 (Reasoning)98.0%$0.1421.8m77%
149GPT-5.4 (Reasoning)95.4%$0.0892.6m68%
150GPT-594.3%$0.0652.8m62%
151DeepSeek-V2 Chat80.8%$0.002153.3s30%
152Gemini 3.6 Flash (Reasoning)85.2%$0.04432.5s36%
153DeepSeek V4 Pro (Reasoning)90.4%$0.0153.1m47%
154Claude Opus 4.789.1%$0.06930.4s40%
155Claude Opus 4.8 (Reasoning)88.8%$0.07141.7s42%
156Claude Sonnet 5 (Reasoning)82.4%$0.03038.9s33%
157Claude Sonnet 482.1%$0.03243.7s35%
158Claude Opus 4.587.5%$0.07053.4s44%
159GPT-5.597.2%$0.1391.7m69%
160GPT-4o, Aug. 6th (temp=1)77.0%$0.01824.4s30%
161Gemini 3.1 Pro (Preview)93.3%$0.1071.8m59%
162Hy4 Preview (Reasoning, High)94.4%$0.0404.4m59%
163ByteDance Seed 2.0 Mini92.9%$0.00454.9m51%
164Claude Opus 4.8 (Reasoning, Low)85.8%$0.07141.9s37%
165Claude Haiku 4.572.0%$0.01121.6s22%
166Mistral Small 3.2 24B92.8%$0.00695.7m50%
167GPT-4.1 Mini67.0%$0.002719.0s20%
168Z.AI GLM 5.3 Flash (Reasoning, Max)92.8%$0.00316.5m53%
169Hermes 3 405B70.7%$0.003253.2s18%
170Qwen 3.8 Max (Reasoning, XHigh)97.7%$0.0835.9m70%
171Thinking Machines Inkling (Reasoning)90.8%$0.0255.1m45%
172Laguna S 2.161.7%$0.000522.1s16%
173Cydonia 24B V4.164.1%$0.001444.8s15%
174Kimi K2.694.4%$0.0586.5m61%
175GPT-5 Nano65.9%$0.00421.4m18%
176Hermes 3 70B63.7%$0.00101.2m13%
177Claude Opus 488.7%$0.2091.4m50%
178Z.AI GLM 5.3 (Reasoning, Max)92.1%$0.0667.3m51%
179GPT-4.1 Nano46.6%$0.000713.3s4%
91.67%

Individual Scenarios

Detailed Writing Rules

Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
GPT-5100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Thinking Machines Inkling (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.1100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
MiniMax M3100100100100100100.0%
Qwen 3.5 122B100100100100100100.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
Gemini 3 Flash (Preview, Reasoning)100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Gemma 4 31B (Reasoning)100100100100100100.0%
Claude Opus 4.5100100100100100100.0%
GPT-5.2100100100100100100.0%
GPT-5.5100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100.0%
Gemma 4 26B (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
Aion 3.0100100100100100100.0%
o4 Mini High100100100100100100.0%
Qwen 3.7 Flash (Reasoning)100100100100100100.0%
Gemini 2.5 Pro100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
DeepSeek V4 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 4.7100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Z.AI GLM 4.6100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
GPT-4.1100100100100100100.0%
MiniMax M2.7100100100100100100.0%
Qwen 3.5 Plus (2026-02-15)100100100100100100.0%
Xiaomi MIMO v2.5 Pro100100100100100100.0%
Gemini 3.1 Flash Lite (Reasoning)100100100100100100.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100100100100.0%
ByteDance Seed 2.0 Mini100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
Gemini 3 Flash (Preview)100100100100100100.0%
Gemini 3.1 Flash Lite (Preview)100100100100100100.0%
Gemma 4 31B100100100100100100.0%
Gemini 3.1 Flash Lite100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Gemma 4 26B100100100100100100.0%
GPT-OSS 120B100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100100100100.0%
GPT-5.4100100100100100100.0%
Gemini 2.5 Flash (Reasoning)100100100100100100.0%
DeepSeek-V2 Chat100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
GPT-5.4 Mini (Reasoning, Low)100100100100100100.0%
DeepSeek V3.1100100100100100100.0%
Z.AI GLM 4.7 Flash100100100100100100.0%
DeepSeek V4 Pro100100100100100100.0%
DeepSeek V4 Flash100100100100100100.0%
Inception Mercury 2100100100100100100.0%
Nemotron 3 Super100100100100100100.0%
Mistral Large 2100100100100100100.0%
Z.AI GLM 4.5 Air100100100100100100.0%
GPT-5.4 Mini100100100100100100.0%
GPT-5.4 Nano (Reasoning)100100100100100100.0%
Writer: Palmyra X5100100100100100100.0%
Qwen 3 235B A22B Instruct 2507100100100100100100.0%
GPT-5.4 Nano (Reasoning, Low)100100100100100100.0%
GPT-4o Mini (temp=0)100100100100100100.0%
Mistral Medium 3.1100100100100100100.0%
Gemma 3 27B100100100100100100.0%
Nemotron 3 Nano100100100100100100.0%
Qwen 2.5 72B100100100100100100.0%
GPT-5.4 Nano100100100100100100.0%
ByteDance Seed 1.6 Flash100100100100100100.0%
Ministral 3 14B100100100100100100.0%
Ministral 3 8B100100100100100100.0%
Arcee AI: Trinity Mini100100100100100100.0%
Gemma 3 4B100100100100100100.0%
Mistral NeMO100100100100100100.0%
Ministral 8B100100100100100100.0%
Kimi K3 (Reasoning, High)1001001001009598.9%
Qwen 3.6 27B1001001001009598.9%
Thinking Machines Inkling Small (Reasoning, High)1001001001009598.9%
Claude Sonnet 51001001001009298.4%
Grok 4.201001001001009298.4%
Gemini 2.5 Flash1001001001009298.4%
Aion 2.01001001001008997.8%
Gemini 3.5 Flash Lite (Reasoning)1001001001008997.8%
Gemini 2.5 Flash Lite (Reasoning)1001001001008997.8%
GPT-4o, Aug. 6th (temp=0)1001001001008997.8%
o4 Mini1001001001008697.1%
Mistral Small 3.2 24B1001001001008596.9%
Claude Sonnet 4.61001001001008296.5%
Mistral Small 4 (Reasoning)1001001001008296.5%
Grok 4.20 (Reasoning)1001001001007995.8%
WizardLM 2 8x22b100100100928495.2%
Gemini 3.8 Flash (Reasoning, Medium)1001001001007595.0%
Gemini 3.6 Flash (Reasoning, Minimal)1001001001007595.0%
Xiaomi MIMO v2.51001001001007595.0%
Gemini 2.5 Flash Lite1001001001007595.0%
Llama 3.1 70B1001001001007595.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)1001001001007194.2%
Gemma 3 12B1001001001007093.9%
Grok 4.5 (Reasoning, High)1001001001006793.3%
DeepSeek V3.21001001001006793.3%
Mistral Large 31001001001006593.0%
Claude Opus 4100100100867592.3%
DeepSeek V4 Flash 0731 (Reasoning, High)1001001001006092.1%
GPT-4.1 Mini1001001001005791.4%
Ministral 3B1001001001005791.4%
Z.AI GLM 5.1100100100956291.4%
Claude Sonnet 5 (Reasoning, Low)100100100896791.1%
Claude Sonnet 5 (Reasoning)100100100797590.8%
Gemini 3.1 Pro (Preview)1001001001005290.4%
Qwen 3 32B1001001001005090.0%
Laguna XS 2.11001001001004689.2%
Claude Haiku 4.51001001001004288.4%
Claude Opus 5 (Reasoning)1001001001003386.7%
GPT-5 Nano100100100874486.1%
GPT-4o Mini (temp=1)100100100854084.9%
Claude Opus 4.8 (Reasoning, Low)100100100824284.9%
GPT-5 Mini1001001001002484.7%
DeepSeek V3 (2024-12-26)100100100674682.6%
Claude Sonnet 4100100100575281.8%
Aion 3.0 Mini100100100100080.0%
GPT-4o, Aug. 6th (temp=1)100100100100080.0%
Grok 4.3100100100673380.0%
Ministral 3 3B100100100100080.0%
DeepSeek V3 (2025-03-24)10010010089077.8%
MiniMax M2.51009787574276.7%
Thinking Machines Inkling100100100463375.9%
Cohere Command R+ (Aug. 2024)100100100571875.1%
ByteDance Seed 1.610010010075075.0%
Z.AI GLM 4.5100100100422974.1%
Z.AI GLM 5100100100571073.3%
Kimi K2.610010010046670.5%
Mistral Small 410010071502969.9%
Cydonia 24B V4.11001008246065.7%
Kimi K2.510010010018063.6%
Laguna S 2.11001005750061.4%
ByteDance Seed 2.0 Lite1001001000060.0%
Hermes 3 405B100100890057.8%
GPT-4.1 Nano100100330046.7%
Hermes 3 70B100100330046.7%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, High)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Kimi K2.6100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
GPT-5100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100.0%
Kimi K2.5100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
MiniMax M3100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
Qwen 3.5 122B100100100100100100.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
Gemini 3 Flash (Preview, Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Z.AI GLM 5100100100100100100.0%
GPT-5.2100100100100100100.0%
GPT-5.5100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100.0%
Gemma 4 26B (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
Aion 3.0100100100100100100.0%
o4 Mini High100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100100100100.0%
Gemini 2.5 Pro100100100100100100.0%
Qwen 3.6 27B100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
DeepSeek V4 Flash (Reasoning)100100100100100100.0%
DeepSeek V4 Flash 0731 (Reasoning, High)100100100100100100.0%
Z.AI GLM 4.7100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Z.AI GLM 4.6100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Claude Sonnet 5100100100100100100.0%
Claude Opus 4100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100100.0%
Aion 2.0100100100100100100.0%
o4 Mini100100100100100100.0%
Qwen 3.5 Plus (2026-02-15)100100100100100100.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
Gemini 3 Flash (Preview)100100100100100100.0%
Gemini 3.1 Flash Lite (Preview)100100100100100100.0%
Gemma 4 31B100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Gemma 4 26B100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning)100100100100100100.0%
Mistral Large 3100100100100100100.0%
ByteDance Seed 2.0 Lite100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
Xiaomi MIMO v2.5100100100100100100.0%
Aion 3.0 Mini100100100100100100.0%
GPT-5.4 Mini (Reasoning, Low)100100100100100100.0%
DeepSeek V3.2100100100100100100.0%
Z.AI GLM 4.7 Flash100100100100100100.0%
GPT-4o, Aug. 6th (temp=0)100100100100100100.0%
DeepSeek V4 Pro100100100100100100.0%
DeepSeek V4 Flash100100100100100100.0%
Inception Mercury 2100100100100100100.0%
Grok 4.20100100100100100100.0%
GPT-5.4 Mini100100100100100100.0%
DeepSeek V3 (2025-03-24)100100100100100100.0%
Gemini 2.5 Flash Lite100100100100100100.0%
Mistral Small 4 (Reasoning)100100100100100100.0%
Qwen 3 32B100100100100100100.0%
Grok 4.3100100100100100100.0%
GPT-5.4 Nano (Reasoning, Low)100100100100100100.0%
Llama 3.1 70B100100100100100100.0%
Mistral Small 3.2 24B100100100100100100.0%
GPT-4o Mini (temp=0)100100100100100100.0%
Mistral Medium 3.1100100100100100100.0%
Gemma 3 27B100100100100100100.0%
Nemotron 3 Nano100100100100100100.0%
Qwen 2.5 72B100100100100100100.0%
WizardLM 2 8x22b100100100100100100.0%
GPT-4.1 Nano100100100100100100.0%
Arcee AI: Trinity Mini100100100100100100.0%
Ministral 3 3B100100100100100100.0%
Mistral NeMO100100100100100100.0%
Ministral 8B100100100100100100.0%
Ministral 3B100100100100100100.0%
GPT-5.6 Luna (Reasoning)1001001001009598.9%
Gemini 3.1 Pro (Preview)1001001001008997.8%
GPT-5.4 Mini (Reasoning)1001001001008997.8%
Claude Opus 4.51001001001008997.8%
GPT-5.41001001001008997.8%
Z.AI GLM 4.5 Air1001001001008997.8%
GPT-5.4 Nano (Reasoning)1001001001008997.8%
ByteDance Seed 1.6 Flash1001001001008997.8%
Gemini 3.1 Flash Lite (Reasoning)1001001001008296.5%
Z.AI GLM 4.51001001001008296.5%
GPT-5.11001001001007595.0%
Grok 4.5 (Reasoning, Low)1001001001005791.4%
Qwen 3.7 Flash (Reasoning)1001001001005791.4%
MiniMax M2.71001001001005791.4%
Gemma 3 12B1001001001005791.4%
Laguna XS 2.11001001001005791.4%
Thinking Machines Inkling1001001001005791.4%
GPT-5.4 Nano1001001001005791.4%
Cohere Command R+ (Aug. 2024)1001001001005791.4%
GPT-5.4 (Reasoning)1001001001003386.7%
Claude Opus 4.8 (Reasoning, Low)1001001001003386.7%
Grok 4.20 (Reasoning)1001001001003386.7%
Gemini 3.1 Flash Lite1001001001003386.7%
GPT-4o, Aug. 6th (temp=1)1001001001003386.7%
Laguna S 2.1100100100863383.8%
Muse Spark 1.1 (Reasoning, Minimal)1001001001001883.6%
ByteDance Seed 1.61001001001001883.6%
Z.AI GLM 5.3 (Reasoning, Max)100100100100080.0%
Z.AI GLM 5.1100100100100080.0%
Claude Opus 4.8 (Reasoning)100100100100080.0%
Thinking Machines Inkling (Reasoning)100100100100080.0%
Claude Opus 4.7100100100100080.0%
Gemma 4 31B (Reasoning)100100100100080.0%
GPT-4.1100100100100080.0%
Xiaomi MIMO v2.5 Pro100100100100080.0%
ByteDance Seed 2.0 Mini100100100100080.0%
GPT-OSS 120B100100100100080.0%
Gemini 2.5 Flash (Reasoning)100100100100080.0%
DeepSeek-V2 Chat100100100100080.0%
Claude Haiku 4.5100100100100080.0%
Gemini 2.5 Flash Lite (Reasoning)100100100100080.0%
DeepSeek V3.1100100100100080.0%
Nemotron 3 Super100100100100080.0%
Mistral Large 2100100100100080.0%
Qwen 3 235B A22B Instruct 2507100100100100080.0%
Hermes 3 70B100100100100080.0%
GPT-5.4 (Reasoning, Low)10010010095078.9%
Ministral 3 8B10010010089077.8%
Writer: Palmyra X510010010082076.5%
Hermes 3 405B10010010075075.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100333373.3%
Gemma 3 4B1001008975072.8%
DeepSeek V4.1 Flash (Reasoning, High)10010010057071.4%
Gemini 2.5 Flash10010010057071.4%
Kimi K3 (Reasoning, High)10010010046069.2%
GPT-5 Nano10010010026065.2%
GPT-4.1 Mini1001006757064.8%
Claude Opus 4.61001001000060.0%
GPT-5 Mini1001001000060.0%
Thinking Machines Inkling Small (Reasoning, High)1001001000060.0%
MiniMax M2.51001001000060.0%
DeepSeek V3 (2024-12-26)1001001000060.0%
Mistral Small 41001001000060.0%
Ministral 3 14B1001001000060.0%
Claude Sonnet 4100100670053.3%
Cydonia 24B V4.1100100330046.7%
GPT-4o Mini (temp=1)67333333033.3%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Kimi K3 (Reasoning, High)100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Kimi K2.6100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
GPT-5100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
GPT-5 Mini100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100.0%
Kimi K2.5100100100100100100.0%
Thinking Machines Inkling (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.1100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
MiniMax M3100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
Qwen 3.5 122B100100100100100100.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
Gemini 3 Flash (Preview, Reasoning)100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Gemma 4 31B (Reasoning)100100100100100100.0%
ByteDance Seed 1.6100100100100100100.0%
GPT-5.2100100100100100100.0%
GPT-5.5100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100.0%
Gemma 4 26B (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
Aion 3.0100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100100100100.0%
Qwen 3.7 Flash (Reasoning)100100100100100100.0%
Qwen 3.6 27B100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
DeepSeek V4 Flash (Reasoning)100100100100100100.0%
DeepSeek V4 Flash 0731 (Reasoning, High)100100100100100100.0%
Z.AI GLM 4.7100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Claude Sonnet 5100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
GPT-4.1100100100100100100.0%
o4 Mini100100100100100100.0%
MiniMax M2.7100100100100100100.0%
Xiaomi MIMO v2.5 Pro100100100100100100.0%
Gemini 3.1 Flash Lite (Reasoning)100100100100100100.0%
ByteDance Seed 2.0 Mini100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
Gemini 3 Flash (Preview)100100100100100100.0%
Gemini 3.1 Flash Lite (Preview)100100100100100100.0%
Gemma 4 31B100100100100100100.0%
Gemini 3.1 Flash Lite100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Gemma 4 26B100100100100100100.0%
GPT-OSS 120B100100100100100100.0%
GPT-5.4100100100100100100.0%
ByteDance Seed 2.0 Lite100100