Filter word density

Test: Bad Writing Habits

Avg. Score
90.4%
Scenarios
18

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1Ministral 3 14B99.8%$0.000711.7s97%
2Mistral Small 499.8%$0.001418.2s98%
3Writer: Palmyra X5100.0%$0.01122.0s99%
4Mistral Medium 3.199.6%$0.004836.5s97%
5GPT-5.6 Luna99.6%$0.01515.8s96%
6GPT-5.6 Luna (Reasoning)99.6%$0.01718.0s96%
7Qwen 3.7 Flash (Reasoning)99.7%$0.001055.2s96%
8Mistral Large 398.8%$0.003330.3s92%
9Mistral Small 4 (Reasoning)98.9%$0.002230.2s91%
10Qwen 3 235B A22B Instruct 250799.8%$0.001159.2s96%
11Muse Spark 1.1 (Reasoning, Medium)98.9%$0.01523.9s93%
12Muse Spark 1.1 (Reasoning, Minimal)98.6%$0.01219.2s90%
13o4 Mini99.1%$0.01525.7s91%
14GPT-5.4 Nano (Reasoning, Low)97.5%$0.005520.6s88%
15DeepSeek V4.1 Flash (Reasoning, High)98.6%$0.002935.4s88%
16Mistral Large 298.7%$0.01329.4s90%
17Qwen 3.5 9B99.5%$0.00111.4m95%
18GPT-5.4 Mini97.8%$0.01516.8s88%
19DeepSeek V3 (2025-03-24)98.2%$0.001439.4s86%
20GPT-5.4 Mini (Reasoning, Low)98.3%$0.01516.8s87%
21GPT-5.4 Nano (Reasoning)97.1%$0.006124.5s85%
22Ministral 3 8B97.2%$0.000819.6s81%
23Gemini 3.7 Flash (Reasoning, Medium)97.9%$0.01218.2s85%
24GPT-5.4 Nano97.3%$0.005726.3s84%
25Gemini 3.8 Flash (Reasoning, Medium)97.1%$0.01418.0s85%
26ByteDance Seed 1.6 Flash97.1%$0.001327.3s81%
27o4 Mini High99.2%$0.02547.2s94%
28Grok 4.397.1%$0.006930.5s83%
29Grok 4.2097.8%$0.009345.7s86%
30GPT-4o Mini (temp=1)95.9%$0.001234.8s82%
31DeepSeek V4 Flash96.2%$0.000631.6s80%
32DeepSeek V4 Pro98.2%$0.00481.3m89%
33Xiaomi MIMO v2.5 Pro97.3%$0.008553.5s87%
34GPT-4.198.2%$0.01844.7s88%
35GPT-5.6 Terra99.8%$0.04636.9s97%
36GPT-5.6 Terra (Reasoning)99.7%$0.04435.2s95%
37Gemini 3.6 Flash (Reasoning, Minimal)97.3%$0.01714.3s81%
38DeepSeek V4 Flash (Reasoning)95.9%$0.000731.1s78%
39Z.AI GLM 5.3 Flash (Reasoning, Low)97.2%$0.00051.1m84%
40Muse Glimmer 30B (Reasoning, Medium)98.0%$0.003843.4s79%
41Z.AI GLM 5 Turbo95.1%$0.008133.2s80%
42GPT-5.4 Mini (Reasoning)96.9%$0.02228.1s83%
43GPT-4.1 Mini95.5%$0.002719.0s73%
44Qwen 3 32B96.5%$0.001554.6s79%
45Ministral 8B96.1%$0.000410.4s69%
46GPT-5 Mini95.6%$0.010057.4s84%
47Qwen 3.6 Flash96.3%$0.01041.4s79%
48Grok 4.5 (Reasoning, Low)97.3%$0.0181.1m85%
49Z.AI GLM 4.7 Flash96.1%$0.00171.2m80%
50Z.AI GLM 4.797.0%$0.0101.4m85%
51Gemini 3.6 Flash (Reasoning)97.7%$0.04432.5s86%
52Qwen 3.6 35B95.6%$0.00831.0m78%
53Qwen 3.5 Flash95.0%$0.002547.5s73%
54Gemini 3.5 Flash Lite (Reasoning)91.4%$0.00356.6s68%
55Qwen 3.5 122B96.3%$0.0251.1m85%
56GPT-5.499.8%$0.0491.4m97%
57Qwen 3.5 Plus (2026-04-20)98.4%$0.0171.8m88%
58Ministral 3B93.1%$0.00018.1s64%
59Claude Sonnet 4.596.4%$0.03538.1s83%
60GPT-5.4 (Reasoning, Low)99.7%$0.0551.4m97%
61Claude Sonnet 4.696.6%$0.03139.3s79%
62Aion 3.097.4%$0.0241.0m79%
63Muse Spark 1.3 (Reasoning, Medium)98.7%$0.0251.8m88%
64Muse Spark 1.2 (Reasoning, Medium)96.3%$0.01838.3s72%
65Gemma 3 27B93.1%$0.000652.6s70%
66Aion 2.093.8%$0.00641.3m77%
67Z.AI GLM 5.2 (Reasoning, High)95.3%$0.0111.0m74%
68DeepSeek V4 Pro 0813 (Reasoning, High)97.8%$0.0251.8m86%
69Kimi K3 (Reasoning, Low)96.7%$0.0281.1m80%
70GPT-5.199.7%$0.0541.8m96%
71GPT-4o, Aug. 6th (temp=1)92.3%$0.01824.4s70%
72Xiaomi MIMO v2.591.5%$0.005431.8s66%
73Ministral 3 3B92.0%$0.000511.1s59%
74GPT-5.298.8%$0.0561.5m93%
75Z.AI GLM 5.195.7%$0.0141.5m77%
76Claude Opus 4.7 (Reasoning)98.6%$0.07632.0s89%
77Grok 4.5 (Reasoning, High)97.3%$0.0301.6m82%
78GPT-4o Mini (temp=0)89.2%$0.001234.8s65%
79Aion 3.0 Mini94.4%$0.00531.2m67%
80GPT-4.1 Nano89.6%$0.000713.3s57%
81Qwen 3.5 35B93.9%$0.0181.0m70%
82DeepSeek-V2 Chat92.2%$0.002153.3s63%
83Claude Opus 598.6%$0.08250.1s90%
84Gemini 3.5 Flash Lite (Reasoning, Minimal)87.9%$0.00356.3s58%
85Gemini 2.5 Pro93.3%$0.03636.2s72%
86Thinking Machines Inkling92.5%$0.00751.5m72%
87DeepSeek V3 (2024-12-26)91.6%$0.002154.6s63%
88Grok 4.20 (Reasoning)95.3%$0.0181.5m72%
89GPT-5.6 Sol100.0%$0.1051.2m100%
90Z.AI GLM 590.7%$0.00841.2m66%
91Grok 4.6 (Reasoning, High)98.7%$0.0422.5m89%
92GPT-5.6 Sol (Reasoning)100.0%$0.1081.2m100%
93Claude Opus 4.8 (Reasoning, Low)96.3%$0.07141.9s81%
94Gemini 2.5 Flash (Reasoning)87.6%$0.01121.5s60%
95Claude Sonnet 5 (Reasoning)92.7%$0.03038.9s65%
96Claude Opus 4.698.2%$0.0781.2m88%
97Gemini 3.5 Flash (Reasoning, Minimal)87.3%$0.01812.0s60%
98 Kimi K3 (Reasoning, High)97.0%$0.0441.8m82%
99DeepSeek V3.291.9%$0.00141.9m69%
100Claude Sonnet 4.6 (Reasoning)97.5%$0.0601.2m79%
101Claude Opus 4.796.0%$0.06930.4s76%
102Qwen 3.6 27B97.4%$0.0252.3m77%
103Qwen 3.5 27B94.3%$0.0201.6m70%
104DeepSeek V4 Flash 0731 (Reasoning, High)94.7%$0.00222.6m73%
105DeepSeek V4 Pro (Reasoning)96.8%$0.0153.1m82%
106Claude Opus 4.8 (Reasoning)95.5%$0.07141.7s78%
107Qwen 3.8 Flash (Reasoning)96.5%$0.00643.1m78%
108Qwen 3.5 Plus (2026-02-15)85.2%$0.006031.5s58%
109Mistral NeMO86.4%$0.000510.1s48%
110Claude Sonnet 588.5%$0.02733.5s62%
111Gemma 3 12B85.3%$0.000441.3s55%
112Hermes 3 405B90.1%$0.003253.2s52%
113Claude Haiku 4.586.4%$0.01121.6s53%
114Claude Opus 5 (Reasoning, Low)97.4%$0.0971.0m86%
115Claude Opus 4.6 (Reasoning)97.7%$0.0881.4m85%
116GPT-5.4 (Reasoning)99.8%$0.0892.6m98%
117Gemini 2.5 Flash83.7%$0.005210.6s46%
118Gemma 4 31B85.5%$0.00101.6m61%
119DeepSeek V3.187.8%$0.00201.8m60%
120GPT-598.3%$0.0652.8m90%
121Claude Opus 5 (Reasoning)97.3%$0.0981.0m81%
122MiniMax M2.586.4%$0.00341.3m54%
123Qwen 3.6 Max Preview99.0%$0.0503.5m90%
124Gemini 3 Flash (Preview)81.3%$0.007819.6s48%
125Z.AI GLM 4.684.1%$0.006551.5s51%
126Gemma 3 4B79.9%$0.000220.0s46%
127Gemini 3.5 Flash (Reasoning)90.4%$0.07137.6s69%
128Arcee AI: Trinity Mini80.8%$0.00039.2s42%
129MiniMax M2.784.4%$0.00401.1m52%
130Gemma 4 31B (Reasoning)88.1%$0.00142.2m60%
131Qwen 3.5 397B A17B92.6%$0.0143.0m70%
132Laguna XS 2.180.3%$0.000314.4s41%
133GPT-5.5100.0%$0.1391.7m100%
134GPT-5.5 (Reasoning)100.0%$0.1421.8m100%
135GPT-5.5 (Reasoning, Low)99.9%$0.1391.8m98%
136Claude Sonnet 5 (Reasoning, Low)86.0%$0.03138.4s50%
137Qwen 3.7 Max95.5%$0.0682.3m78%
138Gemini 3.1 Pro (Preview)97.7%$0.1071.8m83%
139MiniMax M391.4%$0.00603.1m61%
140Qwen 3.8 27B (Reasoning, XHigh)98.0%$0.0404.7m89%
141Gemini 2.5 Flash Lite75.4%$0.00099.5s39%
142Grok 4.3 (Reasoning)90.8%$0.0212.3m55%
143Kimi K2.591.0%$0.0193.2m63%
144Cohere Command R+ (Aug. 2024)81.8%$0.02052.5s38%
145Hy4 Preview (Reasoning, High)95.2%$0.0404.4m77%
146Claude Opus 4.585.4%$0.07053.4s55%
147Gemini 3.1 Flash Lite70.8%$0.003012.1s33%
148Gemini 3 Flash (Preview, Reasoning)74.2%$0.01230.1s37%
149Gemini 3.1 Flash Lite (Preview)70.4%$0.00308.4s32%
150Z.AI GLM 5.3 Flash (Reasoning, Max)97.7%$0.00316.5m82%
151GPT-4o, Aug. 6th (temp=0)77.8%$0.02322.7s34%
152ByteDance Seed 2.0 Lite83.2%$0.0122.2m46%
153Laguna S 2.171.3%$0.000522.1s27%
154Gemini 3.1 Flash Lite (Reasoning)67.0%$0.003011.9s29%
155Hermes 3 70B73.8%$0.00101.2m31%
156Thinking Machines Inkling (Reasoning)90.8%$0.0255.1m72%
157WizardLM 2 8x22b79.3%$0.00261.8m31%
158Gemma 4 26B71.4%$0.000955.1s28%
159Z.AI GLM 4.570.5%$0.005142.1s26%
160Z.AI GLM 4.5 Air71.2%$0.002958.2s26%
161Qwen 2.5 72B66.2%$0.001036.7s24%
162Kimi K2.698.0%$0.0586.5m88%
163Cydonia 24B V4.167.0%$0.001444.8s22%
164Qwen 3.8 Max (Reasoning, XHigh)98.8%$0.0835.9m85%
165Gemini 2.5 Flash Lite (Reasoning)62.8%$0.002830.8s21%
166ByteDance Seed 1.674.2%$0.0132.5m33%
167Thinking Machines Inkling Small (Reasoning, High)69.3%$0.00881.7m27%
168Z.AI GLM 5.3 (Reasoning, Max)98.3%$0.0667.3m90%
169Gemma 4 26B (Reasoning)69.5%$0.00132.0m25%
170GPT-5 Nano61.0%$0.00421.4m25%
171Claude Opus 493.7%$0.2091.4m72%
172Claude Sonnet 464.0%$0.03243.7s18%
173ByteDance Seed 2.0 Mini75.4%$0.00454.9m36%
174Nemotron 3 Super51.5%$0.00001.4m15%
175Llama 3.1 70B44.9%$0.001529.4s10%
176Inception Mercury 240.8%$0.00327.0s10%
177GPT-OSS 120B49.5%$0.00151.8m12%
178Mistral Small 3.2 24B77.6%$0.00685.6m26%
179Nemotron 3 Nano25.6%$0.00101.1m2%
90.39%

Individual Scenarios

Detailed Writing Rules

Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Kimi K3 (Reasoning, High)100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
GPT-5100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100.0%
Thinking Machines Inkling (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.1100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
Qwen 3.5 122B100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
GPT-5.2100100100100100100.0%
GPT-5.5100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
Aion 3.0100100100100100100.0%
o4 Mini High100100100100100100.0%
Qwen 3.7 Flash (Reasoning)100100100100100100.0%
Qwen 3.6 27B100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
GPT-4.1100100100100100100.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100100.0%
o4 Mini100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
GPT-5.4100100100100100100.0%
Mistral Large 3100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
Aion 3.0 Mini100100100100100100.0%
GPT-5.4 Mini (Reasoning, Low)100100100100100100.0%
Z.AI GLM 4.7 Flash100100100100100100.0%
Mistral Large 2100100100100100100.0%
GPT-5.4 Mini100100100100100100.0%
DeepSeek V3 (2025-03-24)100100100100100100.0%
Mistral Small 4 (Reasoning)100100100100100100.0%
Writer: Palmyra X5100100100100100100.0%
Qwen 3 235B A22B Instruct 2507100100100100100100.0%
Grok 4.3100100100100100100.0%
GPT-5.4 Nano (Reasoning, Low)100100100100100100.0%
Mistral Medium 3.1100100100100100100.0%
Mistral Small 4100100100100100100.0%
Thinking Machines Inkling100100100100100100.0%
GPT-5.4 Nano100100100100100100.0%
ByteDance Seed 1.6 Flash100100100100100100.0%
Ministral 3 14B100100100100100100.0%
Grok 4.5 (Reasoning, High)10010010010010099.9%
Claude Opus 4.8 (Reasoning)10010010010010099.9%
Grok 4.201001001001009999.9%
Z.AI GLM 5.2 (Reasoning, High)1001001001009999.8%
GPT-5.4 Nano (Reasoning)1001001001009999.7%
Qwen 3 32B1001001001009899.6%
Z.AI GLM 5.3 Flash (Reasoning, Low)1001001001009799.4%
Ministral 3 8B1001001001009799.4%
Qwen 3.5 35B1001001001009599.0%
Gemini 3.7 Flash (Reasoning, Medium)1001001001009498.9%
GPT-4o Mini (temp=1)1001001001009198.2%
WizardLM 2 8x22b100100100999097.8%
GPT-4o, Aug. 6th (temp=1)1001001001008997.7%
DeepSeek V4 Pro 0813 (Reasoning, High)1001001001008797.5%
Aion 2.01001001001008496.8%
Kimi K2.61001001001008396.7%
Ministral 8B100100100948896.5%
DeepSeek V3 (2024-12-26)1001001001008296.5%
Kimi K2.5100100100968696.5%
DeepSeek V4 Pro1001001001008196.1%
Claude Opus 4.8 (Reasoning, Low)100100100908995.7%
Arcee AI: Trinity Mini100100100958395.6%
Qwen 3.5 Plus (2026-02-15)100100100948495.5%
Z.AI GLM 5100100100928495.3%
Grok 4.5 (Reasoning, Low)1001001001007695.1%
GPT-5 Mini100100100987895.1%
Claude Opus 5 (Reasoning, Low)1001001001007494.8%
Claude Sonnet 4.6 (Reasoning)1001001001007194.1%
Z.AI GLM 4.710010093918493.7%
MiniMax M2.7969595929093.7%
ByteDance Seed 1.6100100100947193.0%
Claude Sonnet 4.5100100100877692.6%
Xiaomi MIMO v2.5 Pro10010099897392.3%
Z.AI GLM 5 Turbo1009897927592.3%
GPT-4.1 Nano1009895917692.1%
Claude Opus 4.6 (Reasoning)100100100916992.0%
MiniMax M3100100100916891.9%
Gemma 3 27B100100100936391.3%
Claude Opus 41001001001005591.1%
Gemini 3.5 Flash (Reasoning, Minimal)10010095906690.3%
DeepSeek V3.2100100100777389.9%
Gemini 3.5 Flash (Reasoning)100100100955289.5%
Thinking Machines Inkling Small (Reasoning, High)100100100826288.8%
DeepSeek V4 Flash100100100826088.4%
Gemini 2.5 Pro1001001001004288.4%
GPT-4.1 Mini100100100875287.9%
Gemini 3.5 Flash Lite (Reasoning)100100100974187.5%
Gemma 4 31B (Reasoning)10010098855487.1%
ByteDance Seed 2.0 Lite100100100983787.1%
Claude Opus 4.510010090786686.8%
Claude Sonnet 5 (Reasoning, Low)10010095884184.8%
Claude Sonnet 5 (Reasoning)1009893893382.4%
Ministral 3B100100100100981.8%
DeepSeek V4 Flash (Reasoning)100100100733481.5%
Gemini 3 Flash (Preview, Reasoning)10010084744981.4%
DeepSeek V4 Flash 0731 (Reasoning, High)1009983773378.4%
Gemini 3.1 Flash Lite1009872635577.9%
Hermes 3 70B10010010086077.1%
Gemini 2.5 Flash (Reasoning)1009976664076.3%
Claude Sonnet 5100100100542776.1%
DeepSeek-V2 Chat100100100701176.1%
Ministral 3 3B100100100522775.7%
Mistral NeMO1009188881175.6%
GPT-4o Mini (temp=0)878275736175.5%
Gemini 3.1 Flash Lite (Preview)1007469676274.3%
Gemini 3.5 Flash Lite (Reasoning, Minimal)10010071543371.6%
Gemini 3 Flash (Preview)968880632770.8%
Gemma 3 4B887971714470.3%
Gemma 4 26B837975654869.9%
Xiaomi MIMO v2.510010084511369.6%
Z.AI GLM 4.61007974633269.4%
GPT-4o, Aug. 6th (temp=0)100948862068.9%
GPT-OSS 120B1007166633567.0%
Gemma 4 31B1008765483366.5%
Hermes 3 405B10010056462665.7%
Nemotron 3 Super1008654453864.8%
Z.AI GLM 4.5100837365064.2%
DeepSeek V3.1948869601064.1%
Claude Haiku 4.591837766063.4%
Laguna XS 2.110010066311662.7%
Inception Mercury 21007363403562.3%
Cydonia 24B V4.11001005742560.9%
Gemini 3.1 Flash Lite (Reasoning)1007256541559.4%
Claude Sonnet 41007752331956.2%
ByteDance Seed 2.0 Mini1001005411053.0%
GPT-5 Nano716856402852.7%
MiniMax M2.5100864136052.6%
Gemini 2.5 Flash100893825451.2%
Z.AI GLM 4.5 Air1006737292251.0%
Gemma 4 26B (Reasoning)8579449043.4%
Gemma 3 12B85553327039.9%
Nemotron 3 Nano8166330035.9%
Llama 3.1 70B1007500035.0%
Gemini 2.5 Flash Lite63464218033.8%
Qwen 2.5 72B6050155026.1%
Gemini 2.5 Flash Lite (Reasoning)6129150020.9%
Mistral Small 3.2 24B3832210018.3%
Cohere Command R+ (Aug. 2024)71000014.3%
Laguna S 2.13900007.8%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Kimi K2.6100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
GPT-5 Mini100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100.0%
Kimi K2.5100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.1100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
GPT-5.2100100100100100100.0%
GPT-5.5100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
Aion 3.0100100100100100100.0%
o4 Mini High100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100100100100.0%
Qwen 3.7 Flash (Reasoning)100100100100100100.0%
Qwen 3.6 27B100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
DeepSeek V4 Flash (Reasoning)100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Claude Opus 4100100100100100100.0%
GPT-4.1100100100100100100.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100100.0%
Aion 2.0100100100100100100.0%
o4 Mini100100100100100100.0%
Qwen 3.5 Plus (2026-02-15)100100100100100100.0%
Xiaomi MIMO v2.5 Pro100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
GPT-5.4100100100100100100.0%
Mistral Large 3100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
GPT-5.4 Mini (Reasoning, Low)100100100100100100.0%
Claude Haiku 4.5100100100100100100.0%
Z.AI GLM 4.7 Flash100100100100100100.0%
Grok 4.20100100100100100100.0%
GPT-5.4 Mini100100100100100100.0%
DeepSeek V3 (2025-03-24)100100100100100100.0%
Mistral Small 4 (Reasoning)100100100100100100.0%
Qwen 3 32B100100100100100100.0%
Writer: Palmyra X5100100100100100100.0%
Qwen 3 235B A22B Instruct 2507100100100100100100.0%
Grok 4.3100100100100100100.0%
GPT-5.4 Nano (Reasoning, Low)100100100100100100.0%
Mistral Medium 3.1100100100100100100.0%
Mistral Small 4100100100100100100.0%
ByteDance Seed 1.6 Flash100100100100100100.0%
Ministral 3 14B100100100100100100.0%
Ministral 3 8B100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning)1001001001009999.7%
Gemma 4 31B (Reasoning)1001001001009999.7%
Gemini 3.6 Flash (Reasoning)1001001001009799.5%
GPT-51001001001009799.4%
Kimi K3 (Reasoning, High)1001001001009699.3%
WizardLM 2 8x22b1001001001009699.2%
Z.AI GLM 4.71001001001009598.9%
Z.AI GLM 51001001001009498.9%
Grok 4.5 (Reasoning, Low)1001001001009398.6%
Grok 4.5 (Reasoning, High)1001001001009298.5%
DeepSeek V4 Flash1001001001009298.4%
Ministral 3 3B1001001001009298.4%
Claude Sonnet 5 (Reasoning)1001001001009198.1%
GPT-4.1 Mini1001001001009098.0%
DeepSeek V4 Pro1001001001008997.7%
Claude Sonnet 51001001001008997.7%
Qwen 3.5 122B1001001001008797.5%
ByteDance Seed 2.0 Lite1001001001008797.4%
Z.AI GLM 5 Turbo1001001001008697.2%
Thinking Machines Inkling100100100988897.2%
Gemma 4 31B100100100978997.1%
DeepSeek V3.11001001001008597.1%
Ministral 3B1001001001008396.6%
Z.AI GLM 4.6100100100919196.5%
GPT-5.4 Nano (Reasoning)1001001001008196.2%
GPT-4o Mini (temp=1)100100100928895.9%
DeepSeek-V2 Chat100100100948595.8%
Gemini 3.5 Flash (Reasoning)100100100918795.6%
Claude Opus 4.8 (Reasoning, Low)100100100997995.6%
DeepSeek V4 Flash 0731 (Reasoning, High)1001001001007795.4%
Claude Opus 5 (Reasoning, Low)1001001001007695.1%
Qwen 3.5 35B1001001001007595.1%
DeepSeek V3 (2024-12-26)1001001001007595.0%
DeepSeek V3.2100100100898594.7%
Grok 4.3 (Reasoning)1001001001007394.6%
MiniMax M2.5100100100878594.3%
Claude Opus 4.510010098878694.3%
Claude Sonnet 41001001001007194.1%
GPT-5.4 Nano100100100898093.8%
DeepSeek V4 Pro 0813 (Reasoning, High)1001001001006693.2%
Aion 3.0 Mini1001001001006592.9%
Gemini 3.5 Flash Lite (Reasoning)1001001001006192.2%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100867391.8%
Z.AI GLM 5.2 (Reasoning, High)100100100846890.5%
Mistral Large 2100100100826990.2%
Z.AI GLM 4.51009588887188.6%
GPT-4o Mini (temp=0)1009189897188.0%
Gemma 4 26B10010099756487.7%
Hermes 3 405B1001001001003687.1%
GPT-4.1 Nano100100100864886.8%
Gemma 4 26B (Reasoning)1009897884986.3%
Gemini 2.5 Pro10010081777486.3%
MiniMax M2.7100100100725585.4%
Gemini 3 Flash (Preview)10010098834384.8%
MiniMax M31001001001002084.0%
GPT-4o, Aug. 6th (temp=1)10010082766083.5%
Thinking Machines Inkling (Reasoning)1009189884883.1%
Gemini 3 Flash (Preview, Reasoning)10010083745883.0%
Ministral 8B1001001001001382.6%
Gemma 3 27B1009382815381.7%
Gemini 2.5 Flash (Reasoning)1008881706781.3%
Gemini 2.5 Flash1009980636380.9%
Mistral Small 3.2 24B100100100100080.0%
Arcee AI: Trinity Mini100100100792080.0%
Gemini 3.1 Flash Lite (Preview)10010073646179.7%
Thinking Machines Inkling Small (Reasoning, High)10010079704879.3%
Xiaomi MIMO v2.510010082773779.2%
Gemini 3.5 Flash (Reasoning, Minimal)10010094593978.3%
Gemma 3 12B959379645878.0%
ByteDance Seed 2.0 Mini100100100711877.8%
Laguna XS 2.110010091831377.4%
Gemini 3.1 Flash Lite1009878743076.1%
GPT-4o, Aug. 6th (temp=0)978983623072.3%
Laguna S 2.11008582672070.9%
Hermes 3 70B100919073070.8%
Gemini 3.1 Flash Lite (Reasoning)868382603669.5%
Z.AI GLM 4.5 Air1009174561867.7%
ByteDance Seed 1.610010070382666.9%
Gemma 3 4B757166615164.8%
Mistral NeMO100767059060.9%
Nemotron 3 Super908344361854.3%
Cydonia 24B V4.196815137754.3%
Cohere Command R+ (Aug. 2024)100684436049.5%
GPT-5 Nano100634439049.2%
Gemini 2.5 Flash Lite894542241142.2%
Qwen 2.5 72B9251391036.9%
GPT-OSS 120B52483832234.2%
Llama 3.1 70B1002200024.4%
Nemotron 3 Nano3633170017.3%
Inception Mercury 2373330014.5%
Gemini 2.5 Flash Lite (Reasoning)42960011.4%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Grok 4.5 (Reasoning, High)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
Kimi K2.6100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.1100100100100