Narrator intent-glossing

Test: Bad Writing Habits

Avg. Score
74.5%
Scenarios
18

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1GPT-5.6 Luna (Reasoning)98.4%$0.01718.0s86%
2GPT-5.6 Luna95.5%$0.01515.8s77%
3Qwen 3.7 Flash (Reasoning)96.2%$0.001055.2s75%
4GPT-5.6 Terra98.6%$0.04636.9s88%
5GPT-5.6 Terra (Reasoning)97.1%$0.04435.2s84%
6o4 Mini92.2%$0.01525.7s68%
7DeepSeek V4.1 Flash (Reasoning, High)92.8%$0.002935.4s64%
8Qwen 3.6 Flash93.1%$0.01041.4s65%
9Gemini 3.7 Flash (Reasoning, Medium)92.2%$0.01218.2s59%
10Gemini 3.8 Flash (Reasoning, Medium)91.5%$0.01418.0s59%
11Qwen 3.6 35B93.7%$0.00831.0m63%
12Gemini 3.6 Flash (Reasoning, Minimal)90.5%$0.01714.3s58%
13Gemini 3.5 Flash Lite (Reasoning, Minimal)88.3%$0.00356.3s51%
14Muse Glimmer 30B (Reasoning, Medium)91.5%$0.003843.4s54%
15GPT-5.6 Sol (Reasoning)100.0%$0.1081.2m100%
16Qwen 3.5 Plus (2026-04-20)95.1%$0.0171.8m71%
17Gemini 3.6 Flash (Reasoning)94.2%$0.04432.5s67%
18GPT-5.4 Mini (Reasoning, Low)87.7%$0.01516.8s56%
19Muse Spark 1.3 (Reasoning, Medium)95.9%$0.0251.8m73%
20o4 Mini High92.9%$0.02547.2s62%
21Grok 4.387.3%$0.006930.5s55%
22Muse Spark 1.2 (Reasoning, Medium)90.7%$0.01838.3s58%
23GPT-5.4 Mini86.0%$0.01516.8s56%
24Qwen 3.5 9B88.7%$0.00111.4m57%
25DeepSeek V3 (2025-03-24)85.8%$0.001439.4s50%
26Hermes 3 405B89.5%$0.003253.2s50%
27ByteDance Seed 1.6 Flash84.2%$0.001327.3s48%
28Qwen 3.5 Flash85.5%$0.002547.5s49%
29GPT-5.6 Sol98.7%$0.1051.2m88%
30GPT-5.4 (Reasoning, Low)93.1%$0.0551.4m72%
31Qwen 3 235B A22B Instruct 250787.0%$0.001159.2s47%
32Gemini 3.5 Flash Lite (Reasoning)83.7%$0.00356.6s38%
33Muse Spark 1.1 (Reasoning, Medium)85.9%$0.01523.9s45%
34GPT-5.4 Mini (Reasoning)84.4%$0.02228.1s51%
35Grok 4.5 (Reasoning, Low)87.4%$0.0181.1m53%
36GPT-5.492.0%$0.0491.4m67%
37Qwen 3.6 27B93.5%$0.0252.3m65%
38Mistral NeMO81.9%$0.000510.1s36%
39Muse Spark 1.1 (Reasoning, Minimal)83.5%$0.01219.2s41%
40Writer: Palmyra X584.3%$0.01122.0s41%
41Mistral Medium 3.183.0%$0.004836.5s42%
42Mistral Small 479.1%$0.001418.2s38%
43Qwen 3 32B80.7%$0.001554.6s42%
44Qwen 3.5 27B86.5%$0.0201.6m52%
45Qwen 3.6 Max Preview96.4%$0.0503.5m82%
46 Kimi K3 (Reasoning, High)91.6%$0.0441.8m60%
47Grok 4.20 (Reasoning)85.4%$0.0181.5m49%
48Qwen 3.5 35B82.4%$0.0181.0m45%
49Ministral 3 14B75.1%$0.000711.7s33%
50Gemini 3.5 Flash (Reasoning, Minimal)78.8%$0.01812.0s35%
51Qwen 2.5 72B77.4%$0.001036.7s34%
52Kimi K3 (Reasoning, Low)85.8%$0.0281.1m44%
53GPT-4.179.6%$0.01844.7s40%
54Thinking Machines Inkling81.7%$0.00751.5m42%
55Qwen 3.5 397B A17B89.1%$0.0143.0m58%
56Hermes 3 70B80.5%$0.00101.2m36%
57GPT-5.4 (Reasoning)96.0%$0.0892.6m81%
58DeepSeek V3 (2024-12-26)78.1%$0.002154.6s35%
59DeepSeek-V2 Chat78.1%$0.002153.3s34%
60Qwen 3.5 122B83.1%$0.0251.1m43%
61Gemini 3.5 Flash (Reasoning)88.7%$0.07137.6s51%
62Qwen 3.7 Max94.0%$0.0682.3m67%
63Qwen 3.8 Flash (Reasoning)88.6%$0.00643.1m54%
64DeepSeek V4 Flash (Reasoning)75.1%$0.000731.1s30%
65Mistral Large 374.6%$0.003330.3s31%
66GPT-4o Mini (temp=1)74.4%$0.001234.8s31%
67Xiaomi MIMO v2.5 Pro76.6%$0.008553.5s35%
68GPT-4o Mini (temp=0)73.6%$0.001234.8s30%
69Gemini 3.1 Pro (Preview)95.7%$0.1071.8m72%
70Grok 4.3 (Reasoning)86.8%$0.0212.3m48%
71GPT-5.598.0%$0.1391.7m84%
72Ministral 3 3B70.8%$0.000511.1s24%
73Z.AI GLM 5.3 Flash (Reasoning, Low)76.0%$0.00051.1m31%
74DeepSeek V4 Pro 0813 (Reasoning, High)84.4%$0.0251.8m42%
75Ministral 3B70.2%$0.00018.1s22%
76GPT-5.5 (Reasoning)96.7%$0.1421.8m82%
77ByteDance Seed 2.0 Lite83.7%$0.0122.2m40%
78Laguna XS 2.169.4%$0.000314.4s22%
79Mistral Large 272.3%$0.01329.4s28%
80Grok 4.5 (Reasoning, High)83.3%$0.0301.6m38%
81Ministral 3 8B70.1%$0.000819.6s21%
82Claude Opus 5 (Reasoning, Low)90.4%$0.0971.0m54%
83GPT-5.5 (Reasoning, Low)96.1%$0.1391.8m76%
84DeepSeek V4 Flash68.3%$0.000631.6s24%
85DeepSeek V4 Flash 0731 (Reasoning, High)80.8%$0.00222.6m39%
86Mistral Small 4 (Reasoning)68.6%$0.002230.2s24%
87Gemma 3 12B68.9%$0.000441.3s24%
88DeepSeek V3.275.5%$0.00141.9m34%
89Claude Opus 4.8 (Reasoning, Low)82.3%$0.07141.9s42%
90Qwen 3.8 27B (Reasoning, XHigh)94.4%$0.0404.7m69%
91Claude Opus 4.8 (Reasoning)82.4%$0.07141.7s41%
92Gemini 3.1 Flash Lite65.9%$0.003012.1s20%
93Gemini 3.1 Flash Lite (Preview)64.5%$0.00308.4s20%
94Claude Opus 584.4%$0.08250.1s45%
95Claude Opus 5 (Reasoning)88.2%$0.0981.0m51%
96DeepSeek V4 Pro71.9%$0.00481.3m29%
97Ministral 8B65.4%$0.000410.4s18%
98Qwen 3.5 Plus (2026-02-15)67.8%$0.006031.5s23%
99GPT-4o, Aug. 6th (temp=0)72.1%$0.02322.7s24%
100Grok 4.2068.1%$0.009345.7s27%
101Arcee AI: Trinity Mini66.2%$0.00039.2s16%
102Xiaomi MIMO v2.567.5%$0.005431.8s22%
103Gemma 3 27B68.7%$0.000652.6s23%
104Z.AI GLM 4.772.6%$0.0101.4m31%
105Kimi K2.583.0%$0.0193.2m46%
106Cohere Command R+ (Aug. 2024)74.2%$0.02052.5s24%
107Gemini 3.1 Flash Lite (Reasoning)63.2%$0.003011.9s18%
108Gemini 2.5 Pro72.1%$0.03636.2s29%
109Aion 3.0 Mini70.4%$0.00531.2m23%
110Z.AI GLM 5.2 (Reasoning, High)68.7%$0.0111.0m25%
111Aion 3.072.8%$0.0241.0m27%
112Gemma 3 4B63.6%$0.000220.0s16%
113Aion 2.069.0%$0.00641.3m25%
114Grok 4.6 (Reasoning, High)82.2%$0.0422.5m44%
115Gemini 3 Flash (Preview)61.1%$0.007819.6s21%
116GPT-4.1 Mini63.3%$0.002719.0s15%
117GPT-5.179.5%$0.0541.8m41%
118Z.AI GLM 4.7 Flash66.1%$0.00171.2m23%
119Gemini 2.5 Flash58.5%$0.005210.6s18%
120Laguna S 2.160.6%$0.000522.1s16%
121ByteDance Seed 1.676.7%$0.0132.5m33%
122Claude Sonnet 4.669.8%$0.03139.3s23%
123Hy4 Preview (Reasoning, High)90.9%$0.0404.4m55%
124Z.AI GLM 566.0%$0.00841.2m22%
125GPT-4o, Aug. 6th (temp=1)64.3%$0.01824.4s17%
126MiniMax M374.4%$0.00603.1m35%
127Z.AI GLM 4.561.9%$0.005142.1s14%
128Llama 3.1 70B59.0%$0.001529.4s12%
129Claude Opus 4.7 (Reasoning)75.3%$0.07632.0s30%
130Claude Sonnet 4.565.3%$0.03538.1s21%
131Z.AI GLM 5.3 Flash (Reasoning, Max)92.5%$0.00316.5m57%
132Claude Opus 4.772.8%$0.06930.4s28%
133Z.AI GLM 5 Turbo58.3%$0.008133.2s14%
134GPT-4.1 Nano53.9%$0.000713.3s11%
135Cydonia 24B V4.158.1%$0.001444.8s13%
136WizardLM 2 8x22b66.7%$0.00261.8m19%
137Z.AI GLM 5.165.2%$0.0141.5m20%
138Z.AI GLM 4.658.5%$0.006551.5s14%
139DeepSeek V3.163.6%$0.00201.8m19%
140Z.AI GLM 4.5 Air59.6%$0.002958.2s12%
141Gemini 2.5 Flash (Reasoning)51.1%$0.01121.5s13%
142Gemini 2.5 Flash Lite48.0%$0.00099.5s9%
143DeepSeek V4 Pro (Reasoning)72.7%$0.0153.1m28%
144GPT-5.4 Nano (Reasoning, Low)45.1%$0.005520.6s15%
145Gemini 3 Flash (Preview, Reasoning)51.7%$0.01230.1s12%
146MiniMax M2.556.4%$0.00341.3m11%
147GPT-5.4 Nano (Reasoning)44.3%$0.006124.5s12%
148MiniMax M2.753.9%$0.00401.1m10%
149ByteDance Seed 2.0 Mini79.3%$0.00454.9m34%
150Claude Opus 4.668.8%$0.0781.2m29%
151GPT-5.4 Nano42.2%$0.005726.3s12%
152Thinking Machines Inkling Small (Reasoning, High)58.7%$0.00881.7m13%
153Z.AI GLM 5.3 (Reasoning, Max)96.3%$0.0667.3m76%
154Gemma 4 31B (Reasoning)57.2%$0.00142.2m16%
155Qwen 3.8 Max (Reasoning, XHigh)93.5%$0.0835.9m66%
156Gemma 4 31B52.1%$0.00101.6m13%
157Claude Opus 4.6 (Reasoning)73.0%$0.0881.4m27%
158Gemma 4 26B47.1%$0.000955.1s8%
159Claude Haiku 4.545.5%$0.01121.6s7%
160Claude Sonnet 4.6 (Reasoning)64.8%$0.0601.2m17%
161Claude Sonnet 454.4%$0.03243.7s9%
162GPT-572.2%$0.0652.8m32%
163Claude Sonnet 5 (Reasoning, Low)50.6%$0.03138.4s8%
164Gemini 2.5 Flash Lite (Reasoning)36.8%$0.002830.8s7%
165Claude Sonnet 545.5%$0.02733.5s7%
166Claude Sonnet 5 (Reasoning)45.5%$0.03038.9s9%
167Gemma 4 26B (Reasoning)49.8%$0.00132.0m8%
168Mistral Small 3.2 24B80.0%$0.00695.7m27%
169GPT-5 Mini39.3%$0.010057.4s8%
170Inception Mercury 232.3%$0.00327.0s1%
171GPT-5.254.6%$0.0561.5m15%
172Kimi K2.686.5%$0.0586.5m47%
173Claude Opus 4.552.8%$0.07053.4s11%
174Thinking Machines Inkling (Reasoning)70.7%$0.0255.1m26%
175Nemotron 3 Super32.9%$0.00001.4m5%
176GPT-OSS 120B31.9%$0.00151.8m5%
177Nemotron 3 Nano15.6%$0.00101.1m0%
178GPT-5 Nano10.4%$0.00421.4m0%
179Claude Opus 471.2%$0.2091.4m29%
74.46%

Individual Scenarios

Detailed Writing Rules

Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
o4 Mini High100100100100100100.0%
Qwen 3.7 Flash (Reasoning)100100100100100100.0%
Qwen 3.6 35B1001001001009799.5%
GPT-5.51001001001009799.4%
Gemini 3.7 Flash (Reasoning, Medium)1001001001009498.9%
Z.AI GLM 5.3 Flash (Reasoning, Low)1001001001009398.6%
GPT-5.6 Terra1001001001009298.5%
Qwen 3.8 27B (Reasoning, XHigh)1001001001009098.1%
Hy4 Preview (Reasoning, High)1001001001008997.8%
Hermes 3 405B100100100949397.5%
Thinking Machines Inkling100100100969297.5%
Grok 4.31001001001008797.3%
Claude Opus 5 (Reasoning)1001001001008396.7%
Grok 4.3 (Reasoning)100100100998396.5%
Muse Glimmer 30B (Reasoning, Medium)1001001001008095.9%
Muse Spark 1.2 (Reasoning, Medium)100100100898895.3%
Z.AI GLM 5.3 (Reasoning, Max)1001001001007695.3%
DeepSeek V3.21001001001007595.1%
Kimi K2.6100100100938194.7%
DeepSeek V3 (2025-03-24)1001001001007294.4%
Kimi K3 (Reasoning, High)1001001001006993.9%
Claude Opus 51001001001006793.3%
Qwen 3.8 Max (Reasoning, XHigh)1001001001006492.8%
Gemini 3.6 Flash (Reasoning)1001001001006192.1%
GPT-5.11001001001005691.1%
Qwen 3.5 Flash100100100966091.1%
Qwen 3.5 27B1001001001005490.8%
GPT-5.4 Mini (Reasoning, Low)1001001001005390.6%
Qwen 3.5 122B1001001001005390.5%
Gemini 3.6 Flash (Reasoning, Minimal)100100100757590.1%
Qwen 3 32B100100100767389.8%
Claude Opus 5 (Reasoning, Low)1001001001004889.6%
Grok 4.20 (Reasoning)10010097856589.5%
Claude Opus 4.610010085827989.0%
GPT-5.4100100100855788.4%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100796187.9%
Qwen 3 235B A22B Instruct 2507100100100716887.7%
GPT-5.5 (Reasoning, Low)100100100993787.3%
GPT-5.4 (Reasoning, Low)1009088827586.8%
Qwen 3.5 9B10010098884886.7%
Muse Spark 1.1 (Reasoning, Medium)100100100983286.1%
Gemini 3.1 Pro (Preview)100100100933685.8%
Qwen 3.7 Max100100100795085.7%
Kimi K2.510010098646284.8%
Gemini 3.5 Flash (Reasoning)100100100734984.3%
o4 Mini100100100784484.3%
Qwen 3.5 397B A17B1009390795984.3%
GPT-5.6 Luna1001001001001883.7%
Grok 4.6 (Reasoning, High)10010094636083.2%
Mistral Small 410010093823682.4%
GPT-4.1 Mini100100100713881.7%
Qwen 3.5 35B10010098752980.5%
Ministral 3 14B10010093842580.5%
GPT-5.4 Mini (Reasoning)10010095852180.3%
GPT-4o Mini (temp=1)100100100742780.3%
DeepSeek V4 Pro10010078626180.1%
Claude Sonnet 4.6 (Reasoning)100100100623880.1%
DeepSeek V3 (2024-12-26)100100100100080.0%
Hermes 3 70B10010093673679.2%
Muse Spark 1.1 (Reasoning, Minimal)10010010089679.0%
GPT-4.11009089892578.7%
DeepSeek V4 Pro 0813 (Reasoning, High)10010088822177.9%
Qwen 3.6 27B100100100612877.8%
Grok 4.5 (Reasoning, High)10010010084076.8%
ByteDance Seed 2.0 Mini10010010081376.7%
Z.AI GLM 5.2 (Reasoning, High)100100100502374.7%
GPT-4o, Aug. 6th (temp=0)100100100541874.5%
GPT-5.4 Mini1009879474674.0%
Mistral NeMO1001009868073.2%
Claude Opus 4.8 (Reasoning, Low)10010010059071.8%
Gemini 3.5 Flash Lite (Reasoning, Minimal)10010081571871.3%
Aion 2.01008582731170.2%
Claude Opus 4.7 (Reasoning)10010010050070.0%
Kimi K3 (Reasoning, Low)1001008657068.7%
ByteDance Seed 1.61008964413666.1%
Arcee AI: Trinity Mini1001007654066.1%
Gemini 3.5 Flash (Reasoning, Minimal)1001007552366.1%
Aion 3.0100100100181165.9%
Claude Opus 4.8 (Reasoning)99989636065.8%
Mistral Large 2100967250865.2%
ByteDance Seed 2.0 Lite1009967411865.1%
MiniMax M3100858451064.2%
Qwen 2.5 72B1007167443864.0%
ByteDance Seed 1.6 Flash10010051472264.0%
Claude Sonnet 4.51001009023062.5%
Gemini 3.1 Flash Lite (Preview)100766967062.5%
Writer: Palmyra X51001001008061.7%
Claude Opus 4.6 (Reasoning)1001006443061.3%
Cydonia 24B V4.1100827940060.1%
Claude Opus 4.71009464311160.1%
Laguna XS 2.11001001000060.0%
Ministral 3B1001001000060.0%
Z.AI GLM 4.6100856447059.2%
Thinking Machines Inkling (Reasoning)10098970058.9%
GPT-585848042058.3%
Claude Opus 4.5100746153157.7%
Gemini 3.5 Flash Lite (Reasoning)100100860057.2%
Cohere Command R+ (Aug. 2024)10093860055.8%
Z.AI GLM 5.1100886718054.7%
Gemini 3 Flash (Preview)90765446053.2%
Gemma 3 27B76756936352.1%
Mistral Medium 3.1100685527049.8%
Gemini 2.5 Pro100704133048.9%
Gemma 4 26B (Reasoning)1001003311048.8%
Aion 3.0 Mini10096470048.6%
Gemini 2.5 Flash696940362748.5%
Qwen 3.5 Plus (2026-02-15)10093426048.3%
Z.AI GLM 4.7100100360047.3%
DeepSeek V4 Pro (Reasoning)100504638046.8%
Xiaomi MIMO v2.5 Pro9492470046.6%
DeepSeek-V2 Chat100100310046.2%
Mistral Large 310077480045.0%
GPT-4o, Aug. 6th (temp=1)10071483044.3%
DeepSeek V3.19088430044.0%
MiniMax M2.7100100160043.2%
DeepSeek V4 Flash 0731 (Reasoning, High)10010050041.0%
Gemma 4 31B (Reasoning)10059460041.0%
Z.AI GLM 510052503041.0%
Laguna S 2.110056460040.3%
Ministral 8B10010000040.0%
Gemini 3 Flash (Preview, Reasoning)8657550039.5%
Gemini 3.1 Flash Lite (Reasoning)100611816039.0%
DeepSeek V4 Flash9352500039.0%
Gemma 3 12B10050440038.9%
Llama 3.1 70B1009300038.6%
GPT-OSS 120B9473137037.5%
Gemma 3 4B7971380037.5%
Z.AI GLM 5 Turbo10059250036.8%
Xiaomi MIMO v2.59073100034.7%
Claude Sonnet 5 (Reasoning, Low)8646360033.6%
Claude Opus 479601712033.6%
DeepSeek V4 Flash (Reasoning)1005270031.8%
GPT-5 Mini6758208030.6%
Claude Sonnet 4.65952390030.0%
Gemma 4 26B5653360029.0%
Mistral Small 4 (Reasoning)1003360027.7%
Thinking Machines Inkling Small (Reasoning, High)7346180027.5%
Grok 4.205442345027.1%
Z.AI GLM 4.51003500026.9%
GPT-4o Mini (temp=0)685750026.1%
Nemotron 3 Super854000025.0%
Claude Sonnet 5 (Reasoning)843400023.6%
GPT-4.1 Nano1001400022.7%
Z.AI GLM 4.5 Air100000020.0%
Ministral 3 8B98000019.6%
Inception Mercury 2643200019.2%
Claude Sonnet 56915110019.1%
Gemini 2.5 Flash Lite (Reasoning)5720170018.8%
Ministral 3 3B90000018.1%
GPT-5.4 Nano (Reasoning, Low)80500017.0%
Gemini 2.5 Flash Lite503500016.9%
GPT-5.4 Nano (Reasoning)452195016.1%
Gemma 4 31B72000014.4%
WizardLM 2 8x22b551000012.9%
Z.AI GLM 4.7 Flash401400010.8%
Gemini 3.1 Flash Lite54000010.8%
MiniMax M2.548600010.7%
GPT-5.4 Nano37970010.5%
Nemotron 3 Nano3100006.2%
GPT-5.21730004.1%
Claude Haiku 4.5731002.3%
Gemini 2.5 Flash (Reasoning)550001.9%
Claude Sonnet 4000000.0%
GPT-5 Nano000000.0%
Mistral Small 3.2 24B000000.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Kimi K3 (Reasoning, High)100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
o4 Mini High100100100100100100.0%
Qwen 3.6 27B100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100100.0%
Mistral Medium 3.1100100100100100100.0%
GPT-5.5 (Reasoning)1001001001009699.1%
Kimi K3 (Reasoning, Low)1001001001009699.1%
Grok 4.3 (Reasoning)1001001001009498.9%
Qwen 3.6 Max Preview1001001001009398.6%
Qwen 3 32B100100100989498.5%
Z.AI GLM 5.3 (Reasoning, Max)1001001001009298.4%
Claude Opus 4.6 (Reasoning)1001001001009098.0%
GPT-5.41001001001008997.7%
Laguna XS 2.1100100100988997.4%
GPT-5.6 Luna (Reasoning)100100100949397.4%
GPT-5.1100100100949397.4%
Qwen 3.7 Flash (Reasoning)1001001001008797.3%
Qwen 3.8 Flash (Reasoning)1001001001007995.7%
Z.AI GLM 4.71001001001007695.1%
GPT-5.5 (Reasoning, Low)1001001001007494.8%
DeepSeek V4 Pro 0813 (Reasoning, High)1001001001007494.8%
ByteDance Seed 2.0 Mini1001001001007294.4%
Qwen 3.7 Max1001001001007194.2%
Muse Spark 1.1 (Reasoning, Minimal)1001001001007194.1%
DeepSeek V4.1 Flash (Reasoning, High)1001001001006793.3%
Mistral Small 41001001001006593.1%
GPT-5.4 Mini (Reasoning)1001001001006292.5%
DeepSeek V3 (2025-03-24)1001001001006192.1%
GPT-5.51001001001005791.3%
GPT-4o, Aug. 6th (temp=0)100100100797891.2%
Qwen 3.5 397B A17B10010098896390.0%
Muse Spark 1.2 (Reasoning, Medium)1001001001005090.0%
Claude Opus 4.8 (Reasoning)1001001001005090.0%
GPT-4o, Aug. 6th (temp=1)100100100806589.0%
Qwen 3 235B A22B Instruct 25071001001001004488.9%
GPT-5.6 Luna1009995866288.5%
WizardLM 2 8x22b100100100964588.2%
Grok 4.20 (Reasoning)1009491866887.9%
Kimi K2.6100100100954487.9%
ByteDance Seed 1.6 Flash10010090886187.7%
Claude Sonnet 5 (Reasoning, Low)1001001001003687.3%
DeepSeek-V2 Chat100100100815486.9%
Claude Sonnet 4.6 (Reasoning)100100100795686.8%
Xiaomi MIMO v2.5 Pro1009898716586.6%
Gemini 3.5 Flash Lite (Reasoning, Minimal)1001001001003186.2%
Aion 3.010010083796886.0%
Gemini 3.6 Flash (Reasoning)1001001001002985.8%
Grok 4.5 (Reasoning, High)1001001001002785.3%
MiniMax M31001001001002785.3%
o4 Mini100100100814685.3%
Qwen 3.5 122B100100100646184.9%
GPT-4.11008888836584.8%
DeepSeek V4 Flash100100100883684.8%
Z.AI GLM 5.3 Flash (Reasoning, Low)10010099745084.6%
Mistral Small 4 (Reasoning)1009487756784.5%
Thinking Machines Inkling10010089755784.4%
Mistral Large 310010089795484.3%
Ministral 3 8B100100100655483.8%
GPT-4.1 Mini10010082785983.8%
GPT-5.4 Mini1009490745983.6%
Claude Opus 4.8 (Reasoning, Low)1001001001001683.2%
Qwen 3.5 Plus (2026-02-15)1001001001001683.2%
Z.AI GLM 5.110010090804683.2%
GPT-5.4 Mini (Reasoning, Low)10010079676782.7%
Writer: Palmyra X5100100100654882.6%
Qwen 3.6 Flash1001001001001182.2%
Grok 4.201009292784982.0%
Qwen 3.5 Plus (2026-04-20)100100100100981.8%
DeepSeek V4 Flash (Reasoning)100100100100681.2%
Z.AI GLM 5100100100713581.1%
DeepSeek V3.210010098822480.7%
Kimi K2.5100100100732980.4%
ByteDance Seed 2.0 Lite100100100100080.0%
Mistral Small 3.2 24B100100100100080.0%
Grok 4.310010098841379.2%
Claude Opus 510010075685178.9%
GPT-510010084654578.7%
Qwen 3.5 35B10010096593678.2%
DeepSeek V3 (2024-12-26)100100100613078.0%
Claude Opus 4100100100504077.9%
Aion 2.010010089732777.6%
Gemini 3.1 Flash Lite (Reasoning)10010010079075.7%
DeepSeek V4 Pro10010078594075.2%
Mistral Large 210010071564874.9%
Gemini 3.8 Flash (Reasoning, Medium)10010081504374.7%
Claude Opus 4.51008072725074.7%
Claude Opus 4.7 (Reasoning)100100100522174.5%
GPT-5.4 Nano (Reasoning)10010089552874.4%
Gemini 2.5 Pro1007574615773.5%
Qwen 3.5 27B1008679693473.5%
GPT-5.21009569524872.9%
Qwen 3.5 9B1001008472872.9%
Claude Sonnet 4.51001008876072.8%
Claude Sonnet 4.610010010057372.1%
Claude Opus 4.6978581762071.9%
Gemini 3.5 Flash Lite (Reasoning)1001009461071.0%
Qwen 3.5 Flash1008279642870.5%
Claude Opus 4.7100100100272570.4%
Ministral 3 14B1009696441670.2%
Qwen 2.5 72B95898275068.1%
GPT-4o Mini (temp=0)1008685531567.7%
Claude Sonnet 41009267651467.5%
Gemini 3.1 Flash Lite1001008057067.4%
Xiaomi MIMO v2.51009266601867.2%
DeepSeek V3.110010010027666.5%
ByteDance Seed 1.61007357544866.5%
Hermes 3 405B1001008448066.4%
DeepSeek V4 Flash 0731 (Reasoning, High)10010054532566.3%
Aion 3.0 Mini1001008841065.8%
Z.AI GLM 4.5 Air1001006759065.2%
GPT-5.4 Nano (Reasoning, Low)94847671065.0%
Z.AI GLM 4.7 Flash96939043064.3%
Mistral NeMO1001008833064.2%
Hermes 3 70B10010048482263.5%
Z.AI GLM 5.2 (Reasoning, High)100747162061.5%
GPT-5.4 Nano1006457552961.0%
Z.AI GLM 4.61001001000060.0%
Gemini 3.5 Flash (Reasoning, Minimal)10010010000