Name drop frequency

Test: Bad Writing Habits

Avg. Score
69.2%
Scenarios
18

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1GPT-4.1 Nano94.8%$0.000713.3s81%
2Gemini 3.1 Flash Lite93.6%$0.003012.1s77%
3Gemini 3.1 Flash Lite (Reasoning)92.2%$0.003011.9s69%
4Gemini 3.1 Flash Lite (Preview)90.2%$0.00308.4s66%
5Gemma 3 4B88.9%$0.000220.0s65%
6Gemini 2.5 Pro92.7%$0.03636.2s69%
7DeepSeek V3.190.6%$0.00201.8m69%
8Z.AI GLM 4.689.7%$0.006551.5s59%
9Xiaomi MIMO v2.585.5%$0.005431.8s57%
10Gemini 2.5 Flash Lite (Reasoning)84.6%$0.002830.8s56%
11Grok 4.20 (Reasoning)88.6%$0.0181.5m66%
12Grok 4.5 (Reasoning, Low)87.9%$0.0181.1m62%
13GPT-5 Nano85.9%$0.00421.4m63%
14Gemma 4 26B84.1%$0.000955.1s56%
15Grok 4.5 (Reasoning, High)90.3%$0.0301.6m66%
16Claude Sonnet 588.1%$0.02733.5s55%
17Nemotron 3 Nano83.3%$0.00101.1m52%
18Inception Mercury 276.8%$0.00327.0s48%
19GPT-4o Mini (temp=1)80.4%$0.001234.8s48%
20Claude Sonnet 5 (Reasoning, Low)84.6%$0.03138.4s54%
21Grok 4.2083.4%$0.009345.7s48%
22Gemini 2.5 Flash80.2%$0.005210.6s42%
23ByteDance Seed 2.0 Lite86.1%$0.0122.2m59%
24Nemotron 3 Super82.5%$0.00001.4m50%
25DeepSeek V3.283.5%$0.00141.9m54%
26Gemini 2.5 Flash Lite78.5%$0.00099.5s41%
27Z.AI GLM 5.3 Flash (Reasoning, Low)83.2%$0.00051.1m45%
28Grok 4.3 (Reasoning)87.3%$0.0212.3m60%
29GPT-OSS 120B83.0%$0.00151.8m53%
30GPT-5 Mini82.2%$0.010057.4s47%
31Claude Sonnet 5 (Reasoning)85.1%$0.03038.9s47%
32Kimi K3 (Reasoning, Low)85.2%$0.0281.1m51%
33Gemma 4 26B (Reasoning)82.0%$0.00132.0m52%
34Gemini 2.5 Flash (Reasoning)79.5%$0.01121.5s41%
35Grok 4.379.3%$0.006930.5s40%
36Aion 2.081.1%$0.00641.3m45%
37Z.AI GLM 5.2 (Reasoning, High)81.4%$0.0111.0m44%
38Qwen 3.7 Flash (Reasoning)79.4%$0.001055.2s41%
39Arcee AI: Trinity Mini76.0%$0.00039.2s36%
40Laguna XS 2.176.0%$0.000314.4s37%
41ByteDance Seed 1.684.3%$0.0132.5m53%
42DeepSeek V4 Flash75.7%$0.000631.6s37%
43Claude Opus 4.8 (Reasoning, Low)86.1%$0.07141.9s53%
44Xiaomi MIMO v2.5 Pro78.1%$0.008553.5s38%
45Gemma 3 27B76.7%$0.000652.6s35%
46Gemini 3.5 Flash Lite (Reasoning)72.9%$0.00356.6s32%
47Gemini 3.7 Flash (Reasoning, Medium)71.3%$0.01218.2s38%
48Gemini 3.5 Flash Lite (Reasoning, Minimal)71.2%$0.00356.3s33%
49Claude Sonnet 4.681.4%$0.03139.3s37%
50DeepSeek V4 Flash (Reasoning)73.8%$0.000731.1s33%
51Claude Opus 4.784.4%$0.06930.4s45%
52Gemini 3.5 Flash (Reasoning, Minimal)71.8%$0.01812.0s37%
53Claude Opus 4.7 (Reasoning)84.2%$0.07632.0s47%
54Z.AI GLM 5 Turbo75.6%$0.008133.2s32%
55Z.AI GLM 577.1%$0.00841.2m37%
56Gemini 3 Flash (Preview, Reasoning)70.9%$0.01230.1s37%
57GPT-4o, Aug. 6th (temp=1)72.7%$0.01824.4s36%
58Gemini 3.8 Flash (Reasoning, Medium)70.8%$0.01418.0s35%
59GPT-4.1 Mini71.9%$0.002719.0s30%
60Gemini 3 Flash (Preview)68.4%$0.007819.6s36%
61Z.AI GLM 5.177.7%$0.0141.5m40%
62Claude Opus 584.5%$0.08250.1s48%
63MiniMax M2.575.3%$0.00341.3m35%
64DeepSeek V4.1 Flash (Reasoning, High)73.7%$0.002935.4s29%
65ByteDance Seed 2.0 Mini88.4%$0.00454.9m58%
66DeepSeek V4 Flash 0731 (Reasoning, High)79.9%$0.00222.6m42%
67GPT-4.171.7%$0.01844.7s36%
68Gemma 4 31B71.6%$0.00101.6m38%
69MiniMax M2.772.5%$0.00401.1m33%
70MiniMax M381.6%$0.00603.1m44%
71Z.AI GLM 4.7 Flash71.5%$0.00171.2m33%
72DeepSeek V4 Pro71.0%$0.00481.3m36%
73Claude Sonnet 4.6 (Reasoning)81.8%$0.0601.2m42%
74Qwen 3.6 Flash70.0%$0.01041.4s32%
75Claude Opus 4.8 (Reasoning)83.3%$0.07141.7s39%
76Mistral Medium 3.167.9%$0.004836.5s31%
77Laguna S 2.166.0%$0.000522.1s28%
78Qwen 3 32B67.6%$0.001554.6s32%
79Muse Spark 1.1 (Reasoning, Medium)69.3%$0.01523.9s30%
80Cydonia 24B V4.169.5%$0.001444.8s28%
81o4 Mini High73.6%$0.02547.2s31%
82Qwen 3.6 35B70.4%$0.00831.0m31%
83Gemma 4 31B (Reasoning)72.7%$0.00142.2m38%
84Gemma 3 12B68.7%$0.000441.3s25%
85Claude Haiku 4.567.0%$0.01121.6s27%
86Gemini 3.6 Flash (Reasoning, Minimal)65.7%$0.01714.3s29%
87Aion 3.0 Mini70.9%$0.00531.2m28%
88Aion 3.071.6%$0.0241.0m32%
89Qwen 3.5 Plus (2026-02-15)64.3%$0.006031.5s28%
90Claude Sonnet 469.2%$0.03243.7s34%
91Claude Opus 5 (Reasoning)83.3%$0.0981.0m45%
92Qwen 3 235B A22B Instruct 250770.8%$0.001159.2s23%
93o4 Mini67.0%$0.01525.7s26%
94Ministral 3 14B59.1%$0.000711.7s27%
95Mistral Large 361.2%$0.003330.3s28%
96Thinking Machines Inkling Small (Reasoning, High)70.3%$0.00881.7m32%
97DeepSeek V4 Pro (Reasoning)78.5%$0.0153.1m39%
98Ministral 3 8B59.7%$0.000819.6s26%
99Mistral Small 458.8%$0.001418.2s27%
100Claude Opus 5 (Reasoning, Low)82.9%$0.0971.0m41%
101WizardLM 2 8x22b69.3%$0.00261.8m30%
102DeepSeek V3 (2024-12-26)64.7%$0.002154.6s26%
103Grok 4.6 (Reasoning, High)79.4%$0.0422.5m40%
104Z.AI GLM 4.769.1%$0.0101.4m29%
105Claude Opus 4.6 (Reasoning)79.4%$0.0881.4m42%
106Writer: Palmyra X564.7%$0.01122.0s21%
107Muse Spark 1.1 (Reasoning, Minimal)63.3%$0.01219.2s22%
108Ministral 8B57.3%$0.000410.4s22%
109GPT-4o Mini (temp=0)61.3%$0.001234.8s22%
110Cohere Command R+ (Aug. 2024)64.2%$0.02052.5s28%
111Muse Spark 1.2 (Reasoning, Medium)65.6%$0.01838.3s23%
112DeepSeek-V2 Chat61.4%$0.002153.3s25%
113ByteDance Seed 1.6 Flash57.8%$0.001327.3s24%
114Claude Opus 4.677.6%$0.0781.2m37%
115GPT-580.8%$0.0652.8m45%
116Gemini 3.6 Flash (Reasoning)66.7%$0.04432.5s28%
117Mistral NeMO54.7%$0.000510.1s21%
118Ministral 3B53.1%$0.00018.1s22%
119GPT-5.4 Mini (Reasoning)61.2%$0.02228.1s24%
120Mistral Large 257.5%$0.01329.4s25%
121Mistral Small 4 (Reasoning)56.5%$0.002230.2s22%
122Hermes 3 70B59.7%$0.00101.2m25%
123 Kimi K3 (Reasoning, High)72.9%$0.0441.8m32%
124Qwen 3.5 Plus (2026-04-20)69.0%$0.0171.8m25%
125GPT-5.4 Mini54.6%$0.01516.8s25%
126Muse Glimmer 30B (Reasoning, Medium)61.8%$0.003843.4s17%
127Kimi K2.573.1%$0.0193.2m36%
128DeepSeek V3 (2025-03-24)55.6%$0.001439.4s22%
129Z.AI GLM 5.3 Flash (Reasoning, Max)84.7%$0.00316.5m49%
130Claude Sonnet 4.562.8%$0.03538.1s23%
131Gemini 3.5 Flash (Reasoning)68.4%$0.07137.6s29%
132Claude Opus 4.567.7%$0.07053.4s32%
133GPT-4o, Aug. 6th (temp=0)55.7%$0.02322.7s22%
134Qwen 3.5 Flash55.3%$0.002547.5s19%
135DeepSeek V4 Pro 0813 (Reasoning, High)66.5%$0.0251.8m25%
136Ministral 3 3B47.8%$0.000511.1s19%
137Muse Spark 1.3 (Reasoning, Medium)64.7%$0.0251.8m25%
138GPT-5.4 Mini (Reasoning, Low)52.2%$0.01516.8s18%
139Llama 3.1 70B47.7%$0.001529.4s19%
140GPT-5.463.0%$0.0491.4m28%
141Qwen 3.8 Flash (Reasoning)64.8%$0.00643.1m28%
142GPT-5.171.7%$0.0541.8m23%
143Qwen 3.6 Max Preview75.2%$0.0503.5m34%
144Hermes 3 405B50.4%$0.003253.2s15%
145Hy4 Preview (Reasoning, High)75.3%$0.0404.4m37%
146Qwen 2.5 72B40.8%$0.001036.7s21%
147Z.AI GLM 4.5 Air47.1%$0.002958.2s17%
148Qwen 3.6 27B63.8%$0.0252.3m20%
149GPT-5.4 (Reasoning, Low)61.4%$0.0551.4m22%
150Z.AI GLM 5.3 (Reasoning, Max)87.3%$0.0667.3m57%
151GPT-5.6 Luna (Reasoning)38.2%$0.01718.0s21%
152Thinking Machines Inkling51.1%$0.00751.5m15%
153GPT-5.6 Terra (Reasoning)44.6%$0.04435.2s24%
154Z.AI GLM 4.542.0%$0.005142.1s14%
155Qwen 3.5 397B A17B57.9%$0.0143.0m22%
156Qwen 3.5 122B51.5%$0.0251.1m12%
157Qwen 3.5 35B49.7%$0.0181.0m11%
158GPT-5.4 Nano (Reasoning)39.1%$0.006124.5s12%
159GPT-5.4 Nano (Reasoning, Low)36.5%$0.005520.6s13%
160GPT-5.6 Terra40.5%$0.04636.9s25%
161GPT-5.4 Nano36.9%$0.005726.3s12%
162GPT-5.6 Luna32.8%$0.01515.8s18%
163Qwen 3.7 Max61.7%$0.0682.3m21%
164Kimi K2.678.3%$0.0586.5m43%
165Thinking Machines Inkling (Reasoning)67.9%$0.0255.1m27%
166Qwen 3.8 27B (Reasoning, XHigh)66.6%$0.0404.7m29%
167Gemini 3.1 Pro (Preview)64.3%$0.1071.8m25%
168Qwen 3.5 9B42.1%$0.00111.4m7%
169GPT-5.4 (Reasoning)64.8%$0.0892.6m26%
170Qwen 3.5 27B44.2%$0.0201.6m8%
171GPT-5.6 Sol43.4%$0.1051.2m28%
172Mistral Small 3.2 24B52.8%$0.00695.7m15%
173GPT-5.544.5%$0.1391.7m28%
174GPT-5.6 Sol (Reasoning)34.8%$0.1081.2m17%
175Qwen 3.8 Max (Reasoning, XHigh)61.0%$0.0835.9m27%
176GPT-5.228.0%$0.0561.5m6%
177GPT-5.5 (Reasoning)39.5%$0.1421.8m21%
178Claude Opus 456.3%$0.2091.4m22%
179GPT-5.5 (Reasoning, Low)36.1%$0.1391.8m15%
69.17%

Individual Scenarios

Detailed Writing Rules

Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Claude Opus 5 (Reasoning)100100100100100100.0%
Gemini 3.1 Flash Lite (Reasoning)100100100100100100.0%
Gemini 3.1 Flash Lite1001001001009398.6%
GPT-4.1 Nano100100100989498.3%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100988997.3%
Claude Opus 5 (Reasoning, Low)100100100958395.7%
Claude Sonnet 4.6 (Reasoning)100100100958395.6%
Gemma 3 4B100100100928395.2%
Claude Sonnet 5 (Reasoning)100100100898394.4%
Grok 4.3 (Reasoning)10010099898394.3%
Gemini 3.5 Flash Lite (Reasoning)1001001001006993.7%
ByteDance Seed 2.0 Mini1001001001006793.3%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100966792.5%
ByteDance Seed 2.0 Lite10010094838191.7%
Gemini 3.5 Flash (Reasoning, Minimal)1001001001005090.0%
Claude Opus 51009892827790.0%
Z.AI GLM 4.710010097836989.8%
Claude Sonnet 5 (Reasoning, Low)1009388877588.6%
GPT-OSS 120B1009492857188.5%
Grok 4.5 (Reasoning, High)1009683837888.2%
Gemini 2.5 Flash (Reasoning)1009088887087.1%
Claude Sonnet 4.61008683838387.1%
Gemini 3.1 Pro (Preview)10010083836786.7%
MiniMax M3988383838386.3%
Gemini 3.5 Flash Lite (Reasoning, Minimal)1009788836185.9%
Thinking Machines Inkling Small (Reasoning, High)959594826385.8%
DeepSeek V3.21009483836785.5%
GPT-4.1 Mini10010080786785.0%
Claude Opus 4.8 (Reasoning, Low)1008887816784.4%
Grok 4.3938383837483.4%
GPT-510010083835083.3%
GPT-5 Nano10010083676783.3%
Grok 4.5 (Reasoning, Low)978683836783.3%
Inception Mercury 2898887826782.6%
Gemma 3 12B1009898675082.5%
Nemotron 3 Super958877766981.0%
Xiaomi MIMO v2.5 Pro959283676780.8%
Qwen 3.7 Flash (Reasoning)100100100831880.4%
Z.AI GLM 5.3 (Reasoning, Max)838383836780.0%
GPT-5.11008383785078.9%
Claude Sonnet 5838282767178.6%
Xiaomi MIMO v2.51008773676678.5%
Gemini 2.5 Pro10010091673378.3%
Gemma 4 31B (Reasoning)948477716478.0%
Grok 4.20878282716777.8%
Grok 4.6 (Reasoning, High)888583825077.7%
ByteDance Seed 1.6838282717077.6%
Z.AI GLM 5.2 (Reasoning, High)1009483605077.6%
Qwen 3.7 Max10010076654276.7%
Kimi K3 (Reasoning, High)1009183595076.7%
Muse Spark 1.1 (Reasoning, Minimal)1008372676276.7%
Gemini 3.6 Flash (Reasoning, Minimal)10010067665076.5%
Claude Opus 4.71009669675076.2%
Gemini 3.1 Flash Lite (Preview)10010068615176.1%
DeepSeek V4 Pro (Reasoning)1009285584475.9%
DeepSeek V3.11008478675075.8%
Ministral 3 3B938779695075.7%
Muse Glimmer 30B (Reasoning, Medium)838378676775.6%
Muse Spark 1.1 (Reasoning, Medium)1009273674675.5%
Kimi K3 (Reasoning, Low)838373706675.1%
Claude Opus 4.7 (Reasoning)1008171685574.9%
Z.AI GLM 4.6969483673374.8%
Gemini 2.5 Flash Lite (Reasoning)1008583505073.6%
Gemma 4 26B (Reasoning)978270674973.0%
GPT-5 Mini1009867505073.0%
Nemotron 3 Nano998382673372.8%
Qwen 3.8 Flash (Reasoning)1008379673372.5%
DeepSeek V4 Flash1008268625072.4%
Thinking Machines Inkling (Reasoning)1009267673472.0%
GPT-5.4 Mini837867676572.0%
Z.AI GLM 5.1938178743371.9%
Grok 4.20 (Reasoning)837572705971.6%
Claude Opus 4.6878276625071.4%
Z.AI GLM 510010062613371.2%
Gemini 3 Flash (Preview)838371675070.8%
Qwen 3.6 35B997167665070.5%
Gemini 3 Flash (Preview, Reasoning)877968675070.2%
DeepSeek V4 Pro 0813 (Reasoning, High)917775555470.2%
Claude Opus 4.6 (Reasoning)1008367673370.0%
Aion 3.0 Mini927966644969.9%
Ministral 3B949367484669.5%
Gemini 2.5 Flash Lite848267645069.4%
GPT-5.4 (Reasoning)838366645069.3%
Gemma 4 31B767469676169.3%
GPT-4o Mini (temp=1)848367625069.0%
Cydonia 24B V4.110010067611768.9%
Laguna S 2.11007766515068.8%
GPT-5.4846767675868.4%
Gemini 2.5 Flash838176505068.2%
Gemma 3 27B1007967613368.0%
DeepSeek V4.1 Flash (Reasoning, High)838375653468.0%
Laguna XS 2.1797767585667.3%
Claude Haiku 4.5826765645967.2%
Claude Opus 4.8 (Reasoning)978754504766.9%
DeepSeek V4 Flash 0731 (Reasoning, High)848367673366.7%
Z.AI GLM 5 Turbo916767585066.4%
Muse Spark 1.2 (Reasoning, Medium)10010050453365.6%
MiniMax M2.7936760585065.6%
Hy4 Preview (Reasoning, High)1008057484265.5%
DeepSeek V4 Flash (Reasoning)1006764603364.7%
Hermes 3 70B887850504963.1%
Gemini 3.5 Flash (Reasoning)1006766503062.5%
Ministral 3 8B906865503962.5%
Z.AI GLM 4.7 Flash948358413361.9%
Gemma 4 26B1006554493961.7%
Gemini 3.6 Flash (Reasoning)1005955534261.6%
Aion 2.0918367333361.5%
Mistral Small 3.2 24B89816967061.0%
Kimi K2.61006762562061.0%
Ministral 8B1006756483360.8%
Qwen 3.5 Plus (2026-02-15)100786659060.6%
MiniMax M2.5837750484259.9%
GPT-5.4 Mini (Reasoning)796464504259.7%
ByteDance Seed 1.6 Flash676160565559.7%
Qwen 3 235B A22B Instruct 2507837667501658.5%
Qwen 3.6 Max Preview766564533358.3%
Kimi K2.5726864543358.2%
o4 Mini636057555257.5%
Gemini 3.8 Flash (Reasoning, Medium)686766503356.8%
GPT-5.6 Terra (Reasoning)625957504955.3%
WizardLM 2 8x22b100675850055.0%
GPT-5.4 Mini (Reasoning, Low)897560331754.9%
Claude Sonnet 4675856504254.5%
Mistral Large 2676056553454.5%
GPT-5.6 Sol (Reasoning)656354464254.2%
Hermes 3 405B93906819054.1%
Qwen 3.6 Flash957657241753.9%
Llama 3.1 70B82716250053.2%
Mistral Large 3675550494553.2%
Arcee AI: Trinity Mini726763372753.1%
DeepSeek-V2 Chat685351503952.3%
Mistral Medium 3.1666160422751.3%
Qwen 3.8 Max (Reasoning, XHigh)786841333250.6%
Mistral NeMO82675944050.3%
Claude Opus 4645450503350.2%
GPT-5.5 (Reasoning, Low)815050333349.6%
Aion 3.0716857331749.2%
Cohere Command R+ (Aug. 2024)100504846048.8%
GPT-5.6 Terra525050484448.7%
Claude Sonnet 4.5706844441447.9%
GPT-4o, Aug. 6th (temp=1)675949451847.4%
GPT-5.6 Sol555050423947.3%
DeepSeek V4 Pro747333282346.3%
GPT-5.5505050473346.1%
Qwen 3.8 27B (Reasoning, XHigh)767348171746.1%
Gemini 3.7 Flash (Reasoning, Medium)615050412846.0%
Qwen 2.5 72B635550431946.0%
DeepSeek V3 (2025-03-24)635642382945.6%
Writer: Palmyra X567595350045.6%
Mistral Small 481635033045.4%
Ministral 3 14B676449271744.9%
GPT-4.1545050353344.4%
o4 Mini High835148211744.1%
GPT-5.6 Luna (Reasoning)584646333343.2%
Qwen 3.5 35B67555044043.0%
GPT-5.4 (Reasoning, Low)67645033042.8%
Claude Opus 4.5675044331742.4%
Qwen 3.5 Plus (2026-04-20)62505045041.3%
Qwen 3 32B605050331441.3%
Thinking Machines Inkling79474136140.8%
Qwen 3.5 Flash67604231040.0%
GPT-5.5 (Reasoning)505050331740.0%
DeepSeek V3 (2024-12-26)655442221639.6%
Muse Spark 1.3 (Reasoning, Medium)575043311739.5%
Qwen 3.6 27B66645017039.1%
Mistral Small 4 (Reasoning)62504533038.0%
GPT-4o Mini (temp=0)67563333037.9%
GPT-5.4 Nano (Reasoning, Low)474233331734.4%
Qwen 3.5 397B A17B60474517033.7%
GPT-5.28350330033.3%
GPT-4o, Aug. 6th (temp=0)59353433032.2%
Z.AI GLM 4.5 Air50383633031.4%
GPT-5.4 Nano (Reasoning)46433333031.1%
GPT-5.6 Luna443332261129.0%
GPT-5.4 Nano423329221728.6%
Z.AI GLM 4.550332928028.1%
Qwen 3.5 27B973300026.1%
Qwen 3.5 122B2800005.6%
Qwen 3.5 9B000000.0%