Sentence opener variety

Test: Bad Writing Habits

Avg. Score
55.5%
Scenarios
18

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1GPT-4o Mini (temp=1)82.2%$0.001234.8s66%
2GPT-4o, Aug. 6th (temp=1)84.8%$0.01824.4s66%
3Gemini 3.5 Flash Lite (Reasoning, Minimal)80.0%$0.00356.3s56%
4Cydonia 24B V4.180.1%$0.001444.8s58%
5Claude Sonnet 5 (Reasoning, Low)79.9%$0.03138.4s62%
6Gemini 3.5 Flash Lite (Reasoning)79.0%$0.00356.6s54%
7Hermes 3 405B78.7%$0.003253.2s57%
8DeepSeek V3 (2025-03-24)77.8%$0.001439.4s56%
9Claude Sonnet 577.5%$0.02733.5s59%
10Claude Sonnet 5 (Reasoning)78.8%$0.03038.9s59%
11GPT-4.1 Mini69.6%$0.002719.0s55%
12Claude Sonnet 475.8%$0.03243.7s58%
13Claude Sonnet 4.572.8%$0.03538.1s58%
14Laguna S 2.167.5%$0.000522.1s51%
15Cohere Command R+ (Aug. 2024)73.8%$0.02052.5s52%
16Hermes 3 70B75.6%$0.00101.2m49%
17GPT-4.1 Nano64.7%$0.000713.3s51%
18MoonshotAI: Kimi K3 (Reasoning, Low)73.7%$0.0281.1m54%
19Z.AI GLM 4.568.1%$0.005142.1s50%
20Grok 4.5 (Reasoning, High)72.4%$0.0301.6m57%
21GPT-4.165.8%$0.01844.7s54%
22Grok 4.5 (Reasoning, Low)69.1%$0.0181.1m53%
23Gemma 3 27B65.9%$0.000652.6s48%
24Gemma 3 12B63.1%$0.000441.3s49%
25Claude Opus 4.8 (Reasoning)70.6%$0.07141.7s56%
26Claude Haiku 4.563.3%$0.01121.6s49%
27Claude Opus 4.8 (Reasoning, Low)70.1%$0.07141.9s56%
28Laguna XS 2.161.5%$0.000314.4s46%
29DeepSeek V3 (2024-12-26)63.9%$0.002154.6s47%
30Z.AI GLM 5 Turbo62.5%$0.008133.2s47%
31Claude Opus 4.769.1%$0.06930.4s53%
32GPT-4o Mini (temp=0)62.1%$0.001234.8s45%
33DeepSeek-V2 Chat63.5%$0.002153.3s46%
34Z.AI GLM 563.0%$0.00841.2m48%
35Claude Opus 5 (Reasoning)72.8%$0.0981.0m55%
36Writer: Palmyra X558.2%$0.01122.0s47%
37Gemma 3 4B57.9%$0.000220.0s44%
38Llama 3.1 70B60.5%$0.001529.4s43%
39Muse Spark 1.1 (Reasoning, Minimal)57.5%$0.01219.2s45%
40Claude Opus 5 (Reasoning, Low)72.1%$0.0971.0m54%
41Qwen3 235B A22B Instruct 250758.7%$0.001159.2s46%
42Z.AI GLM 4.5 Air61.8%$0.002958.2s43%
43Claude Opus 4.7 (Reasoning)65.9%$0.07632.0s50%
44Gemini 3.6 Flash (Reasoning, Minimal)62.0%$0.01714.3s41%
45Gemini 2.5 Flash Lite56.3%$0.00099.5s42%
46Gemini 3.6 Flash (Reasoning)62.5%$0.04432.5s47%
47Grok 4.356.6%$0.006930.5s44%
48Grok 4.2056.1%$0.009345.7s46%
49Claude Opus 567.9%$0.08250.1s49%
50Claude Sonnet 4.662.6%$0.03139.3s43%
51Gemini 3.5 Flash (Reasoning, Minimal)57.5%$0.01812.0s42%
52Gemini 2.5 Flash58.2%$0.005210.6s39%
53Qwen 3.5 Plus (2026-02-15)54.6%$0.006031.5s43%
54Grok 4.20 (Reasoning)59.0%$0.0181.5m48%
55MoonshotAI: Kimi K3 (Reasoning, High)64.9%$0.0441.8m50%
56DeepSeek V4 Flash59.4%$0.000631.6s38%
57Z.AI GLM 5.162.2%$0.0141.5m44%
58Qwen 3 32B58.5%$0.001554.6s41%
59o4 Mini53.0%$0.01525.7s45%
60DeepSeek V4 Pro61.4%$0.00481.3m42%
61Gemini 2.5 Flash (Reasoning)55.3%$0.01121.5s42%
62Mistral Small 454.9%$0.001418.2s40%
63Muse Spark 1.1 (Reasoning, Medium)55.4%$0.01523.9s42%
64Claude Opus 4.562.7%$0.07053.4s49%
65GPT-4o, Aug. 6th (temp=0)57.0%$0.02322.7s42%
66Z.AI GLM 5.2 (Reasoning, High)57.0%$0.0111.0m43%
67DeepSeek V4 Flash (Reasoning)57.1%$0.000731.1s38%
68Qwen 2.5 72B52.8%$0.001036.7s42%
69MiniMax M2.757.3%$0.00401.1m41%
70Gemini 2.5 Flash Lite (Reasoning)53.0%$0.002830.8s40%
71Arcee AI: Trinity Mini55.9%$0.00039.2s36%
72Mistral Medium 3.152.0%$0.004836.5s42%
73MiniMax M2.556.9%$0.00341.3m41%
74Mistral Large 251.7%$0.01329.4s42%
75Thinking Machines Inkling57.2%$0.00751.5m42%
76GPT-5.6 Luna47.5%$0.01515.8s42%
77Mistral Large 349.7%$0.003330.3s40%
78Aion 3.0 Mini58.2%$0.00531.2m38%
79Mistral Small 4 (Reasoning)50.1%$0.002230.2s39%
80ByteDance Seed 1.6 Flash50.8%$0.001327.3s37%
81WizardLM 2 8x22b57.4%$0.00261.8m40%
82GPT-5.4 Mini (Reasoning, Low)46.4%$0.01516.8s41%
83GPT-5.4 Mini46.6%$0.01516.8s41%
84Ministral 3 14B48.2%$0.000711.7s37%
85Claude Sonnet 4.6 (Reasoning)61.1%$0.0601.2m43%
86GPT-5.6 Luna (Reasoning)46.7%$0.01718.0s41%
87o4 Mini High53.1%$0.02547.2s40%
88GPT-5.455.7%$0.0491.4m46%
89Xiaomi MIMO v2.5 Pro50.4%$0.008553.5s39%
90Ministral 3 8B45.3%$0.000819.6s38%
91Ministral 3B46.8%$0.00018.1s36%
92GPT-5.6 Terra (Reasoning)50.7%$0.04435.2s43%
93Xiaomi MIMO v2.547.2%$0.005431.8s38%
94GPT-5.4 Mini (Reasoning)47.7%$0.02228.1s40%
95Ministral 8B44.3%$0.000410.4s37%
96Nemotron 3 Super48.5%$0.00001.4m41%
97Aion 3.053.0%$0.0241.0m38%
98Mistral NeMO46.4%$0.000510.1s34%
99Ministral 3 3B44.7%$0.000511.1s35%
100Aion 2.049.4%$0.00641.3m39%
101Gemini 2.5 Pro50.7%$0.03636.2s39%
102GPT-5.4 Nano (Reasoning)41.2%$0.006124.5s39%
103GPT-5.4 Nano (Reasoning, Low)40.7%$0.005520.6s39%
104GPT-5.4 (Reasoning, Low)53.8%$0.0551.4m44%
105Inception Mercury 241.1%$0.00327.0s36%
106GPT-5.4 Nano40.5%$0.005726.3s39%
107Claude Opus 472.7%$0.2091.4m57%
108GPT-5.6 Terra47.7%$0.04636.9s41%
109Z.AI GLM 4.647.4%$0.006551.5s36%
110DeepSeek V3.247.8%$0.00141.9m40%
111GPT-5.154.4%$0.0541.8m44%
112Gemini 3.1 Flash Lite43.6%$0.003012.1s33%
113Gemini 3 Flash (Preview)43.7%$0.007819.6s34%
114MoonshotAI: Kimi K2.557.7%$0.0193.2m42%
115Gemini 3.1 Flash Lite (Reasoning)43.4%$0.003011.9s32%
116Gemini 3.1 Flash Lite (Preview)43.2%$0.00308.4s32%
117DeepSeek V4 Pro (Reasoning)57.6%$0.0153.1m40%
118Claude Opus 4.655.1%$0.0781.2m42%
119Claude Opus 4.6 (Reasoning)57.2%$0.0881.4m43%
120Gemini 3 Flash (Preview, Reasoning)43.5%$0.01230.1s33%
121Grok 4.3 (Reasoning)53.5%$0.0212.3m38%
122DeepSeek V3.151.6%$0.00201.8m33%
123Z.AI GLM 4.745.1%$0.0101.4m37%
124GPT-5 Mini41.9%$0.010057.4s36%
125GPT-OSS 120B43.5%$0.00151.8m37%
126Z.AI GLM 4.7 Flash43.1%$0.00171.2m34%
127Qwen 3.6 Flash46.5%$0.01041.4s31%
128Gemini 3.5 Flash (Reasoning)50.3%$0.07137.6s38%
129ByteDance Seed 2.0 Lite55.7%$0.0122.2m32%
130Gemma 4 26B39.7%$0.000955.1s33%
131Qwen 3.5 Flash38.0%$0.002547.5s34%
132Nemotron 3 Nano40.9%$0.00101.1m33%
133GPT-5.6 Sol51.9%$0.1051.2m44%
134Gemma 4 31B43.1%$0.00101.6m34%
135ByteDance Seed 1.651.7%$0.0132.5m34%
136GPT-5.6 Sol (Reasoning)50.8%$0.1081.2m44%
137Qwen 3.6 35B43.0%$0.00831.0m30%
138GPT-5.242.7%$0.0561.5m41%
139Qwen 3.5 Plus (2026-04-20)47.5%$0.0171.8m32%
140MiniMax M350.9%$0.00603.1m34%
141Gemma 4 31B (Reasoning)41.0%$0.00142.2m34%
142GPT-5.4 (Reasoning)53.8%$0.0892.6m42%
143Qwen 3.5 122B37.9%$0.0251.1m33%
144Qwen 3.6 27B46.7%$0.0252.3m33%
145Gemma 4 26B (Reasoning)39.8%$0.00132.0m32%
146Qwen 3.5 9B37.1%$0.00111.4m30%
147Qwen 3.5 35B35.7%$0.0181.0m31%
148Qwen 3.5 27B37.5%$0.0201.6m33%
149Thinking Machines Inkling (Reasoning)56.9%$0.0255.1m39%
150GPT-5 Nano33.5%$0.00421.4m31%
151Qwen 3.5 397B A17B42.7%$0.0143.0m34%
152Gemini 3.1 Pro (Preview)49.1%$0.1071.8m37%
153ByteDance Seed 2.0 Mini50.8%$0.00454.9m36%
154Qwen3.7 Max45.2%$0.0682.3m35%
155Qwen3.6 Max Preview48.2%$0.0503.5m35%
156GPT-5.5 (Reasoning)48.3%$0.1421.8m41%
157GPT-544.5%$0.0652.8m36%
158GPT-5.5 (Reasoning, Low)48.4%$0.1391.8m40%
159GPT-5.548.2%$0.1391.7m39%
160MoonshotAI: Kimi K2.652.9%$0.0586.5m39%
161Mistral Small 3.2 24B37.6%$0.00685.6m30%
55.50%

Individual Scenarios

Detailed Writing Rules

Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Cydonia 24B V4.1999898979597.5%
Gemini 3.5 Flash Lite (Reasoning, Minimal)1009898979196.8%
Gemini 3.5 Flash Lite (Reasoning)10010096968795.9%
DeepSeek V3 (2025-03-24)1009894928393.4%
Claude Sonnet 5 (Reasoning, Low)969695908592.3%
GPT-4o Mini (temp=1)1009889878291.2%
Grok 4.5 (Reasoning, High)999889837689.0%
Claude Sonnet 5 (Reasoning)969088878188.3%
Aion 3.0 Mini939189827786.4%
Claude Sonnet 5949387837586.3%
Hermes 3 405B999687846385.8%
Claude Opus 4.7 (Reasoning)939381807985.2%
Thinking Machines Inkling (Reasoning)979693736685.0%
GPT-4o, Aug. 6th (temp=1)989779777184.4%
Hermes 3 70B999782727084.0%
Claude Sonnet 41009084757083.9%
MoonshotAI: Kimi K3 (Reasoning, Low)938584757582.3%
Thinking Machines Inkling968478787582.2%
DeepSeek V3 (2024-12-26)918482816580.8%
Claude Opus 4.7918880737280.8%
Claude Opus 5 (Reasoning, Low)868580797180.1%
DeepSeek-V2 Chat989581656179.9%
Laguna XS 2.1948680776379.8%
Claude Opus 5 (Reasoning)878680737279.7%
Claude Opus 4.8 (Reasoning)888379757479.7%
Z.AI GLM 5848381797179.6%
Claude Sonnet 4.5948180806279.4%
Laguna S 2.1928381766579.4%
DeepSeek V4 Flash848482796478.7%
Gemma 3 12B998774726278.6%
DeepSeek V4 Pro878680756378.3%
Claude Sonnet 4.6808079757477.7%
DeepSeek V4 Pro (Reasoning)1009171656077.6%
DeepSeek V4 Flash (Reasoning)838078767077.6%
MoonshotAI: Kimi K3 (Reasoning, High)887978707077.1%
Z.AI GLM 5.1888477706677.0%
Z.AI GLM 5 Turbo848177756777.0%
Grok 4.5 (Reasoning, Low)808079746976.4%
Claude Opus 4.8 (Reasoning, Low)818077756876.4%
Claude Opus 5908473696576.3%
Claude Haiku 4.5867673727075.3%
Gemma 3 4B948073656274.8%
ByteDance Seed 2.0 Lite1009088554174.6%
Gemini 3.6 Flash (Reasoning)838376666474.2%
Gemma 3 27B838278665873.3%
Gemini 2.5 Flash928477585473.1%
Gemini 3.6 Flash (Reasoning, Minimal)787777716272.9%
MiniMax M3747373727272.7%
Claude Sonnet 4.6 (Reasoning)828076675672.4%
ByteDance Seed 1.6857272716072.3%
Z.AI GLM 4.5837675705672.1%
MiniMax M2.7817869666571.9%
Qwen3 235B A22B Instruct 2507887870635871.5%
Claude Opus 4828072715371.4%
Aion 3.0847776625671.0%
GPT-4o Mini (temp=0)797675656170.9%
GPT-4.1847270646470.8%
Claude Opus 4.6 (Reasoning)797272676370.6%
Gemini 2.5 Flash (Reasoning)787569646370.0%
Z.AI GLM 4.5 Air887964645569.8%
MoonshotAI: Kimi K2.5757372656469.8%
MoonshotAI: Kimi K2.6977360605969.8%
Muse Spark 1.1 (Reasoning, Medium)827167656369.6%
Muse Spark 1.1 (Reasoning, Minimal)817070646269.6%
Claude Opus 4.5757268676669.6%
Grok 4.3938062605068.8%
Cohere Command R+ (Aug. 2024)907367585568.7%
Gemini 3.5 Flash (Reasoning, Minimal)777471655368.1%
Grok 4.20757464645867.0%
Claude Opus 4.6737163626165.9%
GPT-5.4 (Reasoning)767067605665.9%
GPT-4.1 Mini756865645765.8%
Grok 4.3 (Reasoning)796966625365.8%
GPT-5.4 (Reasoning, Low)776865585664.8%
Mistral Large 2767570574664.7%
Gemini 2.5 Flash Lite777164634764.6%
Grok 4.20 (Reasoning)727067645064.5%
Z.AI GLM 5.2 (Reasoning, High)736362615763.3%
GPT-5.6 Sol706961595662.9%
Writer: Palmyra X5726661595562.5%
GPT-5.4726363605562.4%
GPT-4.1 Nano696865585062.2%
GPT-5.4 Mini (Reasoning)706461575461.2%
Xiaomi MIMO v2.5 Pro696563575060.9%
Gemini 3.1 Flash Lite (Preview)706957575160.8%
Gemini 2.5 Pro656360565659.9%
ByteDance Seed 2.0 Mini827057493959.4%
WizardLM 2 8x22b735959535259.2%
GPT-5.6 Sol (Reasoning)666458555359.1%
Gemini 3.1 Pro (Preview)766253525158.7%
GPT-5.5666159575058.6%
Mistral Small 4 (Reasoning)737252524358.5%
MiniMax M2.5806955484058.4%
ByteDance Seed 1.6 Flash816358474358.4%
GPT-5.5 (Reasoning, Low)605957575557.8%
Mistral Small 4725957544457.3%
Gemini 2.5 Flash Lite (Reasoning)625958565157.2%
GPT-5.6 Terra686055535057.2%
Qwen 3.6 Flash646363623357.2%
Aion 2.0646160514756.8%
Nemotron 3 Super625855555356.8%
Qwen3.6 Max Preview715956554256.7%
Qwen 3.5 Plus (2026-02-15)676555494756.5%
GPT-5.6 Terra (Reasoning)656154525156.4%
o4 Mini646255544756.4%
GPT-5.5 (Reasoning)625957564756.2%
Ministral 3 3B985350463356.1%
Gemini 3.1 Flash Lite (Reasoning)686753513855.4%
Ministral 3 8B735554484655.2%
Llama 3.1 70B686251484655.0%
Z.AI GLM 4.7635755544554.8%
Qwen 3.6 35B646357494054.5%
Arcee AI: Trinity Mini726149464454.4%
DeepSeek V3.2615554544754.3%
DeepSeek V3.1676152464554.3%
GPT-5.1605856564154.3%
Qwen 3.5 9B806749413253.9%
o4 Mini High705448474653.0%
Ministral 3 14B695351514152.8%
Gemma 4 31B (Reasoning)605653484752.6%
Gemma 4 31B666051444252.5%
Qwen 3.6 27B645953463952.5%
Mistral Medium 3.1565655504452.4%
Gemini 3.5 Flash (Reasoning)595752494552.2%
Nemotron 3 Nano646260443252.2%
Qwen 3 32B616048464552.1%
GPT-5.4 Mini635350464250.9%
Gemini 3.1 Flash Lite595653513350.4%
GPT-5605550483750.0%
Mistral Large 3585149474450.0%
GPT-5.6 Luna (Reasoning)594949464549.6%
Xiaomi MIMO v2.5645150403948.9%
GPT-OSS 120B625148424148.7%
Gemini 3 Flash (Preview, Reasoning)575147464348.7%
GPT-4o, Aug. 6th (temp=0)505049494648.7%
GPT-5.4 Mini (Reasoning, Low)545248474348.7%
Z.AI GLM 4.7 Flash635046453948.6%
GPT-5.6 Luna555350454148.6%
Z.AI GLM 4.6565550453648.4%
Qwen 3.5 397B A17B595245444248.4%
Qwen 2.5 72B615246434048.3%
GPT-5 Mini565347413847.1%
Qwen3.7 Max644644414047.0%
Ministral 8B494847444145.8%
GPT-5.2494545444445.5%
Ministral 3B584646413445.1%
Gemma 4 26B (Reasoning)625043412845.0%
Gemini 3 Flash (Preview)575042383844.8%
GPT-5.4 Nano (Reasoning, Low)484745433944.6%
Mistral NeMO565443353444.4%
Qwen 3.5 Plus (2026-04-20)575041373644.2%
Gemma 4 26B514942413743.9%
GPT-5.4 Nano464444413842.7%
GPT-5.4 Nano (Reasoning)444342403941.4%
Qwen 3.5 122B424240404040.8%
Qwen 3.5 27B424141393940.4%
Inception Mercury 2454140373740.0%
Qwen 3.5 Flash434040363238.4%
Mistral Small 3.2 24B454140382537.7%
Qwen 3.5 35B444137332936.8%
GPT-5 Nano353432282530.8%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Gemini 3.5 Flash Lite (Reasoning, Minimal)989593797988.8%
Gemini 3.5 Flash Lite (Reasoning)969189828087.5%
DeepSeek V3 (2025-03-24)1009485797786.9%
GPT-4o Mini (temp=1)868685857382.9%
Cydonia 24B V4.1968888676681.2%
Hermes 3 70B1009884753578.5%
GPT-4o, Aug. 6th (temp=1)998377725376.7%
Claude Opus 5 (Reasoning)887775746976.4%
Cohere Command R+ (Aug. 2024)957875735875.8%
Hermes 3 405B10010064575675.5%
Claude Opus 5 (Reasoning, Low)818072706774.0%
Claude Sonnet 4837473706974.0%
Claude Sonnet 5 (Reasoning, Low)867971706173.5%
Claude Opus 4.8 (Reasoning, Low)767574726872.9%
Claude Sonnet 5 (Reasoning)828176635972.4%
Claude Sonnet 4.5797675735872.2%
Claude Sonnet 5817171676771.3%
Grok 4.5 (Reasoning, High)847571666071.3%
DeepSeek V3 (2024-12-26)787676644467.4%
Claude Opus 5866666605667.0%
Claude Opus 4878263584467.0%
Gemma 3 27B786766645866.8%
GPT-4.1717068636166.4%
Mistral Small 41007356534866.0%
Claude Opus 4.5746666616065.3%
Claude Opus 4.8 (Reasoning)746966615665.1%
MoonshotAI: Kimi K3 (Reasoning, Low)737267585565.1%
Claude Opus 4.7746860585763.5%
DeepSeek-V2 Chat797970444463.0%
Laguna S 2.1696962605362.6%
Aion 3.0 Mini696663615462.3%
Gemini 3.6 Flash (Reasoning)686760585762.0%
Claude Opus 4.7 (Reasoning)666561605761.9%
Z.AI GLM 5.1726758565561.5%
DeepSeek V4 Pro756060585461.5%
Thinking Machines Inkling (Reasoning)737056545361.0%
Gemini 3.5 Flash (Reasoning, Minimal)925857494660.6%
Muse Spark 1.1 (Reasoning, Medium)747165524160.6%
Z.AI GLM 5 Turbo686459595260.5%
MoonshotAI: Kimi K3 (Reasoning, High)656363615160.5%
Muse Spark 1.1 (Reasoning, Minimal)646363595360.4%
DeepSeek V4 Flash746657515059.7%
MiniMax M3686563604159.6%
GPT-4.1 Mini666463535159.5%
Z.AI GLM 4.5736358574659.2%
Laguna XS 2.1646361555259.0%
Grok 4.5 (Reasoning, Low)716057545358.9%
Gemini 3.6 Flash (Reasoning, Minimal)656260555358.9%
DeepSeek V4 Pro (Reasoning)706964474458.9%
Z.AI GLM 5725656545358.1%
Claude Opus 4.6 (Reasoning)656560584258.0%
Qwen 3.6 27B786752494457.9%
MiniMax M2.7686257574557.9%
Qwen 3.5 Plus (2026-04-20)875656463856.6%
Writer: Palmyra X5726052524556.4%
Claude Sonnet 4.6605956534654.9%
Claude Opus 4.6626156544154.9%
GPT-5.4615554535054.8%
MiniMax M2.5565555545354.6%
Qwen3 235B A22B Instruct 2507645856484754.5%
DeepSeek V4 Flash (Reasoning)746154473554.3%
Claude Sonnet 4.6 (Reasoning)645453514954.2%
MoonshotAI: Kimi K2.5655652494853.8%
Claude Haiku 4.5605653514352.7%
GPT-5.6 Sol595453494752.2%
GPT-5.6 Sol (Reasoning)645250504552.2%
Gemini 2.5 Flash Lite (Reasoning)655849464252.1%
Gemini 3.5 Flash (Reasoning)605858443951.8%
Gemini 3.1 Pro (Preview)645651474151.8%
Thinking Machines Inkling635548474651.7%
GPT-4.1 Nano605451474551.7%
DeepSeek V3.1815046414051.6%
Z.AI GLM 5.2 (Reasoning, High)635949483851.4%
GPT-4o Mini (temp=0)595350474751.2%
Arcee AI: Trinity Mini765043434050.5%
GPT-5.6 Terra605549474250.3%
WizardLM 2 8x22b685944413850.1%
GPT-5.4 (Reasoning)605250444450.1%
GPT-5.4 (Reasoning, Low)575648474349.9%
Gemini 2.5 Flash Lite565352483849.6%
ByteDance Seed 2.0 Lite655047473649.0%
Z.AI GLM 4.5 Air685348413549.0%
Aion 3.0585448453948.8%
Mistral Large 3565352453748.6%
Gemma 3 12B605046463948.3%
GPT-5.1545150444047.8%
Qwen 3 32B565147424147.7%
Ministral 3 14B715242373647.6%
GPT-4o, Aug. 6th (temp=0)564746454347.5%
Gemini 2.5 Flash (Reasoning)664643414047.3%
Xiaomi MIMO v2.5 Pro605145413847.1%
GPT-5.6 Terra (Reasoning)504747454446.6%
Grok 4.20 (Reasoning)524745454346.5%
Nemotron 3 Super604643434046.3%
Gemma 3 4B535349373745.9%
Gemini 2.5 Pro545045403845.5%
Grok 4.20494645444245.4%
Mistral Small 4 (Reasoning)534747423745.3%
Gemini 2.5 Flash564543424045.3%
Mistral Medium 3.1554947423245.2%
Mistral NeMO555344383545.2%
GPT-5.5 (Reasoning, Low)494845434145.1%
Llama 3.1 70B704443412544.9%
o4 Mini474746444144.8%
Z.AI GLM 4.7 Flash544545423744.5%
Grok 4.3 (Reasoning)484444434344.4%
o4 Mini High504845413944.4%
Inception Mercury 2554542404044.3%
GPT-5.5544641413944.2%
Z.AI GLM 4.7545148343344.0%
Qwen 3.6 35B694838342943.6%
Aion 2.0494742423843.5%
GPT-5.5 (Reasoning)504543413743.0%
Mistral Large 2544744363342.7%
GPT-5.6 Luna444342424042.4%
GPT-5.4 Mini (Reasoning)434342424142.3%
GPT-OSS 120B464442413942.2%
Grok 4.3474442413742.2%
Gemini 3.1 Flash Lite (Preview)494838373441.6%
GPT-5.4 Mini464242403841.6%
Ministral 3 3B554540402741.5%
GPT-5.4 Mini (Reasoning, Low)424241413941.2%
ByteDance Seed 1.6564936343141.1%
GPT-5.6 Luna (Reasoning)424141414041.0%
Qwen3.6 Max Preview644139352540.8%
Qwen 3.5 397B A17B444340403540.5%
Qwen 2.5 72B434341393640.5%
DeepSeek V3.2474642343340.2%
ByteDance Seed 1.6 Flash424140403840.0%
Qwen 3.5 Plus (2026-02-15)434241383439.7%
Ministral 3 8B454239393439.7%
GPT-5464237373539.4%
Qwen 3.6 Flash444238373539.4%
GPT-5 Mini444140373338.9%
Ministral 3B484437372738.7%
GPT-5.2454038383438.7%
ByteDance Seed 2.0 Mini483937353538.7%
MoonshotAI: Kimi K2.6443937363638.6%
Gemma 4 31B (Reasoning)523836363038.6%
Gemini 3.1 Flash Lite424137343237.2%
GPT-5.4 Nano (Reasoning)403736363436.8%
Qwen3.7 Max413937343336.8%
Gemini 3.1 Flash Lite (Reasoning)444135303036.2%
GPT-5.4 Nano (Reasoning, Low)393835353336.1%
Gemini 3 Flash (Preview, Reasoning)393836343335.9%
GPT-5.4 Nano383636353435.7%
Qwen 3.5 9B443933313135.5%
Z.AI GLM 4.6433634332935.2%
Ministral 8B383635333335.1%
Qwen 3.5 27B413835313035.0%
Gemini 3 Flash (Preview)373635353235.0%
Gemma 4 31B433534333034.8%
Qwen 3.5 122B393633323234.3%
Nemotron 3 Nano453832282634.0%
Xiaomi MIMO v2.5353535343033.8%
Qwen 3.5 Flash383734322833.6%
Mistral Small 3.2 24B443837252533.6%
Gemma 4 26B (Reasoning)433330302532.2%
Gemma 4 26B363433292531.4%
Qwen 3.5 35B363030282529.9%
GPT-5 Nano252525252525.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
GPT-4o, Aug. 6th (temp=1)999898918794.4%
GPT-4o Mini (temp=1)989593817989.3%
Grok 4.5 (Reasoning, Low)999586807386.5%
Gemini 3.5 Flash Lite (Reasoning)989384837386.2%
Claude Sonnet 5 (Reasoning)979582817586.1%
Grok 4.5 (Reasoning, High)1009684747385.5%
DeepSeek V3 (2025-03-24)1009286806985.3%
Claude Sonnet 5 (Reasoning, Low)959489846685.3%
Cydonia 24B V4.1989781767385.0%
Hermes 3 70B969583796783.9%
Gemini 3.5 Flash Lite (Reasoning, Minimal)888484818083.4%
Claude Sonnet 4928985767182.5%
MoonshotAI: Kimi K3 (Reasoning, Low)888685777682.5%
Cohere Command R+ (Aug. 2024)958282777582.1%
DeepSeek V3 (2024-12-26)908877777481.2%
Z.AI GLM 4.5 Air939079785979.6%
Hermes 3 405B938878776079.4%
Claude Sonnet 4.5958077756879.3%
Claude Opus 4888276757078.4%
Laguna S 2.1968382656378.0%
Z.AI GLM 4.5908278696777.0%
Gemini 2.5 Flash1007675686476.6%
Claude Sonnet 5817875736774.9%
GPT-4.1 Mini918278685574.8%
GPT-4o Mini (temp=0)767575746873.6%
Z.AI GLM 5.1818172726173.4%
DeepSeek-V2 Chat958467665372.9%
Claude Opus 4.8 (Reasoning, Low)876968666170.1%
DeepSeek V4 Flash (Reasoning)797876675070.0%
Gemma 3 12B827472675369.7%
Z.AI GLM 5896866615968.4%
DeepSeek V4 Pro797467665668.3%
Mistral Medium 3.1907463615368.1%
Grok 4.3948260574567.7%
Claude Opus 4.8 (Reasoning)777266655667.3%
Z.AI GLM 5 Turbo746969655866.9%
Claude Opus 4.5787366625566.6%
GPT-4o, Aug. 6th (temp=0)827465625066.6%
Z.AI GLM 4.6817266635166.6%
GPT-4.1 Nano747272625266.3%
GPT-4.1696965656466.2%
Claude Opus 4.7 (Reasoning)696868665865.9%
MiniMax M2.5737369625265.8%
ByteDance Seed 1.6976955555465.7%
Gemini 2.5 Flash (Reasoning)976563584665.7%
Gemma 3 27B756764615965.3%
Grok 4.20 (Reasoning)716766616065.0%
Thinking Machines Inkling746967585664.9%
MoonshotAI: Kimi K3 (Reasoning, High)776764644964.1%
DeepSeek V4 Flash747267575063.8%
Claude Opus 5 (Reasoning)746965615063.4%
Claude Opus 5 (Reasoning, Low)787258555463.4%
Qwen 3 32B787165534963.3%
Claude Opus 4.7706565605663.3%
Qwen 3.5 Plus (2026-02-15)696763605763.3%
Mistral Large 2756858585763.2%
DeepSeek V4 Pro (Reasoning)676462615962.6%
Writer: Palmyra X5717065525161.9%
Gemini 2.5 Flash Lite736759565561.9%
Gemini 3.6 Flash (Reasoning)757461534661.7%
Claude Sonnet 4.6 (Reasoning)696463595361.6%
Arcee AI: Trinity Mini937158473961.5%
Gemini 2.5 Flash Lite (Reasoning)686762575060.8%
Aion 3.0 Mini686863624360.6%
Claude Sonnet 4.6796059535160.4%
Thinking Machines Inkling (Reasoning)767259514460.2%
MiniMax M2.7726761514659.5%
WizardLM 2 8x22b716459535159.4%
Gemma 3 4B716558524558.4%
Qwen 2.5 72B645857565558.0%
Aion 3.0765958554258.0%
Claude Opus 4.6656361544757.9%
Claude Haiku 4.5755955534857.9%
Llama 3.1 70B686862583257.4%
Claude Opus 4.6 (Reasoning)636159564957.3%
Grok 4.20685856554857.0%
o4 Mini High776450494356.7%
Muse Spark 1.1 (Reasoning, Minimal)655757564656.4%
MoonshotAI: Kimi K2.5666257534356.3%
Laguna XS 2.1675753535056.1%
Claude Opus 5676259494355.8%
Mistral Large 3615957524655.1%
Z.AI GLM 5.2 (Reasoning, High)625856554455.0%
Qwen3 235B A22B Instruct 2507676552454454.4%
MoonshotAI: Kimi K2.6695653514254.1%
Gemini 3.1 Flash Lite655853504354.0%
Aion 2.0616154494453.6%
Xiaomi MIMO v2.5 Pro575553525053.4%
Xiaomi MIMO v2.5615553494953.2%
Mistral Small 4695452484353.1%
o4 Mini595954484652.9%
ByteDance Seed 1.6 Flash585653514552.8%
Gemini 2.5 Pro625958463852.5%
Qwen 3.6 Flash656154453552.0%
Qwen3.6 Max Preview665555443851.6%
Gemini 3.6 Flash (Reasoning, Minimal)555251514851.3%
DeepSeek V3.2535250504950.9%
Grok 4.3 (Reasoning)655649444050.7%
Nemotron 3 Super575451474350.6%
Qwen3.7 Max585552454250.4%
Mistral Small 4 (Reasoning)515150474649.2%
Gemini 3.1 Pro (Preview)535048484749.0%
ByteDance Seed 2.0 Lite595844423848.3%
Ministral 3 14B535347464248.2%
Ministral 3B534848464548.1%
Ministral 3 3B554747454247.4%
Gemini 3.5 Flash (Reasoning, Minimal)565350443547.3%
Ministral 3 8B514846464547.1%
GPT-5.4514847464346.9%
GPT-5.6 Sol (Reasoning)484847454546.7%
Gemini 3.5 Flash (Reasoning)554846434146.4%
Ministral 8B484747454145.9%
GPT-5.6 Sol464646454545.8%
GPT-5.6 Luna (Reasoning)464646464545.8%
GPT-5.4 (Reasoning, Low)514645444345.7%
Muse Spark 1.1 (Reasoning, Medium)505049423845.5%
GPT-5.4 Mini484745444345.5%
GPT-5.6 Luna474646444445.4%
GPT-5.4 Mini (Reasoning)484846443945.1%
Nemotron 3 Nano534544424245.1%
GPT-5.6 Terra (Reasoning)474645444244.9%
GPT-5.6 Terra494645424144.8%
Gemma 4 31B525143393844.6%
DeepSeek V3.1564844413344.6%
GPT-OSS 120B474744434244.5%
GPT-5.1534543424044.5%
GPT-5.5 (Reasoning)484444434344.4%
GPT-5.4 (Reasoning)464444444344.3%
GPT-5.5464544444344.2%
MiniMax M3614645393044.2%
GPT-5.5 (Reasoning, Low)454544444244.2%
GPT-5.4 Mini (Reasoning, Low)474543434244.0%
Inception Mercury 2474444434144.0%
GPT-5.2464444434243.8%
Qwen 3.5 Plus (2026-04-20)5047