Useless dialogue additions

Test: Bad Writing Habits

Avg. Score
62.4%
Scenarios
18

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1GPT-5.6 Luna (Reasoning)99.5%$0.01718.0s95%
2GPT-5.6 Luna99.5%$0.01515.8s93%
3GPT-5.6 Terra99.3%$0.04636.9s94%
4Muse Spark 1.1 (Reasoning, Medium)92.3%$0.01523.9s60%
5GPT-5.6 Terra (Reasoning)96.5%$0.04435.2s70%
6GPT-5.4 Mini87.2%$0.01516.8s54%
7Claude Sonnet 4.692.4%$0.03139.3s60%
8Qwen 3.5 35B93.3%$0.0181.0m58%
9GPT-5.4 Mini (Reasoning)90.0%$0.02228.1s55%
10MoonshotAI: Kimi K3 (Reasoning, Low)91.8%$0.0281.1m63%
11Claude Opus 596.6%$0.08250.1s75%
12GPT-5.4 Mini (Reasoning, Low)84.0%$0.01516.8s47%
13Muse Spark 1.1 (Reasoning, Minimal)84.5%$0.01219.2s45%
14Aion 3.089.5%$0.0241.0m55%
15Qwen 3.6 35B91.4%$0.00831.0m46%
16GPT-5.493.4%$0.0491.4m68%
17Qwen 3.5 9B89.3%$0.00111.4m48%
18Claude Sonnet 587.0%$0.02733.5s48%
19GPT-5.6 Sol98.0%$0.1051.2m82%
20Z.AI GLM 5.2 (Reasoning, High)87.1%$0.0111.0m46%
21Z.AI GLM 5 Turbo84.3%$0.008133.2s41%
22Qwen 3.6 Flash87.9%$0.01041.4s38%
23GPT-5.6 Sol (Reasoning)98.6%$0.1081.2m78%
24Qwen 3.5 397B A17B96.4%$0.0143.0m64%
25Claude Haiku 4.579.8%$0.01121.6s38%
26Qwen 3.5 Flash84.5%$0.002547.5s35%
27DeepSeek V4 Pro82.0%$0.00481.3m45%
28Grok 4.5 (Reasoning, Low)85.1%$0.0181.1m44%
29MoonshotAI: Kimi K3 (Reasoning, High)90.9%$0.0441.8m62%
30MiniMax M2.580.7%$0.00341.3m44%
31Claude Sonnet 4.6 (Reasoning)90.8%$0.0601.2m59%
32Claude Opus 4.8 (Reasoning, Low)87.1%$0.07141.9s59%
33GPT-5.4 (Reasoning, Low)91.0%$0.0551.4m58%
34Z.AI GLM 5.184.9%$0.0141.5m46%
35Claude Opus 5 (Reasoning, Low)93.2%$0.0971.0m68%
36DeepSeek V3 (2025-03-24)79.4%$0.001439.4s32%
37Aion 3.0 Mini81.9%$0.00531.2m39%
38Claude Opus 5 (Reasoning)94.0%$0.0981.0m66%
39Qwen3.6 Max Preview98.0%$0.0503.5m78%
40Qwen3 235B A22B Instruct 250777.9%$0.001159.2s36%
41Grok 4.5 (Reasoning, High)87.2%$0.0301.6m48%
42Mistral Small 4 (Reasoning)73.0%$0.002230.2s32%
43GPT-5 Mini76.6%$0.010057.4s38%
44Claude Sonnet 5 (Reasoning)80.3%$0.03038.9s38%
45Mistral Small 471.4%$0.001418.2s27%
46Claude Opus 4.690.2%$0.0781.2m56%
47GPT-5.4 Nano (Reasoning)70.8%$0.006124.5s30%
48MiniMax M2.776.2%$0.00401.1m34%
49Gemini 3.5 Flash Lite (Reasoning)72.5%$0.00356.6s22%
50MiniMax M387.1%$0.00603.1m53%
51Grok 4.375.2%$0.006930.5s25%
52Claude Opus 4.6 (Reasoning)92.0%$0.0881.4m58%
53Claude Sonnet 5 (Reasoning, Low)79.6%$0.03138.4s34%
54GPT-5.186.9%$0.0541.8m54%
55Gemini 3.5 Flash Lite (Reasoning, Minimal)69.1%$0.00356.3s23%
56Claude Opus 4.784.7%$0.06930.4s43%
57Claude Sonnet 4.578.6%$0.03538.1s35%
58Z.AI GLM 577.9%$0.00841.2m31%
59Writer: Palmyra X567.9%$0.01122.0s28%
60Gemini 3.1 Flash Lite (Reasoning)72.4%$0.003011.9s17%
61DeepSeek V4 Flash (Reasoning)70.0%$0.000731.1s22%
62GPT-5.4 Nano65.7%$0.005726.3s27%
63GPT-5.4 Nano (Reasoning, Low)65.7%$0.005520.6s23%
64Qwen 3.5 122B80.1%$0.0251.1m28%
65GPT-589.7%$0.0652.8m63%
66Claude Opus 4.8 (Reasoning)82.3%$0.07141.7s40%
67Qwen 3.5 27B82.4%$0.0201.6m31%
68Grok 4.20 (Reasoning)77.7%$0.0181.5m30%
69DeepSeek V4 Flash65.8%$0.000631.6s19%
70Grok 4.2066.4%$0.009345.7s24%
71GPT-5.594.7%$0.1391.7m69%
72GPT-5.5 (Reasoning)94.9%$0.1421.8m71%
73GPT-5.5 (Reasoning, Low)95.4%$0.1391.8m68%
74Claude Opus 4.7 (Reasoning)80.3%$0.07632.0s35%
75Claude Opus 4.577.4%$0.07053.4s40%
76Gemini 3.1 Flash Lite64.1%$0.003012.1s10%
77GPT-5.4 (Reasoning)91.7%$0.0892.6m58%
78Qwen 3.5 Plus (2026-04-20)77.4%$0.0171.8m26%
79o4 Mini61.8%$0.01525.7s19%
80Qwen 3 32B61.6%$0.001554.6s20%
81Claude Sonnet 469.2%$0.03243.7s24%
82ByteDance Seed 2.0 Lite76.8%$0.0122.2m25%
83Thinking Machines Inkling68.3%$0.00751.5m19%
84Qwen3.7 Max85.9%$0.0682.3m42%
85Laguna S 2.152.1%$0.000522.1s14%
86Mistral Medium 3.157.0%$0.004836.5s14%
87Cydonia 24B V4.154.7%$0.001444.8s16%
88Gemini 3.1 Flash Lite (Preview)55.7%$0.00308.4s6%
89Grok 4.3 (Reasoning)77.4%$0.0212.3m22%
90o4 Mini High62.9%$0.02547.2s15%
91Mistral Large 255.9%$0.01329.4s9%
92Xiaomi MIMO v2.5 Pro59.2%$0.008553.5s10%
93Hermes 3 405B56.1%$0.003253.2s10%
94Gemini 3.6 Flash (Reasoning, Minimal)47.6%$0.01714.3s14%
95MoonshotAI: Kimi K2.575.9%$0.0193.2m31%
96Laguna XS 2.143.3%$0.000314.4s8%
97ByteDance Seed 1.6 Flash43.9%$0.001327.3s11%
98Xiaomi MIMO v2.552.3%$0.005431.8s5%
99Mistral Large 350.0%$0.003330.3s5%
100GPT-4.151.5%$0.01844.7s14%
101Gemini 3.1 Pro (Preview)85.6%$0.1071.8m34%
102Ministral 3 14B40.6%$0.000711.7s4%
103GPT-5.266.4%$0.0561.5m24%
104Z.AI GLM 4.544.6%$0.005142.1s9%
105Qwen 3.6 27B66.7%$0.0252.3m18%
106Gemini 3.6 Flash (Reasoning)52.8%$0.04432.5s13%
107GPT-4o, Aug. 6th (temp=1)43.2%$0.01824.4s6%
108Gemini 2.5 Flash37.3%$0.005210.6s2%
109DeepSeek V4 Pro (Reasoning)66.9%$0.0153.1m20%
110ByteDance Seed 1.662.9%$0.0132.5m14%
111Gemini 2.5 Flash Lite (Reasoning)39.0%$0.002830.8s1%
112Hermes 3 70B43.6%$0.00101.2m5%
113Gemma 4 31B (Reasoning)57.1%$0.00142.2m6%
114Aion 2.043.2%$0.00641.3m8%
115Llama 3.1 70B36.6%$0.001529.4s0%
116Ministral 3B29.4%$0.00018.1s0%
117Gemma 4 26B (Reasoning)55.5%$0.00132.0m3%
118WizardLM 2 8x22b48.6%$0.00261.8m7%
119Z.AI GLM 4.7 Flash39.1%$0.00171.2m6%
120Ministral 8B28.1%$0.000410.4s0%
121Gemini 2.5 Flash (Reasoning)34.1%$0.01121.5s1%
122Z.AI GLM 4.740.4%$0.0101.4m10%
123Gemma 4 26B38.0%$0.000955.1s0%
124Arcee AI: Trinity Mini24.8%$0.00039.2s0%
125GPT-5 Nano37.2%$0.00421.4m8%
126Gemini 3 Flash (Preview, Reasoning)34.9%$0.01230.1s1%
127Z.AI GLM 4.638.0%$0.006551.5s0%
128Gemini 2.5 Flash Lite23.7%$0.00099.5s0%
129GPT-4.1 Nano24.0%$0.000713.3s0%
130Ministral 3 8B25.5%$0.000819.6s0%
131Ministral 3 3B22.4%$0.000511.1s0%
132Gemma 4 31B40.7%$0.00101.6m4%
133DeepSeek V3 (2024-12-26)33.1%$0.002154.6s0%
134Gemini 3.5 Flash (Reasoning, Minimal)26.7%$0.01812.0s2%
135DeepSeek-V2 Chat32.0%$0.002153.3s0%
136Gemini 2.5 Pro42.2%$0.03636.2s1%
137MoonshotAI: Kimi K2.689.5%$0.0586.5m52%
138Gemini 3 Flash (Preview)23.3%$0.007819.6s0%
139GPT-4.1 Mini20.3%$0.002719.0s0%
140DeepSeek V3.238.2%$0.00141.9m5%
141Qwen 3.5 Plus (2026-02-15)20.3%$0.006031.5s0%
142Mistral NeMO10.9%$0.000510.1s0%
143Z.AI GLM 4.5 Air23.5%$0.002958.2s0%
144GPT-4o Mini (temp=1)16.7%$0.001234.8s0%
145Claude Opus 482.3%$0.2091.4m45%
146Thinking Machines Inkling (Reasoning)70.2%$0.0255.1m24%
147Cohere Command R+ (Aug. 2024)25.6%$0.02052.5s0%
148Gemma 3 27B15.1%$0.000652.6s0%
149Nemotron 3 Super22.6%$0.00001.4m0%
150DeepSeek V3.129.2%$0.00201.8m0%
151Inception Mercury 21.6%$0.00327.0s0%
152Nemotron 3 Nano15.9%$0.00101.1m0%
153Gemma 3 4B3.1%$0.000220.0s0%
154Gemma 3 12B7.3%$0.000441.3s0%
155Qwen 2.5 72B3.6%$0.001036.7s0%
156GPT-4o, Aug. 6th (temp=0)7.5%$0.02322.7s0%
157GPT-4o Mini (temp=0)0.0%$0.001234.8s0%
158Gemini 3.5 Flash (Reasoning)32.8%$0.07137.6s1%
159ByteDance Seed 2.0 Mini56.7%$0.00454.9m10%
160GPT-OSS 120B6.8%$0.00151.8m0%
161Mistral Small 3.2 24B16.1%$0.00695.7m0%
62.39%

Individual Scenarios

Detailed Writing Rules

Model # 1 # 2 # 3 # 4 # 5 Avg ▼
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
Qwen 3.5 122B100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
GPT-5.51001001001009498.8%
Claude Sonnet 4.5100100100979698.6%
GPT-5.4 (Reasoning)1001001001009298.3%
GPT-5.4 Mini1001001001008997.9%
Claude Opus 5 (Reasoning)1001001001008997.9%
GPT-5.410010097949296.5%
MoonshotAI: Kimi K3 (Reasoning, High)10010097948996.1%
GPT-5.11001001001007895.6%
Claude Opus 5 (Reasoning, Low)1001001001007795.5%
GPT-5.6 Luna (Reasoning)100100100948395.4%
MoonshotAI: Kimi K2.6100100100898795.2%
GPT-5100100100858393.7%
Muse Spark 1.1 (Reasoning, Medium)10010097878393.4%
GPT-5.5 (Reasoning, Low)1001001001005490.7%
GPT-5.4 Mini (Reasoning, Low)100100100875889.0%
Grok 4.5 (Reasoning, High)1001001001004288.3%
Claude Sonnet 5 (Reasoning)100100100756387.5%
Claude Opus 4100100100834886.3%
Claude Opus 4.8 (Reasoning)10010099666686.2%
MoonshotAI: Kimi K3 (Reasoning, Low)1008989807286.1%
Qwen3.7 Max10010088756685.8%
Claude Sonnet 4.6 (Reasoning)100100100755485.7%
Claude Opus 4.8 (Reasoning, Low)10010092835485.7%
Qwen3.6 Max Preview100100100943485.6%
Claude Sonnet 4.610010080806384.3%
Qwen 3.5 Flash100100100695184.2%
Claude Opus 4.71009489835484.0%
Qwen3 235B A22B Instruct 250710010099922583.1%
Claude Opus 4.610010092893483.0%
Claude Opus 4.7 (Reasoning)10010089834282.9%
Qwen 3.6 27B100100100724282.8%
Claude Opus 4.6 (Reasoning)10010092873482.5%
Cydonia 24B V4.110010088695482.2%
GPT-5.210010098644882.1%
Grok 4.5 (Reasoning, Low)100100100100080.0%
Qwen 3.6 Flash100100100100080.0%
ByteDance Seed 2.0 Mini100100100752580.0%
Claude Haiku 4.510010089723779.7%
DeepSeek V4 Pro10010089832579.5%
Muse Spark 1.1 (Reasoning, Minimal)10010077754278.8%
Grok 4.20 (Reasoning)10010010094078.8%
Mistral Small 4 (Reasoning)100100100543477.5%
Gemini 3.5 Flash Lite (Reasoning)10010010080075.9%
Aion 3.0 Mini1008983802575.4%
GPT-5 Mini10010095661675.3%
Claude Opus 4.51009671634675.1%
ByteDance Seed 1.610010010069073.9%
Z.AI GLM 5.2 (Reasoning, High)10010080484273.9%
Z.AI GLM 510010069544673.8%
ByteDance Seed 2.0 Lite10010010063072.5%
DeepSeek V4 Flash1009787541470.2%
MiniMax M2.71007769544669.3%
Mistral Small 4967572544868.9%
DeepSeek-V2 Chat1001008063068.4%
Grok 4.310010010042068.3%
Aion 3.01008983541468.0%
o4 Mini100948363067.9%
Claude Sonnet 5100100100251467.8%
Gemini 3.6 Flash (Reasoning, Minimal)10010063383867.7%
Qwen 3 32B96968167067.7%
Writer: Palmyra X51007569543767.0%
Qwen 3.5 Plus (2026-04-20)10010010030066.1%
Grok 4.201009277371664.4%
Gemma 4 26B (Reasoning)10010010014062.8%
GPT-5.4 Nano (Reasoning)100946650062.0%
Thinking Machines Inkling (Reasoning)1007554542561.4%
Z.AI GLM 4.5 Air876363514260.9%
MiniMax M3100837537059.0%
Z.AI GLM 4.7 Flash1001006625058.2%
Z.AI GLM 5.11008054421457.7%
DeepSeek V3 (2024-12-26)1001004242056.7%
Xiaomi MIMO v2.5 Pro100946918056.2%
DeepSeek V3 (2025-03-24)1001005425055.7%
WizardLM 2 8x22b1009742251455.6%
Claude Sonnet 5 (Reasoning, Low)100836325054.2%
o4 Mini High100896614053.9%
GPT-4.187756937053.5%
Gemma 4 31B (Reasoning)100100540050.7%
DeepSeek V4 Pro (Reasoning)1001002525050.0%
Z.AI GLM 5 Turbo9694580049.5%
GPT-5.4 Nano (Reasoning, Low)100843825049.5%
Grok 4.3 (Reasoning)100100420048.3%
Gemini 2.5 Flash100100370047.4%
Z.AI GLM 4.787753831046.2%
MoonshotAI: Kimi K2.510087420045.6%
GPT-5.4 Nano80695425045.5%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100545414044.2%
Thinking Machines Inkling100100100041.9%
Claude Sonnet 48987310041.4%
DeepSeek V4 Flash (Reasoning)100543120040.9%
Hermes 3 70B10010000040.0%
Gemini 3.5 Flash (Reasoning)1009100038.1%
Gemini 3.6 Flash (Reasoning)66503834037.7%
DeepSeek V3.11007500035.0%
Cohere Command R+ (Aug. 2024)10054180034.3%
Ministral 3 14B1005400030.7%
MiniMax M2.55446460029.1%
Gemini 3.1 Flash Lite (Reasoning)9425250028.7%
Ministral 3 8B10025140027.8%
Mistral Large 31003400026.8%
Gemini 3 Flash (Preview, Reasoning)7231200024.7%
ByteDance Seed 1.6 Flash5139250022.9%
Z.AI GLM 4.5634900022.3%
Gemini 2.5 Flash Lite (Reasoning)1001000021.9%
Mistral Medium 3.1634200020.8%
Gemma 4 26B545000020.7%
Qwen 3.5 Plus (2026-02-15)3834208020.0%
Z.AI GLM 4.6100000020.0%
Gemini 3.1 Flash Lite (Preview)37252014019.1%
GPT-4o, Aug. 6th (temp=1)544200019.0%
Hermes 3 405B80700017.4%
Llama 3.1 70B80000015.9%
GPT-5 Nano671000015.4%
Gemini 3.5 Flash (Reasoning, Minimal)372570013.8%
Gemma 4 31B481800013.2%
Laguna S 2.154700012.2%
Aion 2.0342000010.8%
Ministral 3B54000010.7%
GPT-4.1 Mini2518100010.5%
GPT-4o Mini (temp=1)361060010.3%
Gemini 3 Flash (Preview)4600009.2%
DeepSeek V3.225140007.8%
Mistral Large 23400006.8%
Gemma 3 12B2500005.0%
Ministral 8B2500005.0%
Laguna XS 2.110100003.8%
GPT-4.1 Nano1400002.8%
Gemini 2.5 Flash (Reasoning)1000001.9%
Gemini 3.1 Flash Lite600001.2%
Gemini 2.5 Pro000000.0%
GPT-OSS 120B000000.0%
Xiaomi MIMO v2.5000000.0%
GPT-4o, Aug. 6th (temp=0)000000.0%
Inception Mercury 2000000.0%
Nemotron 3 Super000000.0%
Gemini 2.5 Flash Lite000000.0%
Mistral Small 3.2 24B000000.0%
GPT-4o Mini (temp=0)000000.0%
Gemma 3 27B000000.0%
Nemotron 3 Nano000000.0%
Qwen 2.5 72B000000.0%
Arcee AI: Trinity Mini000000.0%
Gemma 3 4B000000.0%
Ministral 3 3B000000.0%
Mistral NeMO000000.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Qwen3.7 Max100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Qwen3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
MoonshotAI: Kimi K2.6100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
GPT-5100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100.0%
Thinking Machines Inkling (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
GPT-5.5100100100100100100.0%
Aion 3.0100100100100100100.0%
Gemini 2.5 Pro100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Z.AI GLM 4.6100100100100100100.0%
Claude Sonnet 4100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Claude Sonnet 5100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
ByteDance Seed 2.0 Mini100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
ByteDance Seed 2.0 Lite100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
Aion 3.0 Mini100100100100100100.0%
Gemini 2.5 Flash Lite (Reasoning)100100100100100100.0%
Mistral Small 4 (Reasoning)100100100100100100.0%
Grok 4.3100100100100100100.0%
GPT-5.4 Mini1001001001008095.9%
GPT-5.6 Terra1001001001007595.0%
GPT-5.1100100100927793.8%
Gemini 3.1 Pro (Preview)1001001001005490.7%
Claude Sonnet 5 (Reasoning)1001001001005490.7%
MiniMax M2.71001001001005490.7%
GPT-5.4 (Reasoning)1001001001004288.3%
MoonshotAI: Kimi K3 (Reasoning, Low)1001001001004288.3%
Claude Opus 4.8 (Reasoning, Low)1001001001004288.3%
Grok 4.5 (Reasoning, Low)1001001001004288.3%
GPT-5.41001001001004288.3%
Claude Opus 410010099835587.5%
DeepSeek V4 Pro100100100805486.6%
Gemini 3.5 Flash Lite (Reasoning, Minimal)1001001001002585.0%
Arcee AI: Trinity Mini1001001001002585.0%
MiniMax M2.5100100100695484.6%
Grok 4.5 (Reasoning, High)100100100100080.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100080.0%
Z.AI GLM 5 Turbo100100100100080.0%
GPT-5.5 (Reasoning, Low)100100100100080.0%
GPT-5.6 Terra (Reasoning)100100100100080.0%
Claude Opus 4.8 (Reasoning)100100100100080.0%
Claude Opus 4.6100100100100080.0%
Grok 4.20 (Reasoning)100100100100080.0%
MoonshotAI: Kimi K2.5100100100100080.0%
MiniMax M3100100100100080.0%
Qwen 3.5 122B100100100100080.0%
Claude Sonnet 5 (Reasoning, Low)100100100100080.0%
Claude Opus 4.5100100100752580.0%
Z.AI GLM 5100100100100080.0%
Qwen 3.6 Flash100100100100080.0%
o4 Mini High100100100100080.0%
Qwen 3.6 27B100100100100080.0%
Aion 2.0100100100100080.0%
Gemini 3.5 Flash Lite (Reasoning)100100100100080.0%
Gemini 2.5 Flash (Reasoning)100100100100080.0%
GPT-5.4 Mini (Reasoning, Low)100100100100080.0%
Claude Haiku 4.5100100100100080.0%
DeepSeek V3 (2025-03-24)100100100100080.0%
Qwen3 235B A22B Instruct 2507100100100100080.0%
Ministral 3 3B100100100100080.0%
Qwen 3 32B10010083575078.0%
ByteDance Seed 1.610010010080075.9%
Thinking Machines Inkling10010010075075.0%
Grok 4.2010010010069073.9%
Hermes 3 405B10010010069073.9%
Writer: Palmyra X510010010069073.9%
Mistral Small 410010010069073.9%
GPT-5.4 Nano (Reasoning, Low)100100100541473.5%
MoonshotAI: Kimi K3 (Reasoning, High)100100100422573.3%
DeepSeek V4 Flash10010010063072.5%
Gemini 3.1 Flash Lite1008069634270.6%
o4 Mini10010010042068.3%
Claude Opus 4.7 (Reasoning)10010010025065.0%
Ministral 8B10010010025065.0%
DeepSeek V4 Pro (Reasoning)10010010018063.6%
Gemini 3.6 Flash (Reasoning)1001006354063.2%
GPT-5 Mini99897354063.0%
GPT-5.4 (Reasoning, Low)1001006342060.8%
DeepSeek V4 Flash (Reasoning)1001001000060.0%
GPT-4.11001001000060.0%
Xiaomi MIMO v2.5 Pro1001001000060.0%
Gemma 4 31B1001001000060.0%
Gemma 4 26B1001001000060.0%
Mistral Large 31001001000060.0%
DeepSeek V3.11001001000060.0%
DeepSeek V3.21001001000060.0%
Mistral Large 21001001000060.0%
Llama 3.1 70B1001001000060.0%
Mistral Medium 3.11001001000060.0%
WizardLM 2 8x22b1001001000060.0%
GPT-4.1 Nano1001001000060.0%
ByteDance Seed 1.6 Flash100776948059.0%
Cydonia 24B V4.11001006925058.9%
Gemini 3.5 Flash (Reasoning, Minimal)756963424258.1%
GPT-5.21001005425055.7%
GPT-5 Nano836057423455.1%
GPT-5.4 Nano100100630052.5%
Gemini 3.6 Flash (Reasoning, Minimal)100100540050.7%
Gemini 3.1 Flash Lite (Reasoning)100100540050.7%
Z.AI GLM 4.71001002525050.0%
GPT-5.4 Nano (Reasoning)100634242049.2%
GPT-4.1 Mini10080540046.6%
GPT-4o, Aug. 6th (temp=1)100634225045.8%
Ministral 3 14B100100250045.0%
Qwen 3.5 Plus (2026-02-15)83803425044.4%
Gemma 4 31B (Reasoning)10010000040.0%
Gemma 4 26B (Reasoning)10010000040.0%
DeepSeek-V2 Chat10010000040.0%
Xiaomi MIMO v2.510010000040.0%
DeepSeek V3 (2024-12-26)10010000040.0%
Ministral 3 8B10010000040.0%
Hermes 3 70B10010000040.0%
Ministral 3B10010000040.0%
Laguna S 2.17258480035.8%
Gemini 3 Flash (Preview, Reasoning)1007500035.0%
Gemini 3.5 Flash (Reasoning)1006900033.9%
Gemini 3.1 Flash Lite (Preview)8063250033.4%
Gemini 3 Flash (Preview)42424242033.3%
Z.AI GLM 4.51005400030.7%
GPT-4o Mini (temp=1)1004200028.3%
Z.AI GLM 4.7 Flash1002500025.0%
Gemma 3 27B1002500025.0%
Nemotron 3 Nano1001400022.8%
Nemotron 3 Super100000020.0%
Gemini 2.5 Flash100000020.0%
Gemini 2.5 Flash Lite100000020.0%
Laguna XS 2.1100000020.0%
Mistral NeMO100000020.0%
GPT-OSS 120B6316140018.5%
Gemma 3 4B2525140012.8%
Z.AI GLM 4.5 Air421800011.9%
Cohere Command R+ (Aug. 2024)54000010.7%
GPT-4o, Aug. 6th (temp=0)000000.0%
Inception Mercury 2000000.0%
Mistral Small 3.2 24B000000.0%
GPT-4o Mini (temp=0)000000.0%
Gemma 3 12B000000.0%
Qwen 2.5 72B000000.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Qwen3.7 Max100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
MoonshotAI: Kimi K2.6100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.1100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.5100100100100100100.0%
Aion 3.0100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
MiniMax M2.7100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
GPT-5.4100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
Aion 3.0 Mini100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)1001001001009999.7%
Z.AI GLM 5.11001001001009999.7%
DeepSeek V3 (2025-03-24)1001001001009799.4%
GPT-51001001001009799.3%
Claude Sonnet 5 (Reasoning, Low)1001001001009699.1%
DeepSeek V4 Pro1001001001009498.8%
Qwen3 235B A22B Instruct 25071001001001009498.8%
GPT-5.21001001001009398.5%
GPT-5.4 Mini (Reasoning, Low)1001001001009298.3%
GPT-5.5 (Reasoning, Low)1001001001008997.9%
Claude Opus 4.6 (Reasoning)1001001001008897.6%
GPT-5.4 Mini100100100978997.3%
Z.AI GLM 5 Turbo100100100948996.6%
Claude Sonnet 4.6 (Reasoning)100100100948996.6%
DeepSeek V4 Flash (Reasoning)1001001001008296.3%
Claude Opus 51001001001007795.5%
Z.AI GLM 5100100100928395.0%
Claude Opus 5 (Reasoning, Low)100100100948094.7%
MiniMax M310010092928994.5%
MiniMax M2.5100100100898394.5%
Qwen 3.6 Flash100100100977594.4%
Claude Opus 4.8 (Reasoning)100100100947794.2%
GPT-5.4 Mini (Reasoning)100100100977293.9%
Grok 4.5 (Reasoning, High)100100100926992.2%
Grok 4.3 (Reasoning)1001001001006092.0%
Thinking Machines Inkling (Reasoning)1001001001005891.7%
Claude Opus 4.7 (Reasoning)10010089838391.2%
Mistral Medium 3.11001001001005490.7%
Claude Opus 5 (Reasoning)100100100807290.4%
MoonshotAI: Kimi K3 (Reasoning, Low)100100100926090.3%
Claude Opus 4100100100836790.1%
Claude Opus 4.8 (Reasoning, Low)10010092827790.1%
Grok 4.310010087838089.9%
Qwen 3.5 Plus (2026-04-20)100100100965489.8%
Claude Haiku 4.510010096916389.7%
MoonshotAI: Kimi K2.510010097806989.2%
Claude Sonnet 5 (Reasoning)100100100875889.0%
MoonshotAI: Kimi K3 (Reasoning, High)10010097776387.4%
Grok 4.20 (Reasoning)100100100775887.1%
Claude Opus 4.61001001001003486.8%
Hermes 3 405B1001001001003486.8%
Mistral Large 310010097894686.5%
Claude Sonnet 41001001001003186.3%
Claude Sonnet 51009696805785.5%
Writer: Palmyra X51009788696784.4%
Claude Opus 4.5100100100665483.9%
Mistral Small 4100100100635683.6%
Qwen3.6 Max Preview1001001001001883.6%
o4 Mini1008383806682.5%
DeepSeek V4 Pro (Reasoning)100100100921481.1%
ByteDance Seed 2.0 Lite100100100634280.8%
Xiaomi MIMO v2.5 Pro10010084734680.8%
Qwen 3.5 122B10010010099079.7%
Grok 4.5 (Reasoning, Low)100100100722579.5%
Grok 4.2010010083713778.3%
GPT-5.4 Nano10010071685077.8%
Z.AI GLM 4.7 Flash10010010082076.3%
GPT-5 Mini908881794275.9%
GPT-5.4 Nano (Reasoning, Low)10010010074074.7%
Thinking Machines Inkling10010085632574.5%
Laguna S 2.11009672504672.8%
Z.AI GLM 4.5968573565472.7%
o4 Mini High10010071542570.0%
Laguna XS 2.110010077542070.0%
Mistral Large 299978766069.7%
ByteDance Seed 1.6 Flash10010091341868.6%
GPT-5.4 Nano (Reasoning)1008971542567.9%
Mistral Small 4 (Reasoning)10010058423767.4%
WizardLM 2 8x22b1001007850666.8%
ByteDance Seed 1.610010010025065.0%
DeepSeek V4 Flash1001006337059.9%
Gemini 3.5 Flash Lite (Reasoning)898563461459.3%
Cydonia 24B V4.11006557393659.3%
Ministral 3 14B1007563421158.1%
Qwen 3 32B87807542056.6%
GPT-4o, Aug. 6th (temp=1)928054302555.9%
Aion 2.092877211753.9%
Gemini 3.5 Flash (Reasoning, Minimal)100835430053.3%
Gemini 3.5 Flash (Reasoning)1005749341450.9%
Z.AI GLM 4.777726342050.6%
GPT-4.180726614046.4%
Gemini 3.1 Flash Lite (Reasoning)100664220045.5%
Ministral 3 8B9175547045.3%
Gemini 3.6 Flash (Reasoning)8877580044.7%
Z.AI GLM 4.5 Air100100100041.9%
Qwen 3.6 27B100572525041.4%
Gemini 3.6 Flash (Reasoning, Minimal)655438282040.9%
DeepSeek V3 (2024-12-26)9654540040.5%
Gemma 4 26B (Reasoning)10010000040.0%
Ministral 3B10010000040.0%
GPT-5 Nano10071214039.3%
Gemini 3.5 Flash Lite (Reasoning, Minimal)69543431037.7%
DeepSeek-V2 Chat1007500035.0%
Gemma 4 31B (Reasoning)1006300032.5%
Gemma 3 12B66503011031.5%
DeepSeek V3.266483011031.1%
Qwen 3.5 Plus (2026-02-15)5651375029.7%
Hermes 3 70B1004800029.6%
ByteDance Seed 2.0 Mini7546250029.2%
Gemini 2.5 Flash1004400028.8%
DeepSeek V3.110025140027.8%
Gemini 3 Flash (Preview, Reasoning)1002500025.0%
Xiaomi MIMO v2.5694280023.9%
Gemini 2.5 Flash (Reasoning)5145210023.5%
GPT-4o Mini (temp=1)54361711023.4%
Nemotron 3 Super100000020.0%
Llama 3.1 70B100000020.0%
Gemma 3 27B543800018.3%
Qwen 2.5 72B80000015.9%
Z.AI GLM 4.63425140014.6%
Gemini 3 Flash (Preview)3122180014.1%
GPT-4.1 Mini69000013.9%
Arcee AI: Trinity Mini63000012.5%
Cohere Command R+ (Aug. 2024)63000012.5%
Gemma 3 4B63000012.5%
Mistral NeMO58000011.7%
Ministral 8B54000010.7%
Gemini 3.1 Flash Lite (Preview)37100009.3%
Gemma 4 31B4200008.3%
Gemma 4 26B25100006.9%
Gemini 2.5 Flash Lite2500005.0%
Gemini 3.1 Flash Lite2000003.9%
GPT-OSS 120B1800003.6%
Gemini 2.5 Pro000000.0%
Gemini 2.5 Flash Lite (Reasoning)000000.0%
GPT-4o, Aug. 6th (temp=0)000000.0%
Inception Mercury 2000000.0%
Mistral Small 3.2 24B000000.0%
GPT-4o Mini (temp=0)000000.0%
Nemotron 3 Nano000000.0%
GPT-4.1 Nano000000.0%
Ministral 3 3B000000.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
MoonshotAI: Kimi K3 (Reasoning, High)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
Qwen 3.5 122B100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
GPT-5.5100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Claude Opus 4100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
GPT-5.4100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
DeepSeek V4 Pro100100100100100100.0%
GPT-51001001001009999.9%
Aion 3.01001001001009999.7%
GPT-5.4 Mini (Reasoning, Low)1001001001009799.4%
GPT-4.1100100100969698.2%
Qwen3.6 Max Preview1001001001008797.3%
Claude Opus 5 (Reasoning)100100100949297.1%
Claude Opus 5100100100949297.1%
MoonshotAI: Kimi K3 (Reasoning, Low)1001001001008396.7%
Qwen 3.5 397B A17B1001001001008396.7%
GPT-5.4 Mini1001001001008396.7%
Muse Spark 1.1 (Reasoning, Medium)1001001001007795.5%
Claude Sonnet 4.61001001001007595.0%
GPT-5.2100100100928395.0%
Xiaomi MIMO v2.5 Pro1001001001007595.0%
Claude Opus 4.8 (Reasoning)100100100977594.4%
GPT-5.11001001001007194.3%
GPT-5.5 (Reasoning)1001001001006993.9%
Claude Sonnet 41001001001006993.9%
DeepSeek V3 (2025-03-24)1001001001006993.9%
o4 Mini100100100927593.3%
Aion 3.0 Mini1001001001006693.2%
Muse Spark 1.1 (Reasoning, Minimal)100100100838092.6%
Grok 4.5 (Reasoning, High)1001001001006392.5%
ByteDance Seed 2.0 Lite1001001001006392.5%
DeepSeek V4 Flash (Reasoning)100100100896991.7%
Grok 4.3100100100807590.9%
Claude Haiku 4.510010099975890.8%
Gemma 4 31B (Reasoning)1001001001005490.7%
Grok 4.5 (Reasoning, Low)100100100806989.8%
Z.AI GLM 5.2 (Reasoning, High)10010087877589.6%
MoonshotAI: Kimi K2.61001001001004889.6%
Claude Opus 4.6100100100836389.2%
Claude Opus 4.8 (Reasoning, Low)1009694837289.0%
GPT-5.4 (Reasoning)1001001001004288.3%
GPT-5.4 (Reasoning, Low)1001001001004288.3%
Mistral Small 4 (Reasoning)1001001001004288.3%
GPT-5 Mini100100100835888.2%
MiniMax M310010092776687.0%
GPT-5.4 Nano (Reasoning)100100100726387.0%
Claude Sonnet 5 (Reasoning, Low)1001001001003486.8%
GPT-5.4 Nano10010087776986.7%
Qwen3.7 Max100100100834685.9%
Claude Opus 4.7 (Reasoning)1001001001002585.0%
Qwen 3.5 Plus (2026-04-20)100100100695484.6%
Grok 4.201009983835483.8%
Claude Sonnet 510010089755483.6%
Z.AI GLM 510010099883083.3%
Claude Sonnet 4.51009292804882.2%
Claude Opus 5 (Reasoning, Low)100100100941481.5%
Hermes 3 405B100100100545481.4%
Writer: Palmyra X510010099832581.4%
WizardLM 2 8x22b100100100565081.2%
Claude Opus 4.710010087635480.5%
DeepSeek V4 Pro (Reasoning)10010087803480.0%
ByteDance Seed 1.6100100100100080.0%
Qwen 3.5 Flash100100100100080.0%
MiniMax M2.71009989585480.0%
ByteDance Seed 2.0 Mini100100100424276.7%
Claude Sonnet 4.6 (Reasoning)1009694662576.1%
Laguna XS 2.1898969696376.0%
Qwen 3 32B948780664874.8%
Grok 4.20 (Reasoning)10010083691874.1%
Mistral Large 210010010063072.5%
Claude Opus 4.51008980662572.0%
MoonshotAI: Kimi K2.51001009658070.8%
Z.AI GLM 5.11009663544270.7%
Z.AI GLM 5 Turbo10010063543470.0%
Thinking Machines Inkling (Reasoning)1001007569068.9%
Claude Sonnet 5 (Reasoning)1007563634268.3%
Hermes 3 70B10010010042068.3%
Qwen3 235B A22B Instruct 2507100100100141064.7%
o4 Mini High1001006756064.7%
GPT-5.4 Nano (Reasoning, Low)1009488201663.6%
Cydonia 24B V4.11008066541462.6%
Mistral Medium 3.189807563061.3%
Laguna S 2.11001007525060.0%
Z.AI GLM 4.5100726560059.4%
Qwen 3.6 27B776959464459.3%
DeepSeek V4 Flash100100920058.3%
Thinking Machines Inkling100756354058.2%
MiniMax M2.5100896634057.9%
GPT-4.1 Mini875450484656.8%
DeepSeek-V2 Chat1001006020055.9%
Z.AI GLM 4.5 Air10094780054.4%
ByteDance Seed 1.6 Flash100875825054.0%
Gemini 3.5 Flash Lite (Reasoning)1001003725052.4%
Gemma 4 31B100754234050.2%
Mistral Small 4100100480049.6%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100754625049.2%
DeepSeek V3 (2024-12-26)1001003014048.7%
GPT-4o, Aug. 6th (temp=1)96754214045.2%
Ministral 3 14B100692525043.9%
Z.AI GLM 4.7 Flash95604810042.4%
Gemini 3.6 Flash (Reasoning)83665011042.2%
Gemini 3.6 Flash (Reasoning, Minimal)63544238039.2%
Xiaomi MIMO v2.5997570036.2%
Cohere Command R+ (Aug. 2024)8769250036.2%
GPT-4o Mini (temp=1)7265360034.6%
Gemini 3.5 Flash (Reasoning)10042310034.6%
Mistral Large 39448300034.3%
Gemini 3 Flash (Preview, Reasoning)10031100028.2%
DeepSeek V3.2825800028.0%
Z.AI GLM 4.75754290027.8%
Z.AI GLM 4.68034180026.3%
Gemini 2.5 Flash (Reasoning)4832316624.7%
Ministral 3 8B1001470024.2%
Mistral NeMO1001800023.6%
Gemini 2.5 Flash Lite694500022.9%
Gemini 3 Flash (Preview)574250020.7%
Gemma 4 26B (Reasoning)100000020.0%
Gemini 2.5 Pro100000020.0%
Llama 3.1 70B100000020.0%
DeepSeek V3.14834100018.4%
Gemini 2.5 Flash632800018.1%
GPT-4.1 Nano87000017.3%
Ministral 8B87000017.3%
Gemini 3.1 Flash Lite (Reasoning)4218140014.7%
Gemini 3.1 Flash Lite (Preview)66000013.2%
Gemma 3 12B3018160012.8%
Aion 2.0371460011.3%
GPT-4o, Aug. 6th (temp=0)4800009.6%
Qwen 2.5 72B4800009.6%
Qwen 3.5 Plus (2026-02-15)31124009.4%
Gemini 3.5 Flash (Reasoning, Minimal)4500009.0%
Gemma 3 27B2560006.2%
GPT-OSS 120B2540005.9%
Ministral 3 3B2500005.0%
Arcee AI: Trinity Mini1800003.6%
Nemotron 3 Nano1100002.3%
Gemini 3.1 Flash Lite000000.0%
Gemma 4 26B000000.0%
Gemini 2.5 Flash Lite (Reasoning)000000.0%
Inception Mercury 2000000.0%
Nemotron 3 Super000000.0%
GPT-5 Nano000000.0%
Mistral Small 3.2 24B000000.0%
GPT-4o Mini (temp=0)000000.0%
Gemma 3 4B000000.0%
Ministral 3B000000.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
GPT-5.6 Sol (Reasoning)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Qwen3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
Aion 3.0100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
DeepSeek V4 Flash (Reasoning)100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Claude Opus 4100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
GPT-5.4100100100100100100.0%
ByteDance Seed 2.0 Lite100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
GPT-5.4 Mini100100100100100100.0%
Xiaomi MIMO v2.5 Pro1001001001009999.7%
Claude Sonnet 4.6 (Reasoning)1001001001009699.1%
Claude Opus 51001001001009699.1%
Qwen 3.6 35B1001001001009699.1%
MoonshotAI: Kimi K3 (Reasoning, Low)100100100999698.9%
MiniMax M2.71001001001009498.8%
Aion 3.0 Mini100100100999598.7%
Grok 4.5 (Reasoning, High)1001001001009298.3%
GPT-5.2100100100999197.8%
Qwen3 235B A22B Instruct 2507100100100979297.8%
Gemini 3.5 Flash Lite (Reasoning, Minimal)1001001001008797.3%
GPT-51001001001008697.1%
Claude Opus 5 (Reasoning, Low)100100100929296.7%
DeepSeek V3 (2025-03-24)1001001001008396.7%
Claude Opus 4.71001001001008396.7%
Muse Spark 1.1 (Reasoning, Medium)100100100968395.8%
GPT-5.11001001001007895.6%
Qwen3.7 Max1001001001007795.5%
Claude Sonnet 4.6100100100898795.2%
Claude Opus 4.7 (Reasoning)100100100898093.8%
Writer: Palmyra X5100100100838393.3%
Z.AI GLM 5.2 (Reasoning, High)100100100966993.0%
GPT-5.5 (Reasoning, Low)1001001001006392.5%
GPT-5.6 Terra (Reasoning)1001001001006392.5%
MiniMax M3100100100877291.8%
Cydonia 24B V4.110010088888391.8%
MoonshotAI: Kimi K2.5100100100896991.7%
DeepSeek V4 Flash100100100966391.6%
DeepSeek V4 Pro (Reasoning)100100100886991.5%
GPT-5.4 (Reasoning)1001001001005490.7%
MoonshotAI: Kimi K3 (Reasoning, High)1001001001005490.7%
DeepSeek V4 Pro100100100836990.6%
Qwen 3.5 122B100100100777590.5%
Claude Opus 4.8 (Reasoning)10010097926390.3%
Z.AI GLM 5 Turbo10010096896590.0%
Claude Opus 5 (Reasoning)100100100777289.9%
Z.AI GLM 5.11001001001004889.6%
MiniMax M2.5100100100696987.8%
Claude Opus 4.51009994726385.5%
Claude Opus 4.8 (Reasoning, Low)1009992726385.0%
Gemma 4 31B (Reasoning)1001001001002585.0%
Claude Opus 4.6100100100635483.2%
WizardLM 2 8x22b969182805680.9%
Grok 4.201009592873180.8%
Qwen 3.6 27B100100100772580.3%
GPT-5.4 Nano1009182775179.9%
MoonshotAI: Kimi K2.610010010094078.8%
Claude Haiku 4.51009480724578.1%
GPT-5.4 Mini (Reasoning, Low)10010094544277.8%
Mistral Small 4 (Reasoning)1009996484477.3%
Claude Sonnet 510010010087077.3%
GPT-5.4 Mini (Reasoning)10010010080075.9%
Z.AI GLM 51001008989075.7%
Thinking Machines Inkling (Reasoning)10010010075075.0%
Grok 4.20 (Reasoning)928777774274.9%
Grok 4.5 (Reasoning, Low)1001009975074.7%
GPT-5.4 Nano (Reasoning)1008375694574.6%
Claude Sonnet 41001009475073.8%
Claude Sonnet 5 (Reasoning)10010010063072.5%
GPT-5.510010010063072.5%
GPT-5 Mini948474693871.9%
GPT-4o, Aug. 6th (temp=1)97979463771.6%
Gemini 3.1 Flash Lite (Preview)1001009263070.8%
o4 Mini High1008575751870.6%
Hermes 3 405B1001009656070.3%
Laguna S 2.1100968072069.5%
Muse Spark 1.1 (Reasoning, Minimal)10010010042068.3%
ByteDance Seed 1.610010010025065.0%
Claude Sonnet 5 (Reasoning, Low)10010010010061.9%
Grok 4.394836963061.8%
Gemini 3 Flash (Preview, Reasoning)1001001000060.0%
Gemma 4 26B10010010000