Count dialogue tags

Test: Dialogue tags

Avg. Score
88.5%
Scenarios
1

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1Mistral Small 4100.0%$0.00022.9s100%
2Gemini 3.1 Flash Lite (Preview)100.0%$0.00042.0s100%
3GPT-4o Mini (temp=0)100.0%$0.00023.4s100%
4Gemini 3.1 Flash Lite100.0%$0.00042.0s100%
5Mistral Small 3.2 24B100.0%$0.00014.1s100%
6Gemini 3.5 Flash Lite (Reasoning)100.0%$0.00061.6s100%
7Gemini 3.5 Flash Lite (Reasoning, Minimal)100.0%$0.00061.7s100%
8Gemini 3.1 Flash Lite (Reasoning)100.0%$0.00043.6s100%
9DeepSeek V4 Flash (Reasoning)100.0%$0.00016.3s100%
10DeepSeek V4 Flash100.0%$0.00016.8s100%
11Gemma 3 12B100.0%$0.00007.4s100%
12Gemini 3 Flash (Preview)100.0%$0.00093.2s100%
13Ministral 3 14B100.0%$0.00018.2s100%
14Grok 4.20100.0%$0.00074.9s100%
15Qwen 3 235B A22B Instruct 2507100.0%$0.00018.3s100%
16Mistral Medium 3.1100.0%$0.00066.1s100%
17Mistral Large 3100.0%$0.00057.2s100%
18DeepSeek V3 (2024-12-26)100.0%$0.000410.1s100%
19Gemma 3 27B100.0%$0.000112.5s100%
20Z.AI GLM 5.3 Flash (Reasoning, Low)100.0%$0.000113.6s100%
21Gemini 3.6 Flash (Reasoning, Minimal)100.0%$0.00222.7s100%
22Mistral Medium 3.5 (Reasoning)100.0%$0.00223.2s100%
23DeepSeek V3 (2025-03-24)100.0%$0.000314.6s100%
24Mistral Small 4 (Reasoning)100.0%$0.001011.0s100%
25GPT-4o Mini (temp=1)100.0%$0.000215.5s100%
26Gemini 3.5 Flash (Reasoning, Minimal)100.0%$0.00252.6s100%
27DeepSeek V3.1100.0%$0.000215.4s100%
28Gemma 4 31B100.0%$0.000115.9s100%
29DeepSeek-V2 Chat100.0%$0.000116.1s100%
30Muse Glimmer 30B (Reasoning, Medium)100.0%$0.000912.2s100%
31GPT-4.1100.0%$0.00234.7s100%
32Hermes 3 405B100.0%$0.000017.7s100%
33Gemma 4 26B100.0%$0.000117.2s100%
34Mistral Large 2100.0%$0.00198.1s100%
35GPT-4o, Aug. 6th (temp=0)100.0%$0.00303.8s100%
36GPT-4o, Aug. 6th (temp=1)100.0%$0.00303.7s100%
37Writer: Palmyra X5100.0%$0.00218.8s100%
38Aion 2.0100.0%$0.001116.7s100%
39Muse Spark 1.1 (Reasoning, Minimal)100.0%$0.00376.5s100%
40Z.AI GLM 4.7 Flash100.0%$0.000624.6s100%
41Z.AI GLM 5 Turbo100.0%$0.00339.9s100%
42DeepSeek V4 Pro100.0%$0.000925.1s100%
43GPT-5.6 Terra100.0%$0.00465.1s100%
44Gemini 3.7 Flash (Reasoning, Medium)100.0%$0.00447.3s100%
45Claude Sonnet 5.5 (Reasoning)100.0%$0.00465.9s100%
46Claude Sonnet 4100.0%$0.00447.2s100%
47Claude Sonnet 4.5100.0%$0.00457.3s100%
48DeepSeek V4.1 Flash (Reasoning, High)100.0%$0.001822.1s100%
49Claude Sonnet 5100.0%$0.00439.2s100%
50Claude Sonnet 5 (Reasoning)100.0%$0.00478.7s100%
51GPT-5.4100.0%$0.00489.6s100%
52Gemini 3 Flash (Preview, Reasoning)100.0%$0.004810.1s100%
53Grok 4.7 (Reasoning, High)100.0%$0.004413.6s100%
54GPT-5.1100.0%$0.004912.4s100%
55Kimi K3 (Reasoning, Low)100.0%$0.004714.1s100%
56GPT-6.1 Sol (Reasoning, Medium)100.0%$0.003920.2s100%
57Gemini 3.8 Flash (Reasoning, Medium)100.0%$0.00637.4s100%
58 Kimi K3 (Reasoning, High)100.0%$0.005114.4s100%
59GPT-5.4 (Reasoning, Low)100.0%$0.006010.3s100%
60Aion 3.5 (Reasoning, High)100.0%$0.004918.5s100%
61Muse Spark 1.1 (Reasoning, Medium)100.0%$0.006710.8s100%
62Qwen 3.6 35B100.0%$0.004424.7s100%
63Z.AI GLM 5.2 (Reasoning, High)100.0%$0.005122.4s100%
64Claude Opus 4.5100.0%$0.00778.7s100%
65Gemini 2.5 Flash Lite96.1%$0.00011.4s76%
66Claude Opus 4.6100.0%$0.00799.5s100%
67GPT-5.4 (Reasoning)100.0%$0.007315.2s100%
68Llama 3.1 70B96.1%$0.00033.2s76%
69GPT-5.5100.0%$0.00919.1s100%
70Z.AI GLM 4.596.1%$0.00055.8s76%
71Claude Opus 4.6 (Reasoning)100.0%$0.009110.3s100%
72GPT-5.6 Sol100.0%$0.00977.5s100%
73GPT-6 Luna (Reasoning, High)96.1%$0.00038.3s76%
74Muse Spark 1.2 (Reasoning, Medium)100.0%$0.008813.8s100%
75Z.AI GLM 5.1100.0%$0.006030.6s100%
76Grok 4.5 (Reasoning, Low)100.0%$0.004341.5s100%
77Xiaomi MIMO v2.6 Pro96.1%$0.000312.8s76%
78Mistral Medium 3.596.1%$0.00212.9s76%
79Z.AI GLM 4.7100.0%$0.002751.3s100%
80Claude Opus 4.7 (Reasoning)100.0%$0.0116.8s100%
81Gemma 4 31B (Reasoning)100.0%$0.00041.1m100%
82Xiaomi MIMO v2.5 Pro96.1%$0.001410.3s76%
83Claude Opus 4.7100.0%$0.0117.2s100%
84Qwen 3.8 Flash (Reasoning)100.0%$0.002158.0s100%
85Z.AI GLM 4.6100.0%$0.003351.6s100%
86Kimi K2.5100.0%$0.005340.7s100%
87GPT-5.5 (Reasoning, Low)100.0%$0.01111.1s100%
88Claude Opus 4.8 (Reasoning)100.0%$0.0119.2s100%
89Claude Opus 4.8 (Reasoning, Low)100.0%$0.0119.5s100%
90Claude Opus 5100.0%$0.01210.6s100%
91Gemma 4 26B (Reasoning)100.0%$0.00111.2m100%
92Gemini 3.6 Flash (Reasoning)100.0%$0.0128.9s100%
93Z.AI GLM 5100.0%$0.004950.1s100%
94GPT-5.6 Sol (Reasoning, Medium)100.0%$0.0138.6s100%
95GPT-5.5 (Reasoning, Medium)100.0%$0.01211.2s100%
96Gemini 3.5 Flash (Reasoning)100.0%$0.0137.5s100%
97Qwen 3.7 Flash (Reasoning)96.1%$0.000627.9s76%
98Aion 3.096.1%$0.003512.9s76%
99Xiaomi MIMO v2.592.1%$0.00096.1s69%
100Claude Opus 5 (Reasoning)100.0%$0.01311.5s100%
101Claude Haiku 4.592.1%$0.00164.0s69%
102Claude Sonnet 4.6 (Reasoning)96.1%$0.00548.4s76%
103Claude Opus 5 (Reasoning, Low)100.0%$0.01412.1s100%
104MiniMax M396.1%$0.001134.1s76%
105Muse Spark 1.3 (Reasoning, Medium)100.0%$0.01040.6s100%
106Gemini 2.5 Flash Lite (Reasoning)92.1%$0.000620.1s69%
107GPT-6 Luna (Reasoning, Medium)88.2%$0.00028.5s64%
108Z.AI GLM 5.3 (Reasoning, Max)100.0%$0.009252.8s100%
109Claude Opus 5.5 (Reasoning)100.0%$0.01711.5s100%
110Claude Sonnet 4.692.1%$0.00467.7s69%
111Claude Sonnet 5 (Reasoning, Low)92.1%$0.00458.5s69%
112GPT-5.6 Terra (Reasoning, Medium)92.1%$0.00515.1s69%
113Qwen 3.5 Plus (2026-04-20)100.0%$0.008659.6s100%
114GPT-5.292.1%$0.00469.8s69%
115GPT-5 Nano96.1%$0.002358.8s76%
116GPT-4.1 Mini87.4%$0.00043.3s45%
117Qwen 3.8 Max (Reasoning, XHigh)100.0%$0.01452.6s100%
118Z.AI GLM 5.3 Flash (Reasoning, Max)96.1%$0.00081.4m76%
119Thinking Machines Inkling Small (Reasoning, High)92.1%$0.003845.4s69%
120DeepSeek V4 Pro (Reasoning)100.0%$0.00851.6m100%
121DeepSeek V3.290.0%$0.000213.7s40%
122Claude Opus 4100.0%$0.02315.8s100%
123Cydonia 24B V4.186.1%$0.00026.2s38%
124Cohere Command R+ (Aug. 2024)87.4%$0.00307.0s45%
125Inception Mercury 279.5%$0.00091.9s44%
126Gemini 2.5 Pro96.1%$0.01514.6s76%
127Thinking Machines Inkling (Reasoning)100.0%$0.00921.7m100%
128Gemini 2.5 Flash (Reasoning)87.4%$0.00357.1s45%
129Claude Haiku 5.5 (Reasoning, Low)60.7%$0.00023.8s61%
130Z.AI GLM 4.5 Air83.5%$0.000515.4s44%
131Mistral Large 4.0 (Reasoning)96.1%$0.00661.1m76%
132GPT-5 Mini90.0%$0.002214.1s40%
133Gemini 3.1 Pro (Preview)100.0%$0.02423.5s100%
134Aion 3.5 Mini (Reasoning, High)90.0%$0.001523.1s40%
135Qwen 3.6 27B96.1%$0.01054.4s76%
136Qwen 3.5 27B100.0%$0.0161.3m100%
137o4 Mini High96.1%$0.01434.7s76%
138Laguna XS 2.176.4%$0.00014.2s37%
139Aion 3.0 Mini90.0%$0.001630.7s40%
140ByteDance Seed 1.690.0%$0.002327.7s40%
141GPT-5.4 Mini (Reasoning)78.2%$0.00203.7s37%
142DeepSeek V4 Flash 0731 (Reasoning, High)82.2%$0.000326.4s38%
143DeepSeek V4 Pro 0813 (Reasoning, High)90.0%$0.004920.6s40%
144Grok 4.5 (Reasoning, High)100.0%$0.02353.0s100%
145Qwen 3.5 122B100.0%$0.02256.5s100%
146Grok 4.3 (Reasoning)100.0%$0.0181.4m100%
147Kimi K2.6100.0%$0.0151.6m100%
148GPT-6 Luna74.4%$0.00025.5s31%
149Gemini 2.5 Flash74.4%$0.00092.5s31%
150Qwen 3.6 Flash90.0%$0.006322.6s40%
151Thinking Machines Inkling82.1%$0.001332.4s37%
152Qwen 3.5 Plus (2026-02-15)81.5%$0.000813.3s26%
153GPT-5.6 Luna (Reasoning, Medium)74.4%$0.00273.8s31%
154GPT-6 Sol81.5%$0.00317.4s26%
155Claude Haiku 5.5 (Adaptive)70.9%$0.00056.2s27%
156GPT-5100.0%$0.02751.7s100%
157GPT-4.1 Nano69.7%$0.00012.9s23%
158Grok 4.20 (Reasoning)90.0%$0.006736.2s40%
159Claude Haiku 5.5 (Reasoning, Max)100.0%$0.0152.1m100%
160GPT-6 Sol (Reasoning, Medium)82.7%$0.006216.2s31%
161Grok 4.368.9%$0.00064.0s19%
162GPT-5.4 Mini67.0%$0.00142.2s22%
163Xiaomi MIMO v2.6 Flash69.5%$0.000118.9s23%
164GPT-5.6 Luna67.0%$0.00203.0s22%
165Mistral Large 4.067.0%$0.000711.8s22%
166Hy4 Preview (Reasoning, High)100.0%$0.0192.0m100%
167Qwen 3 32B67.0%$0.000423.9s22%
168Hermes 3 70B64.9%$0.000112.7s17%
169MiniMax M2.586.2%$0.00441.2m39%
170Grok 4.6 (Reasoning, High)100.0%$0.0281.4m100%
171GPT-OSS 120B68.8%$0.000229.8s18%
172Mistral NeMO47.9%$0.00004.0s24%
173Arcee AI: Trinity Mini51.9%$0.00013.9s19%
174Claude Haiku 5.5 (Reasoning, Medium)40.5%$0.00034.4s30%
175Qwen 2.5 72B57.5%$0.00017.5s14%
176o4 Mini72.1%$0.006315.9s22%
177Qwen 3.6 Max Preview100.0%$0.0271.7m100%
178ByteDance Seed 1.6 Flash52.3%$0.00036.9s15%
179Qwen 3.7 Max100.0%$0.0341.2m100%
180Laguna S 2.159.5%$0.000130.9s12%
181Ministral 3 8B37.0%$0.00012.0s12%
182Nemotron 3 Nano66.1%$0.000950.4s10%
183Qwen 3.8 27B (Reasoning, XHigh)90.0%$0.0131.5m40%
184Qwen 3.5 Flash70.0%$0.003051.7s8%
185Ministral 3B40.2%$0.00001.8s2%
186Gemma 3 4B33.8%$0.00003.4s5%
187Ministral 3 3B29.8%$0.00001.5s7%
188GPT-5.4 Mini (Reasoning, Low)31.1%$0.00163.2s7%
189MiniMax M2.786.1%$0.00812.1m38%
190Nemotron 3 Super56.1%$0.000056.2s5%
191ByteDance Seed 2.0 Mini60.0%$0.00111.0m2%
192Qwen 3.5 9B71.4%$0.00121.8m12%
193WizardLM 2 8x22b25.6%$0.000512.6s6%
194Qwen 3.5 397B A17B100.0%$0.0263.1m100%
195Ministral 8B19.9%$0.00002.1s1%
196GPT-5.4 Nano12.9%$0.00042.1s0%
197GPT-5.4 Nano (Reasoning, Low)9.1%$0.00042.0s1%
198GPT-5.4 Nano (Reasoning)8.9%$0.00042.3s0%
199Qwen 3.5 35B70.0%$0.01653.3s8%
200ByteDance Seed 2.0 Lite0.0%$0.002833.4s0%
88.52%

Individual Scenarios

Model # 1 # 2 # 3 # 4 # 5 # 6 # 7 # 8 # 9 # 10 Avg ▼
Claude Opus 5.5 (Reasoning)100100100100100100100100100100100.0%
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100100100100100100.0%
Claude Haiku 5.5 (Reasoning, Max)100100100100 – – – – – – 100.0%
GPT-6.1 Sol (Reasoning, Medium)100100100100100100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100100100100100100.0%
GPT-5.6 Sol (Reasoning, Medium)100100100100100100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100100100100100100.0%
Qwen 3.7 Max100100100100100100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100100100100100100.0%
Grok 4.5 (Reasoning, High)100100100100100100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100100100100100100.0%
Z.AI GLM 5.1100100100100100100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100100100100100100.0%
GPT-5.5 (Reasoning, Medium)100100100100100100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100100100100100100.0%
Kimi K3 (Reasoning, High)100100100100100100100100100100100.0%
Claude Sonnet 5.5 (Reasoning)100100100100100100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100100100100100100.0%
Grok 4.7 (Reasoning, High)100100100100100100100100100100100.0%
Kimi K2.6100100100100100100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100100100100100100.0%
Claude Opus 4.6100100100100100100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100100100100100100.0%
Aion 3.5 (Reasoning, High)100100100100100100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100100100100100100.0%
GPT-5100100100100100100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100100100100100100.0%
Kimi K2.5100100100100100100100100100100100.0%
Thinking Machines Inkling (Reasoning)100100100100100100100100100100100.0%
GPT-5.6 Sol100100100100100100100100100100100.0%
GPT-5.1100100100100100100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100100100100100100.0%
Qwen 3.5 122B100100100100100100100100100100100.0%
Qwen 3.5 27B100100100100100100100100100100100.0%
Claude Opus 5100100100100100100100100100100100.0%
Gemini 3 Flash (Preview, Reasoning)100100100100100100100100100100100.0%
Claude Opus 4.7100100100100100100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100100100100100100.0%
Gemma 4 31B (Reasoning)100100100100100100100100100100100.0%
Claude Opus 4.5100100100100100100100100100100100.0%
Z.AI GLM 5100100100100100100100100100100100.0%
GPT-5.5100100100100100100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100100100100100100.0%
Gemma 4 26B (Reasoning)100100100100100100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100100100100100100100100100.0%
GPT-5.6 Terra100100100100100100100100100100100.0%
DeepSeek V4 Flash (Reasoning)100100100100100100100100100100100.0%
Z.AI GLM 4.7100100100100100100100100100100100.0%
Qwen 3.6 35B100100100100100100100100100100100.0%
Z.AI GLM 4.6100100100100100100100100100100100.0%
Claude Sonnet 4100100100100100100100100100100100.0%
Claude Sonnet 4.5100100100100100100100100100100100.0%
Claude Sonnet 5100100100100100100100100100100100.0%
Claude Opus 4100100100100100100100100100100100.0%
GPT-4.1100100100100100100100100100100100.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100100100100100100100.0%
Aion 2.0100100100100100100100100100100100.0%
Gemini 3.1 Flash Lite (Reasoning)100100100100100100100100100100100.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100100100100100100100100100.0%
Gemini 3 Flash (Preview)100100100100100100100100100100100.0%
Gemini 3.1 Flash Lite (Preview)100100100100100100100100100100100.0%
Mistral Medium 3.5 (Reasoning)100100100100100100100100100100100.0%
Gemma 4 31B100100100100100100100100100100100.0%
Gemini 3.1 Flash Lite100100100100100100100100100100100.0%
Gemma 4 26B100100100100100100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100100100100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning)100100100100100100100100100100100.0%
GPT-5.4100100100100100100100100100100100.0%
Mistral Large 3100100100100100100100100100100100.0%
DeepSeek-V2 Chat100100100100100100100100100100100.0%
DeepSeek V3 (2024-12-26)100100100100100100100100100100100.0%
DeepSeek V3.1100100100100100100100100100100100.0%
Z.AI GLM 4.7 Flash100100100100100100100100100100100.0%
GPT-4o, Aug. 6th (temp=0)100100100100100100100100100100100.0%
DeepSeek V4 Pro100100100100100100100100100100100.0%
DeepSeek V4 Flash100100100100100100100100100100100.0%
Mistral Large 2100100100100100100100100100100100.0%
GPT-4o, Aug. 6th (temp=1)100100100100100100100100100100100.0%
Grok 4.20100100100100100100100100100100100.0%
Hermes 3 405B100100100100100100100100100100100.0%
DeepSeek V3 (2025-03-24)100100100100100100100100100100100.0%
Mistral Small 4 (Reasoning)100100100100100100100100100100100.0%
Writer: Palmyra X5100100100100100100100100100100100.0%
Qwen 3 235B A22B Instruct 2507100100100100100100100100100100100.0%
GPT-4o Mini (temp=1)100100100100100100100100100100100.0%
Mistral Small 3.2 24B100100100100100100100100100100100.0%
GPT-4o Mini (temp=0)100100100100100100100100100100100.0%
Mistral Medium 3.1100100100100100100100100100100100.0%
Gemma 3 12B100100100100100100100100100100100.0%
Gemma 3 27B100100100100100100100100100100100.0%
Mistral Small 4100100100100100100100100100100100.0%
Ministral 3 14B100100100100100100100100100100100.0%
Aion 3.01001001001001001001001001006196.1%
Qwen 3.7 Flash (Reasoning)1001001001001001001001001006196.1%
Z.AI GLM 5.3 Flash (Reasoning, Max)1001001001001001001001001006196.1%
GPT-6 Luna (Reasoning, High)1001001001001001001001001006196.1%
Claude Sonnet 4.6 (Reasoning)1001001001001001001001001006196.1%
Mistral Large 4.0 (Reasoning)1001001001001001001001001006196.1%
Xiaomi MIMO v2.6 Pro1001001001001001001001001006196.1%
MiniMax M31001001001001001001001001006196.1%
o4 Mini High1001001001001001001001001006196.1%
Gemini 2.5 Pro1001001001001001001001001006196.1%
Qwen 3.6 27B1001001001001001001001001006196.1%
Xiaomi MIMO v2.5 Pro1001001001001001001001001006196.1%
Z.AI GLM 4.51001001001001001001001001006196.1%
Mistral Medium 3.51001001001001001001001001006196.1%
GPT-5 Nano1001001001001001001001001006196.1%
Gemini 2.5 Flash Lite1001001001001001001001001006196.1%
Llama 3.1 70B1001001001001001001001001006196.1%
GPT-5.6 Terra (Reasoning, Medium)100100100100100100100100616192.1%
Claude Sonnet 4.6100100100100100100100100616192.1%
Claude Sonnet 5 (Reasoning, Low)100100100100100100100100616192.1%
GPT-5.2100100100100100100100100616192.1%
Thinking Machines Inkling Small (Reasoning, High)100100100100100100100100616192.1%
Xiaomi MIMO v2.5100100100100100100100100616192.1%
Claude Haiku 4.5100100100100100100100100616192.1%
Gemini 2.5 Flash Lite (Reasoning)100100100100100100100100616192.1%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100100100100090.0%
Aion 3.5 Mini (Reasoning, High)100100100100100100100100100090.0%
GPT-5 Mini100100100100100100100100100090.0%
Grok 4.20 (Reasoning)100100100100100100100100100090.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100100100100100100090.0%
ByteDance Seed 1.6100100100100100100100100100090.0%
Qwen 3.6 Flash100100100100100100100100100090.0%
Aion 3.0 Mini100100100100100100100100100090.0%
DeepSeek V3.2100100100100100100100100100090.0%
GPT-6 Luna (Reasoning, Medium)10010010010010010010061616188.2%
Gemini 2.5 Flash (Reasoning)100100100100100100100100611487.4%
GPT-4.1 Mini100100100100100100100100611487.4%
Cohere Command R+ (Aug. 2024)100100100100100100100100611487.4%
MiniMax M2.510010010010010010010010061186.2%
MiniMax M2.710010010010010010010010061086.1%
Cydonia 24B V4.110010010010010010010010061086.1%
Z.AI GLM 4.5 Air10010010010010010010061611483.5%
GPT-6 Sol (Reasoning, Medium)100100100100100100100100141482.7%
DeepSeek V4 Flash 0731 (Reasoning, High)1001001001001001001006161182.2%
Thinking Machines Inkling1001001001001001001006161082.1%
GPT-6 Sol10010010010010010010010014181.5%
Qwen 3.5 Plus (2026-02-15)10010010010010010010010014181.5%
Inception Mercury 21001001001001001006161611479.5%
GPT-5.4 Mini (Reasoning)100100100100100100616161078.2%
Laguna XS 2.110010010010061616161616176.4%
GPT-5.6 Luna (Reasoning, Medium)10010010010010061616161174.4%
GPT-6 Luna10010010010010061616161174.4%
Gemini 2.5 Flash10010010010010061616161174.4%
o4 Mini10010010010010010061610072.1%
Qwen 3.5 9B100100100100100100100140071.4%
Claude Haiku 5.5 (Adaptive)100100100100100616161141470.9%
Qwen 3.5 35B10010010010010010010000070.0%
Qwen 3.5 Flash10010010010010010010000070.0%
GPT-4.1 Nano10010010010010061616114169.7%
Xiaomi MIMO v2.6 Flash10010010010010061616114069.5%
Grok 4.3100100100100100100611414168.9%
GPT-OSS 120B100100100100100100611414068.8%
GPT-5.6 Luna10010010010061616161141467.0%
Mistral Large 4.010010010010061616161141467.0%
GPT-5.4 Mini10010010010061616161141467.0%
Qwen 3 32B10010010010061616161141467.0%
Nemotron 3 Nano1001001001001001006100066.1%
Hermes 3 70B10010010010010061611414164.9%
Claude Haiku 5.5 (Reasoning, Low)616161 – – – – – – – 60.7%
ByteDance Seed 2.0 Mini100100100100100100000060.0%
Laguna S 2.1100100100100616161140059.5%
Qwen 2.5 72B10010010010061611414141457.5%
Nemotron 3 Super10010010010010061000056.1%
ByteDance Seed 1.6 Flash100100100616161141414052.3%
Arcee AI: Trinity Mini1001006161616161141151.9%
Mistral NeMO100616161616161141047.9%
Claude Haiku 5.5 (Reasoning, Medium)616161616161141414040.5%
Ministral 3B1001001006114141410040.2%
Ministral 3 8B10061616161141400037.0%
Gemma 3 4B100616161141414141133.8%
GPT-5.4 Mini (Reasoning, Low)616161611414141414131.1%
Ministral 3 3B61616161141414141029.8%
WizardLM 2 8x22b1006114141414141414125.6%
Ministral 8B6161611411100019.9%
GPT-5.4 Nano1001414110000012.9%
GPT-5.4 Nano (Reasoning, Low)61141411100009.1%
GPT-5.4 Nano (Reasoning)61141410000008.9%
ByteDance Seed 2.0 Lite00000000000.0%