Contains a count of nouns

Test: Language Comprehension

Avg. Score
89.3%
Scenarios
2

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1Ministral 3 3B100.0%$0.0000855ms100%
2Mistral NeMO100.0%$0.0000870ms100%
3GPT-5.4 Nano100.0%$0.0001874ms100%
4Ministral 3 8B100.0%$0.00001.1s100%
5Mistral Small 4100.0%$0.00011.1s100%
6GPT-6 Luna100.0%$0.00001.4s100%
7Ministral 3 14B100.0%$0.00001.4s100%
8GPT-4.1 Nano100.0%$0.00001.9s100%
9GPT-4.1 Mini100.0%$0.00011.8s100%
10Cydonia 24B V4.1100.0%$0.00012.0s100%
11GPT-5.6 Luna100.0%$0.0003955ms100%
12Mistral Small 3.2 24B100.0%$0.00002.5s100%
13Mistral Medium 3.1100.0%$0.00022.0s100%
14GPT-6 Luna (Reasoning, Medium)100.0%$0.00013.2s100%
15Hermes 3 70B100.0%$0.00013.5s100%
16Claude Haiku 5.5 (Adaptive)100.0%$0.00022.8s100%
17Qwen 2.5 72B100.0%$0.00013.7s100%
18GPT-4o, Aug. 6th (temp=0)100.0%$0.00051.5s100%
19GPT-6 Luna (Reasoning, High)100.0%$0.00013.8s100%
20GPT-4o, Aug. 6th (temp=1)100.0%$0.00051.3s100%
21GPT-6 Sol100.0%$0.00042.3s100%
22Mistral Large 3100.0%$0.00033.1s100%
23Claude Haiku 4.5100.0%$0.00051.8s100%
24Claude Haiku 5.5 (Reasoning, Medium)100.0%$0.00023.8s100%
25Gemma 3 27B100.0%$0.00004.8s100%
26Mistral Large 4.0100.0%$0.00023.8s100%
27Claude Haiku 5.5 (Reasoning, Low)100.0%$0.00024.2s100%
28Mistral Medium 3.5100.0%$0.00081.0s100%
29Mistral Medium 3.5 (Reasoning)100.0%$0.00081.1s100%
30Qwen 3.5 Plus (2026-02-15)100.0%$0.00034.2s100%
31GPT-5.4 Mini (Reasoning)100.0%$0.00062.7s100%
32DeepSeek-V2 Chat100.0%$0.00005.8s100%
33Mistral Large 2100.0%$0.00062.6s100%
34DeepSeek V3 (2024-12-26)100.0%$0.00025.1s100%
35DeepSeek V3 (2025-03-24)100.0%$0.00025.3s100%
36DeepSeek V4.1 Flash (Reasoning, High)100.0%$0.00044.1s100%
37GPT-5.6 Sol100.0%$0.00111.6s100%
38GPT-6.1 Sol (Reasoning, Medium)100.0%$0.00084.0s100%
39WizardLM 2 8x22b100.0%$0.00037.1s100%
40GPT-6 Sol (Reasoning, Medium)100.0%$0.00103.5s100%
41Claude Sonnet 4.6100.0%$0.00162.8s100%
42Qwen 3 32B100.0%$0.000210.8s100%
43Hermes 3 405B100.0%$0.000012.2s100%
44Z.AI GLM 5.3 Flash (Reasoning, Low)100.0%$0.000112.3s100%
45GPT-OSS 120B100.0%$0.000112.5s100%
46Muse Glimmer 30B (Reasoning, Medium)100.0%$0.000710.3s100%
47Xiaomi MIMO v2.6 Flash100.0%$0.000113.8s100%
48MiniMax M2.5100.0%$0.000710.3s100%
49Qwen 3.6 Flash100.0%$0.00156.1s100%
50Gemini 3.8 Flash (Reasoning, Medium)100.0%$0.00213.3s100%
51MiniMax M2.7100.0%$0.000813.3s100%
52GPT-5 Mini100.0%$0.001310.3s100%
53Aion 3.5 (Reasoning, High)100.0%$0.00197.4s100%
54Claude Opus 4.5100.0%$0.00263.6s100%
55Claude Sonnet 5100.0%$0.00245.3s100%
56Aion 2.0100.0%$0.001013.9s100%
57Z.AI GLM 4.5100.0%$0.001112.9s100%
58Gemini 3.7 Flash (Reasoning, Medium)100.0%$0.00179.6s100%
59Claude Opus 4.6100.0%$0.00273.8s100%
60GPT-5.5 (Reasoning, Low)100.0%$0.00283.9s100%
61GPT-5.6 Sol (Reasoning, Medium)100.0%$0.00303.1s100%
62Aion 3.0 Mini100.0%$0.000915.5s100%
63DeepSeek V4 Flash (Reasoning)100.0%$0.000120.7s100%
64MiniMax M3100.0%$0.000618.3s100%
65Aion 3.5 Mini (Reasoning, High)100.0%$0.000917.1s100%
66Z.AI GLM 5.3 Flash (Reasoning, Max)100.0%$0.000221.6s100%
67GPT-5.5 (Reasoning, Medium)100.0%$0.00344.6s100%
68Kimi K2.5100.0%$0.002012.7s100%
69ByteDance Seed 1.6100.0%$0.001417.1s100%
70Qwen 3.5 Plus (2026-04-20)100.0%$0.002013.8s100%
71Nemotron 3 Super100.0%$0.000026.0s100%
72Z.AI GLM 5.2 (Reasoning, High)100.0%$0.002512.3s100%
73Kimi K3 (Reasoning, Low)100.0%$0.00328.6s100%
74Claude Haiku 5.5 (Reasoning, Max)100.0%$0.001818.0s100%
75Z.AI GLM 5 Turbo100.0%$0.003310.0s100%
76Muse Spark 1.2 (Reasoning, Medium)100.0%$0.00416.7s100%
77Mistral Large 4.0 (Reasoning)100.0%$0.001820.5s100%
78Claude Sonnet 5 (Reasoning)100.0%$0.00446.6s100%
79Qwen 3.8 27B (Reasoning, XHigh)100.0%$0.002418.6s100%
80Claude Sonnet 5 (Reasoning, Low)100.0%$0.00447.3s100%
81Grok 4.5 (Reasoning, High)100.0%$0.00429.0s100%
82Qwen 3.8 Flash (Reasoning)100.0%$0.000729.8s100%
83 Kimi K3 (Reasoning, High)100.0%$0.004110.2s100%
84ByteDance Seed 2.0 Lite100.0%$0.001923.3s100%
85Gemini 3.6 Flash (Reasoning)100.0%$0.00534.1s100%
86Claude Opus 4.7 (Reasoning)100.0%$0.00543.4s100%
87Claude Sonnet 4.6 (Reasoning)100.0%$0.00506.8s100%
88Thinking Machines Inkling (Reasoning)100.0%$0.002919.6s100%
89Qwen 3.5 35B100.0%$0.004013.7s100%
90Qwen 3.5 122B100.0%$0.004611.2s100%
91Qwen 3.5 27B100.0%$0.003717.8s100%
92Claude Opus 4.6 (Reasoning)100.0%$0.00605.7s100%
93Qwen 3.8 Max (Reasoning, XHigh)100.0%$0.004317.9s100%
94Qwen 3.5 Flash100.0%$0.000938.0s100%
95Claude Opus 5.5 (Reasoning)100.0%$0.00695.5s100%
96Z.AI GLM 4.6100.0%$0.002341.1s100%
97Z.AI GLM 5.3 (Reasoning, Max)100.0%$0.004430.6s100%
98Kimi K2.6100.0%$0.003740.1s100%
99Claude Opus 5100.0%$0.00947.7s100%
100Claude Opus 4100.0%$0.00959.3s100%
101Gemini 3.1 Flash Lite (Reasoning)90.0%$0.0001904ms40%
102Gemini 3.1 Flash Lite (Preview)90.0%$0.0001975ms40%
103Inception Mercury 290.0%$0.0002663ms40%
104GPT-5.4 Mini90.0%$0.0002746ms40%
105Gemma 3 12B90.0%$0.00002.8s40%
106Qwen 3.6 Max Preview100.0%$0.007028.7s100%
107Grok 4.2090.0%$0.00041.8s40%
108Gemini 3 Flash (Preview)90.0%$0.00051.7s40%
109GPT-4.190.0%$0.00061.9s40%
110DeepSeek V4 Pro90.0%$0.00024.4s40%
111Qwen 3 235B A22B Instruct 250790.0%$0.00015.4s40%
112Gemini 3.6 Flash (Reasoning, Minimal)90.0%$0.00081.1s40%
113Qwen 3.7 Flash (Reasoning)90.0%$0.00015.8s40%
114Laguna S 2.1100.0%$0.00011.2m100%
115GPT-5.6 Luna (Reasoning, Medium)90.0%$0.00082.6s40%
116DeepSeek V4 Pro (Reasoning)100.0%$0.00251.0m100%
117Llama 3.1 70B90.0%$0.00018.3s40%
118DeepSeek V3.190.0%$0.00018.5s40%
119Xiaomi MIMO v2.5 Pro90.0%$0.00085.5s40%
120GPT-5.6 Terra (Reasoning, Medium)90.0%$0.00132.8s40%
121GPT-5.190.0%$0.00124.3s40%
122Gemini 3.5 Flash (Reasoning, Minimal)90.0%$0.00171.7s40%
123Gemini 3 Flash (Preview, Reasoning)90.0%$0.00153.5s40%
124Claude Sonnet 4.590.0%$0.00153.2s40%
125Qwen 3.7 Max100.0%$0.009722.2s100%
126Writer: Palmyra X590.0%$0.00088.3s40%
127GPT-5.4 (Reasoning)90.0%$0.00194.0s40%
128Muse Spark 1.1 (Reasoning, Minimal)90.0%$0.00274.7s40%
129Z.AI GLM 4.7 Flash90.0%$0.000419.9s40%
130Z.AI GLM 4.5 Air90.0%$0.000619.3s40%
131Gemma 4 26B (Reasoning)90.0%$0.000223.7s40%
132DeepSeek V4 Flash90.0%$0.000124.4s40%
133Grok 4.5 (Reasoning, Low)90.0%$0.00328.7s40%
134Grok 4.20 (Reasoning)90.0%$0.002812.7s40%
135Grok 4.7 (Reasoning, High)90.0%$0.00369.1s40%
136Gemini 3.1 Flash Lite80.0%$0.0001832ms20%
137Muse Spark 1.1 (Reasoning, Medium)90.0%$0.00416.8s40%
138Claude Sonnet 5.5 (Reasoning)90.0%$0.00454.5s40%
139GPT-5.4 Nano (Reasoning, Low)80.0%$0.00011.6s20%
140Arcee AI: Trinity Mini80.0%$0.00013.0s20%
141Grok 4.3 (Reasoning)90.0%$0.002518.2s40%
142Grok 4.380.0%$0.00032.3s20%
143Gemma 4 26B80.0%$0.00005.0s20%
144Qwen 3.5 397B A17B100.0%$0.007159.1s100%
145Claude Opus 5 (Reasoning, Low)100.0%$0.01610.4s100%
146Thinking Machines Inkling Small (Reasoning, High)90.0%$0.001428.3s40%
147Claude Opus 5 (Reasoning)100.0%$0.01610.4s100%
148GPT-5.4 Nano (Reasoning)80.0%$0.00027.4s20%
149Thinking Machines Inkling80.0%$0.00055.5s20%
150GPT-5.280.0%$0.00113.3s20%
151Xiaomi MIMO v2.6 Pro80.0%$0.00038.7s20%
152Claude Sonnet 480.0%$0.00152.7s20%
153GPT-5.580.0%$0.00172.3s20%
154Gemini 3.5 Flash (Reasoning)90.0%$0.00674.0s40%
155Z.AI GLM 590.0%$0.003226.3s40%
156Qwen 3.6 35B80.0%$0.00148.5s20%
157Grok 4.6 (Reasoning, High)90.0%$0.005315.1s40%
158Nemotron 3 Nano80.0%$0.000216.7s20%
159Gemini 2.5 Flash Lite70.0%$0.0000568ms8%
160Gemini 2.5 Flash70.0%$0.0001646ms8%
161Mistral Small 4 (Reasoning)70.0%$0.00022.7s8%
162GPT-5.4 Mini (Reasoning, Low)70.0%$0.00032.8s8%
163GPT-5.6 Terra70.0%$0.00061.0s8%
164Claude Opus 4.8 (Reasoning, Low)90.0%$0.00865.8s40%
165Qwen 3.6 27B80.0%$0.002613.7s20%
166Xiaomi MIMO v2.570.0%$0.00074.6s8%
167GPT-5.4 (Reasoning, Low)70.0%$0.00123.0s8%
168GPT-580.0%$0.00399.3s20%
169Claude Opus 4.8 (Reasoning)90.0%$0.00966.3s40%
170DeepSeek V4 Flash 0731 (Reasoning, High)70.0%$0.000112.3s8%
171Gemini 2.5 Flash (Reasoning)70.0%$0.00184.1s8%
172Ministral 8B60.0%$0.0000733ms2%
173Gemma 3 4B60.0%$0.00001.1s2%
174GPT-4o Mini (temp=1)60.0%$0.00001.0s2%
175Gemini 3.5 Flash Lite (Reasoning, Minimal)60.0%$0.0001601ms2%
176Gemini 3.5 Flash Lite (Reasoning)60.0%$0.0001637ms2%
177Aion 3.070.0%$0.00217.2s8%
178DeepSeek V3.260.0%$0.00015.5s2%
179Z.AI GLM 5.180.0%$0.003821.7s20%
180Gemini 2.5 Pro80.0%$0.00686.9s20%
181Muse Spark 1.3 (Reasoning, Medium)80.0%$0.005120.5s20%
182GPT-4o Mini (temp=0)50.0%$0.00001.2s0%
183Gemini 2.5 Flash Lite (Reasoning)50.0%$0.00033.6s0%
184GPT-5.450.0%$0.00081.1s0%
185Cohere Command R+ (Aug. 2024)50.0%$0.00081.7s0%
186Claude Opus 4.770.0%$0.00544.2s8%
187ByteDance Seed 2.0 Mini80.0%$0.000852.8s20%
188o4 Mini50.0%$0.00124.3s0%
189Gemini 3.1 Pro (Preview)90.0%$0.01314.4s40%
190o4 Mini High50.0%$0.00195.5s0%
191ByteDance Seed 1.6 Flash40.0%$0.00025.1s0%
192Qwen 3.5 9B80.0%$0.00071.1m20%
193Gemma 4 31B (Reasoning)50.0%$0.000117.6s0%
194Laguna XS 2.130.0%$0.00014.4s0%
195GPT-5 Nano50.0%$0.000722.4s0%
196Z.AI GLM 4.760.0%$0.002329.0s2%
197Ministral 3B20.0%$0.0000591ms0%
198Hy4 Preview (Reasoning, High)100.0%$0.0151.6m100%
199Gemma 4 31B10.0%$0.00006.6s0%
200DeepSeek V4 Pro 0813 (Reasoning, High)80.0%$0.0141.2m20%
89.30%

Individual Scenarios

Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Claude Opus 5.5 (Reasoning)100100100100100100.0%
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Claude Haiku 5.5 (Reasoning, Max)100100 – – – 100.0%
GPT-6.1 Sol (Reasoning, Medium)100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning, Medium)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, High)100100100100100100.0%
GPT-6 Luna (Reasoning, High)100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning, Medium)100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Kimi K3 (Reasoning, High)100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
GPT-6 Sol (Reasoning, Medium)100100100100100100.0%
Kimi K2.6100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-6 Luna (Reasoning, Medium)100100100100100100.0%
Aion 3.5 Mini (Reasoning, High)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Mistral Large 4.0 (Reasoning)100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
Aion 3.5 (Reasoning, High)100100100100100100.0%
GPT-5 Mini100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Kimi K2.5100100100100100100.0%
Thinking Machines Inkling (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
MiniMax M3100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
Qwen 3.5 122B100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100.0%
GPT-6 Sol100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Claude Opus 4.5100100100100100100.0%
ByteDance Seed 1.6100100100100100100.0%
Claude Haiku 5.5 (Adaptive)100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100100100100.0%
DeepSeek V4 Flash (Reasoning)100100100100100100.0%
Claude Haiku 5.5 (Reasoning, Low)100100100 – – 100.0%
Z.AI GLM 4.6100100100100100100.0%
Thinking Machines Inkling Small (Reasoning, High)100100100100100100.0%
Claude Sonnet 5100100100100100100.0%
Xiaomi MIMO v2.6 Flash100100100100100100.0%
Claude Opus 4100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
MiniMax M2.5100100100100100100.0%
Aion 2.0100100100100100100.0%
MiniMax M2.7100100100100100100.0%
Qwen 3.5 Plus (2026-02-15)100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
Mistral Medium 3.5 (Reasoning)100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Z.AI GLM 4.5100100100100100100.0%
GPT-OSS 120B100100100100100100.0%
Mistral Large 4.0100100100100100100.0%
Mistral Medium 3.5100100100100100100.0%
Mistral Large 3100100100100100100.0%
ByteDance Seed 2.0 Lite100100100100100100.0%
Claude Haiku 5.5 (Reasoning, Medium)100100100100100100.0%
DeepSeek-V2 Chat100100100100100100.0%
GPT-6 Luna100100100100100100.0%
Aion 3.0 Mini100100100100100100.0%
Claude Haiku 4.5100100100100100100.0%
DeepSeek V3 (2024-12-26)100100100100100100.0%
GPT-4o, Aug. 6th (temp=0)100100100100100100.0%
Nemotron 3 Super100100100100100100.0%
Mistral Large 2100100100100100100.0%
GPT-4.1 Mini100100100100100100.0%
GPT-4o, Aug. 6th (temp=1)100100100100100100.0%
Hermes 3 405B100100100100100100.0%
Laguna S 2.1100100100100100100.0%
DeepSeek V3 (2025-03-24)100100100100100100.0%
Qwen 3 32B100100100100100100.0%
Writer: Palmyra X5100100100100100100.0%
Mistral Small 3.2 24B100100100100100100.0%
Mistral Medium 3.1100100100100100100.0%
Gemma 3 27B100100100100100100.0%
Mistral Small 4100100100100100100.0%
Qwen 2.5 72B100100100100100100.0%
Cydonia 24B V4.1100100100100100100.0%
GPT-5.4 Nano100100100100100100.0%
WizardLM 2 8x22b100100100100100100.0%
Ministral 3 14B100100100100100100.0%
Ministral 3 8B100100100100100100.0%
GPT-4.1 Nano100100100100100100.0%
Hermes 3 70B100100100100100100.0%
Ministral 3 3B100100100100100100.0%
Mistral NeMO100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100080.0%
GPT-5.4 (Reasoning)100100100100080.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100080.0%
Gemini 3.5 Flash (Reasoning)100100100100080.0%
Claude Sonnet 5.5 (Reasoning)100100100100080.0%
Grok 4.7 (Reasoning, High)100100100100080.0%
GPT-5.6 Terra (Reasoning, Medium)100100100100080.0%
Claude Opus 4.8 (Reasoning)100100100100080.0%
Claude Opus 4.8 (Reasoning, Low)100100100100080.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100080.0%
Grok 4.3 (Reasoning)100100100100080.0%
Grok 4.5 (Reasoning, Low)100100100100080.0%
Grok 4.20 (Reasoning)100100100100080.0%
GPT-5.1100100100100080.0%
GPT-5.6 Luna (Reasoning, Medium)100100100100080.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100080.0%
Gemini 3 Flash (Preview, Reasoning)100100100100080.0%
Z.AI GLM 5100100100100080.0%
Gemma 4 26B (Reasoning)100100100100080.0%
Qwen 3.7 Flash (Reasoning)100100100100080.0%
Claude Sonnet 4.5100100100100080.0%
GPT-4.1100100100100080.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100080.0%
Xiaomi MIMO v2.5 Pro100100100100080.0%
Gemini 3.1 Flash Lite (Reasoning)100100100100080.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100100080.0%
Gemini 3 Flash (Preview)100100100100080.0%
Gemini 3.1 Flash Lite (Preview)100100100100080.0%
Qwen 3.5 9B100100100100080.0%
GPT-5.4 Mini (Reasoning, Low)100100100100080.0%
DeepSeek V3.1100100100100080.0%
Z.AI GLM 4.7 Flash100100100100080.0%
DeepSeek V4 Pro100100100100080.0%
DeepSeek V4 Flash100100100100080.0%
Inception Mercury 2100100100100080.0%
Grok 4.20100100100100080.0%
Z.AI GLM 4.5 Air100100100100080.0%
GPT-5.4 Mini100100100100080.0%
Qwen 3 235B A22B Instruct 2507100100100100080.0%
Grok 4.3100100100100080.0%
Llama 3.1 70B100100100100080.0%
Gemma 3 12B100100100100080.0%
Ministral 8B100100100100080.0%
Muse Spark 1.3 (Reasoning, Medium)1001001000060.0%
Z.AI GLM 5.11001001000060.0%
Xiaomi MIMO v2.6 Pro1001001000060.0%
GPT-51001001000060.0%
GPT-5.21001001000060.0%
GPT-5.51001001000060.0%
Gemini 2.5 Pro1001001000060.0%
Qwen 3.6 27B1001001000060.0%
Qwen 3.6 35B1001001000060.0%
Claude Sonnet 41001001000060.0%
ByteDance Seed 2.0 Mini1001001000060.0%
Gemini 3.1 Flash Lite1001001000060.0%
Gemma 4 26B1001001000060.0%
GPT-5.4 Nano (Reasoning)1001001000060.0%
GPT-5.4 Nano (Reasoning, Low)1001001000060.0%
Nemotron 3 Nano1001001000060.0%
Thinking Machines Inkling1001001000060.0%
Arcee AI: Trinity Mini1001001000060.0%
GPT-5.4 (Reasoning, Low)10010000040.0%
Claude Opus 4.710010000040.0%
Aion 3.010010000040.0%
GPT-5.6 Terra10010000040.0%
DeepSeek V4 Flash 0731 (Reasoning, High)10010000040.0%
Z.AI GLM 4.710010000040.0%
Gemini 2.5 Flash (Reasoning)10010000040.0%
Xiaomi MIMO v2.510010000040.0%
Gemini 2.5 Flash10010000040.0%
Gemini 2.5 Flash Lite10010000040.0%
Mistral Small 4 (Reasoning)10010000040.0%
Gemma 4 31B (Reasoning)100000020.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100000020.0%
Gemini 3.5 Flash Lite (Reasoning)100000020.0%
DeepSeek V3.2100000020.0%
GPT-4o Mini (temp=1)100000020.0%
Laguna XS 2.1100000020.0%
Gemma 3 4B100000020.0%
Ministral 3B100000020.0%
o4 Mini High000000.0%
o4 Mini000000.0%
Gemma 4 31B000000.0%
GPT-5.4000000.0%
Gemini 2.5 Flash Lite (Reasoning)000000.0%
GPT-5 Nano000000.0%
GPT-4o Mini (temp=0)000000.0%
ByteDance Seed 1.6 Flash000000.0%
Cohere Command R+ (Aug. 2024)000000.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Claude Opus 5.5 (Reasoning)100100100100100100.0%
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Claude Haiku 5.5 (Reasoning, Max)100 – – – – 100.0%
GPT-6.1 Sol (Reasoning, Medium)100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning, Medium)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, High)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-6 Luna (Reasoning, High)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning, Medium)100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Kimi K3 (Reasoning, High)100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100.0%
Claude Sonnet 5.5 (Reasoning)100100100100100100.0%
GPT-6 Sol (Reasoning, Medium)100100100100100100.0%
Grok 4.7 (Reasoning, High)100100100100100100.0%
Kimi K2.6100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning, Medium)100100100100100100.0%
GPT-6 Luna (Reasoning, Medium)100100100100100100.0%
Aion 3.5 Mini (Reasoning, High)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Mistral Large 4.0 (Reasoning)100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
Aion 3.5 (Reasoning, High)100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100.0%
Xiaomi MIMO v2.6 Pro100100100100100100.0%
GPT-5100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
GPT-5 Mini100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100.0%
Kimi K2.5100100100100100100.0%
Thinking Machines Inkling (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
GPT-5.1100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
GPT-5.6 Luna (Reasoning, Medium)100100100100100100.0%
MiniMax M3100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
Qwen 3.5 122B100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100.0%
GPT-6 Sol100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
Gemini 3 Flash (Preview, Reasoning)100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Claude Opus 4.5100100100100100100.0%
Z.AI GLM 5100100100100100100.0%
ByteDance Seed 1.6100100100100100100.0%
GPT-5.2100100100100100100.0%
Claude Haiku 5.5 (Adaptive)100100100100100100.0%
GPT-5.5100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100.0%
Gemma 4 26B (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
Aion 3.0100100100100100100.0%
o4 Mini High100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100100100100.0%
Qwen 3.7 Flash (Reasoning)100100100100100100.0%
Gemini 2.5 Pro100100100100100100.0%
Qwen 3.6 27B100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
DeepSeek V4 Flash (Reasoning)100100100100100100.0%
DeepSeek V4 Flash 0731 (Reasoning, High)100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Claude Haiku 5.5 (Reasoning, Low)100100 – – – 100.0%
Z.AI GLM 4.6100100100100100100.0%
Claude Sonnet 4100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Claude Sonnet 5100100100100100100.0%
Xiaomi MIMO v2.6 Flash100100100100100100.0%
Claude Opus 4100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
GPT-4.1100100100100100100.0%
MiniMax M2.5100100100100100100.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100100.0%
Aion 2.0100100100100100100.0%
o4 Mini100100100100100100.0%
MiniMax M2.7100100100100100100.0%
Qwen 3.5 Plus (2026-02-15)100100100100100100.0%
Xiaomi MIMO v2.5 Pro100100100100100100.0%
Gemini 3.1 Flash Lite (Reasoning)100100100100100100.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100100100100.0%
ByteDance Seed 2.0 Mini100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
Gemini 3 Flash (Preview)100100100100100100.0%
Gemini 3.1 Flash Lite (Preview)100100100100100100.0%
Mistral Medium 3.5 (Reasoning)100100100100100100.0%
Gemini 3.1 Flash Lite100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Z.AI GLM 4.5100100100100100100.0%
Gemma 4 26B100100100100100100.0%
GPT-OSS 120B100100100100100100.0%
Mistral Large 4.0100100100100100100.0%
Mistral Medium 3.5100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning)100100100100100100.0%
GPT-5.4100100100100100100.0%
Mistral Large 3100100100100100100.0%
ByteDance Seed 2.0 Lite100100100100100100.0%
Claude Haiku 5.5 (Reasoning, Medium)100100100100100100.0%
Gemini 2.5 Flash (Reasoning)100100100100100100.0%
DeepSeek-V2 Chat100100100100100100.0%
Xiaomi MIMO v2.5100100100100100100.0%
GPT-6 Luna100100100100100100.0%
Aion 3.0 Mini100100100100100100.0%
Claude Haiku 4.5100100100100100100.0%
Gemini 2.5 Flash Lite (Reasoning)100100100100100100.0%
DeepSeek V3 (2024-12-26)100100100100100100.0%
DeepSeek V3.1100100100100100100.0%
DeepSeek V3.2100100100100100100.0%
Z.AI GLM 4.7 Flash100100100100100100.0%
GPT-4o, Aug. 6th (temp=0)100100100100100100.0%
DeepSeek V4 Pro100100100100100100.0%
DeepSeek V4 Flash100100100100100100.0%
Inception Mercury 2100100100100100100.0%
Nemotron 3 Super100100100100100100.0%
Mistral Large 2100100100100100100.0%
GPT-4.1 Mini100100100100100100.0%
GPT-4o, Aug. 6th (temp=1)100100100100100100.0%
Grok 4.20100100100100100100.0%
Hermes 3 405B100100100100100100.0%
Z.AI GLM 4.5 Air100100100100100100.0%
Gemini 2.5 Flash100100100100100100.0%
GPT-5.4 Mini100100100100100100.0%
GPT-5 Nano100100100100100100.0%
GPT-5.4 Nano (Reasoning)100100100100100100.0%
Laguna S 2.1100100100100100100.0%
DeepSeek V3 (2025-03-24)100100100100100100.0%
Gemini 2.5 Flash Lite100100100100100100.0%
Mistral Small 4 (Reasoning)100100100100100100.0%
Qwen 3 32B100100100100100100.0%
Qwen 3 235B A22B Instruct 2507100100100100100100.0%
GPT-4o Mini (temp=1)100100100100100100.0%
GPT-5.4 Nano (Reasoning, Low)100100100100100100.0%
Llama 3.1 70B100100100100100100.0%
Mistral Small 3.2 24B100100100100100100.0%
GPT-4o Mini (temp=0)100100100100100100.0%
Mistral Medium 3.1100100100100100100.0%
Gemma 3 12B100100100100100100.0%
Gemma 3 27B100100100100100100.0%
Mistral Small 4100100100100100100.0%
Nemotron 3 Nano100100100100100100.0%
Thinking Machines Inkling100100100100100100.0%
Qwen 2.5 72B100100100100100100.0%
Cydonia 24B V4.1100100100100100100.0%
GPT-5.4 Nano100100100100100100.0%
WizardLM 2 8x22b100100100100100100.0%
Ministral 3 14B100100100100100100.0%
Ministral 3 8B100100100100100100.0%
GPT-4.1 Nano100100100100100100.0%
Hermes 3 70B100100100100100100.0%
Arcee AI: Trinity Mini100100100100100100.0%
Cohere Command R+ (Aug. 2024)100100100100100100.0%
Gemma 3 4B100100100100100100.0%
Ministral 3 3B100100100100100100.0%
Mistral NeMO100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100080.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100080.0%
Gemma 4 31B (Reasoning)100100100100080.0%
Z.AI GLM 4.7100100100100080.0%
Thinking Machines Inkling Small (Reasoning, High)100100100100080.0%
Qwen 3.5 9B100100100100080.0%
Writer: Palmyra X5100100100100080.0%
Grok 4.3100100100100080.0%
ByteDance Seed 1.6 Flash100100100100080.0%
GPT-5.4 Mini (Reasoning, Low)1001001000060.0%
Laguna XS 2.110010000040.0%
Ministral 8B10010000040.0%
Gemma 4 31B100000020.0%
Ministral 3B100000020.0%