Matches Regex

Test: Language Comprehension

Avg. Score
86.0%
Scenarios
2

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1Ministral 3 3B100.0%$0.0000811ms100%
2Gemini 3.1 Flash Lite (Preview)100.0%$0.0002975ms100%
3GPT-5.6 Luna100.0%$0.0003868ms100%
4Gemini 3.5 Flash Lite (Reasoning)100.0%$0.0004760ms100%
5Gemini 3.5 Flash Lite (Reasoning, Minimal)100.0%$0.0004790ms100%
6Gemini 3.1 Flash Lite (Reasoning)100.0%$0.00022.3s100%
7Claude Haiku 5.5 (Adaptive)100.0%$0.00022.7s100%
8Mistral Large 3100.0%$0.00014.2s100%
9GPT-6 Sol100.0%$0.00041.8s100%
10Claude Haiku 5.5 (Reasoning, Low)100.0%$0.00024.0s100%
11DeepSeek V3 (2024-12-26)100.0%$0.00024.5s100%
12Mistral Medium 3.5100.0%$0.0007805ms100%
13Mistral Medium 3.5 (Reasoning)100.0%$0.0007930ms100%
14Claude Haiku 5.5 (Reasoning, Medium)100.0%$0.00024.5s100%
15GPT-5.6 Terra100.0%$0.00071.1s100%
16Mistral Large 4.0100.0%$0.00043.1s100%
17GPT-6 Luna (Reasoning, Medium)100.0%$0.00025.4s100%
18DeepSeek V3.1100.0%$0.00025.6s100%
19Qwen 3.5 Plus (2026-02-15)100.0%$0.00035.4s100%
20Laguna S 2.1100.0%$0.00016.6s100%
21GPT-6 Luna (Reasoning, High)100.0%$0.00026.3s100%
22DeepSeek-V2 Chat100.0%$0.00017.5s100%
23Gemma 4 26B100.0%$0.00009.2s100%
24GPT-5.4 Mini (Reasoning, Low)100.0%$0.00093.6s100%
25GPT-6.1 Sol (Reasoning, Medium)100.0%$0.00084.0s100%
26Gemini 3.6 Flash (Reasoning, Minimal)100.0%$0.00121.2s100%
27DeepSeek V3 (2025-03-24)100.0%$0.00019.8s100%
28GPT-5.6 Luna (Reasoning, Medium)100.0%$0.00113.0s100%
29Gemma 4 26B (Reasoning)100.0%$0.00029.7s100%
30Hermes 3 405B100.0%$0.000011.9s100%
31Gemini 3.5 Flash (Reasoning, Minimal)100.0%$0.00141.3s100%
32GPT-6 Sol (Reasoning, Medium)100.0%$0.00134.0s100%
33Mistral Large 2100.0%$0.00124.9s100%
34DeepSeek V3.2100.0%$0.000212.8s100%
35GPT-5.5100.0%$0.00191.7s100%
36Gemini 3 Flash (Preview, Reasoning)100.0%$0.00174.0s100%
37Gemini 3.7 Flash (Reasoning, Medium)100.0%$0.00193.7s100%
38GPT-5.6 Terra (Reasoning, Medium)100.0%$0.00223.0s100%
39Xiaomi MIMO v2.6 Pro100.0%$0.000714.5s100%
40Gemini 3.8 Flash (Reasoning, Medium)100.0%$0.00232.7s100%
41Gemma 4 31B (Reasoning)100.0%$0.000219.2s100%
42GPT-5.4 Mini (Reasoning)100.0%$0.00197.0s100%
43Claude Sonnet 4100.0%$0.00253.4s100%
44Claude Sonnet 4.6100.0%$0.00263.3s100%
45ByteDance Seed 1.6100.0%$0.001214.4s100%
46Claude Sonnet 4.5100.0%$0.00283.7s100%
47Z.AI GLM 4.5 Air100.0%$0.000917.6s100%
48Thinking Machines Inkling (Reasoning)100.0%$0.00266.6s100%
49Qwen 3.6 35B100.0%$0.002111.1s100%
50Muse Glimmer 30B (Reasoning, Medium)100.0%$0.001416.2s100%
51GPT-5.4 (Reasoning, Low)100.0%$0.00304.2s100%
52Aion 2.0100.0%$0.001217.8s100%
53Z.AI GLM 4.7 Flash100.0%$0.000523.4s100%
54Z.AI GLM 5 Turbo100.0%$0.00268.9s100%
55Grok 4.5 (Reasoning, Low)100.0%$0.00346.3s100%
56Z.AI GLM 5.3 Flash (Reasoning, Max)100.0%$0.000329.7s100%
57Claude Sonnet 5 (Reasoning, Low)100.0%$0.00375.7s100%
58Claude Haiku 5.5 (Reasoning, Max)100.0%$0.002118.9s100%
59Qwen 3.8 Flash (Reasoning)100.0%$0.000729.8s100%
60Claude Opus 4.5100.0%$0.00433.7s100%
61Thinking Machines Inkling Small (Reasoning, High)100.0%$0.002119.7s100%
62Claude Sonnet 5.5 (Reasoning)100.0%$0.00445.0s100%
63MiniMax M3100.0%$0.001328.8s100%
64Z.AI GLM 5.2 (Reasoning, High)100.0%$0.003214.6s100%
65Claude Sonnet 5 (Reasoning)100.0%$0.00456.2s100%
66Claude Opus 4.6100.0%$0.00474.9s100%
67Grok 4.7 (Reasoning, High)100.0%$0.00429.5s100%
68GPT-5.5 (Reasoning, Low)100.0%$0.00495.4s100%
69GPT-5.6 Sol (Reasoning, Medium)100.0%$0.00523.7s100%
70Claude Opus 4.7 (Reasoning)100.0%$0.00572.9s100%
71Aion 3.5 Mini (Reasoning, High)100.0%$0.002031.9s100%
72Kimi K3 (Reasoning, Low)100.0%$0.005010.8s100%
73Z.AI GLM 4.6100.0%$0.002132.1s100%
74GPT-5.4 (Reasoning)100.0%$0.00539.0s100%
75Claude Opus 4.7100.0%$0.00633.4s100%
76ByteDance Seed 2.0 Lite100.0%$0.002831.7s100%
77Muse Spark 1.2 (Reasoning, Medium)100.0%$0.00679.9s100%
78Qwen 3.5 122B100.0%$0.006016.0s100%
79Qwen 3.5 Plus (2026-04-20)100.0%$0.004130.3s100%
80Claude Opus 5100.0%$0.00755.8s100%
81MiniMax M2.7100.0%$0.002741.7s100%
82Gemini 3.5 Flash (Reasoning)100.0%$0.00794.3s100%
83Claude Sonnet 4.6 (Reasoning)100.0%$0.00739.8s100%
84Qwen 3.5 9B100.0%$0.00061.0m100%
85Gemini 3.6 Flash (Reasoning)100.0%$0.00865.3s100%
86Qwen 3.5 27B100.0%$0.005925.2s100%
87Qwen 3.5 35B100.0%$0.006521.4s100%
88Gemini 2.5 Pro100.0%$0.00848.1s100%
89Qwen 3.6 27B100.0%$0.005232.6s100%
90Qwen 3.5 397B A17B100.0%$0.004837.0s100%
91Z.AI GLM 4.7100.0%$0.002454.2s100%
92Grok 4.5 (Reasoning, High)100.0%$0.007716.3s100%
93Muse Spark 1.1 (Reasoning, Minimal)100.0%$0.008414.1s100%
94Aion 3.5 (Reasoning, High)100.0%$0.006728.1s100%
95Claude Opus 5.5 (Reasoning)100.0%$0.00976.7s100%
96Z.AI GLM 5100.0%$0.004052.7s100%
97Mistral Large 4.0 (Reasoning)100.0%$0.005641.6s100%
98GPT-5.5 (Reasoning, Medium)100.0%$0.0107.9s100%
99 Kimi K3 (Reasoning, High)100.0%$0.008918.6s100%
100Claude Opus 4100.0%$0.010011.3s100%
101Kimi K2.5100.0%$0.005843.3s100%
102Claude Opus 4.6 (Reasoning)100.0%$0.0118.8s100%
103Claude Opus 4.8 (Reasoning)100.0%$0.0126.3s100%
104Grok 4.20 (Reasoning)100.0%$0.008233.9s100%
105Gemini 3.1 Pro (Preview)100.0%$0.01112.6s100%
106Muse Spark 1.1 (Reasoning, Medium)100.0%$0.01117.0s100%
107Grok 4.6 (Reasoning, High)100.0%$0.009627.8s100%
108Claude Opus 4.8 (Reasoning, Low)100.0%$0.0136.5s100%
109Grok 4.3 (Reasoning)100.0%$0.008151.0s100%
110Z.AI GLM 5.3 (Reasoning, Max)100.0%$0.01045.0s100%
111Claude Opus 5 (Reasoning, Low)100.0%$0.0158.9s100%
112Claude Opus 5 (Reasoning)100.0%$0.0168.8s100%
113DeepSeek V4 Flash (Reasoning)100.0%$0.00032.0m100%
114ByteDance Seed 2.0 Mini100.0%$0.00202.2m100%
115Qwen 3.6 Max Preview100.0%$0.01350.7s100%
116Qwen 3.7 Max100.0%$0.01946.9s100%
117Mistral NeMO90.0%$0.0000380ms40%
118Gemini 2.5 Flash Lite90.0%$0.0001728ms40%
119Gemini 3.1 Flash Lite90.0%$0.0002977ms40%
120Cydonia 24B V4.190.0%$0.00012.4s40%
121Gemini 3 Flash (Preview)90.0%$0.00031.2s40%
122Gemma 4 31B90.0%$0.00003.1s40%
123Z.AI GLM 4.590.0%$0.00013.1s40%
124WizardLM 2 8x22b90.0%$0.00025.0s40%
125Kimi K2.6100.0%$0.0131.8m100%
126Claude Haiku 4.590.0%$0.00092.1s40%
127GPT-4.190.0%$0.00132.7s40%
128GPT-OSS 120B90.0%$0.000316.3s40%
129DeepSeek V4 Flash90.0%$0.000018.9s40%
130GPT-5 Mini90.0%$0.001512.5s40%
131GPT-5.290.0%$0.00265.0s40%
132Claude Sonnet 590.0%$0.00294.4s40%
133Z.AI GLM 5.3 Flash (Reasoning, Low)90.0%$0.000330.9s40%
134Qwen 3.5 Flash90.0%$0.001425.5s40%
135Qwen 3.8 Max (Reasoning, XHigh)100.0%$0.0201.5m100%
136GPT-5.190.0%$0.00459.8s40%
137MiniMax M2.590.0%$0.001932.8s40%
138Aion 3.090.0%$0.004916.1s40%
139Z.AI GLM 5.190.0%$0.004142.3s40%
140DeepSeek V4.1 Flash (Reasoning, High)90.0%$0.005634.4s40%
141GPT-6 Luna80.0%$0.00001.8s20%
142Gemma 3 4B80.0%$0.00002.2s20%
143Gemini 2.5 Flash80.0%$0.0003987ms20%
144Qwen 3.7 Flash (Reasoning)80.0%$0.000312.1s20%
145GPT-5.6 Sol80.0%$0.00191.3s20%
146GPT-5.480.0%$0.00182.1s20%
147Qwen 3 32B80.0%$0.000313.0s20%
148Xiaomi MIMO v2.6 Flash80.0%$0.000114.8s20%
149DeepSeek V4 Flash 0731 (Reasoning, High)90.0%$0.00071.7m40%
150Gemini 2.5 Flash Lite (Reasoning)80.0%$0.000920.0s20%
151Xiaomi MIMO v2.5 Pro80.0%$0.002413.4s20%
152Nemotron 3 Nano80.0%$0.000640.6s20%
153Aion 3.0 Mini80.0%$0.002239.7s20%
154Gemini 2.5 Flash (Reasoning)80.0%$0.006211.7s20%
155GPT-590.0%$0.01628.4s40%
156GPT-5.4 Mini70.0%$0.0002749ms8%
157Grok 4.370.0%$0.0003936ms8%
158Qwen 3.6 Flash70.0%$0.00248.1s8%
159Cohere Command R+ (Aug. 2024)70.0%$0.00285.5s8%
160o4 Mini70.0%$0.00267.4s8%
161o4 Mini High70.0%$0.004613.2s8%
162Inception Mercury 260.0%$0.0004879ms2%
163Llama 3.1 70B60.0%$0.00023.4s2%
164GPT-5.4 Nano (Reasoning, Low)60.0%$0.00033.3s2%
165GPT-4.1 Mini60.0%$0.00042.8s2%
166GPT-5.4 Nano (Reasoning)60.0%$0.00045.3s2%
167Xiaomi MIMO v2.560.0%$0.00105.2s2%
168Qwen 3 235B A22B Instruct 250760.0%$0.000214.2s2%
169GPT-5 Nano60.0%$0.000617.5s2%
170Hy4 Preview (Reasoning, High)100.0%$0.0313.2m100%
171Ministral 8B50.0%$0.0000347ms0%
172GPT-4o Mini (temp=0)50.0%$0.0000877ms0%
173GPT-4o Mini (temp=1)50.0%$0.0000862ms0%
174Mistral Small 3.2 24B50.0%$0.00002.4s0%
175Hermes 3 70B50.0%$0.00013.2s0%
176Gemma 3 12B50.0%$0.00004.9s0%
177DeepSeek V4 Pro50.0%$0.000313.0s0%
178Muse Spark 1.3 (Reasoning, Medium)80.0%$0.01553.3s20%
179Qwen 3.8 27B (Reasoning, XHigh)80.0%$0.0131.1m20%
180Writer: Palmyra X550.0%$0.00177.8s0%
181GPT-5.4 Nano40.0%$0.00011.1s0%
182Grok 4.2040.0%$0.0002867ms0%
183Qwen 2.5 72B40.0%$0.00013.9s0%
184Thinking Machines Inkling40.0%$0.00033.1s0%
185ByteDance Seed 1.6 Flash40.0%$0.00025.1s0%
186Laguna XS 2.140.0%$0.00017.4s0%
187Ministral 3B30.0%$0.0000357ms0%
188GPT-4.1 Nano30.0%$0.00001.6s0%
189Arcee AI: Trinity Mini40.0%$0.000132.5s0%
190GPT-4o, Aug. 6th (temp=1)30.0%$0.00071.3s0%
191Gemma 3 27B30.0%$0.00018.2s0%
192Mistral Small 4 (Reasoning)30.0%$0.00066.3s0%
193Nemotron 3 Super30.0%$0.000012.9s0%
194Mistral Small 410.0%$0.00011.2s0%
195Ministral 3 8B0.0%$0.0000711ms0%
196Ministral 3 14B0.0%$0.0000912ms0%
197Mistral Medium 3.10.0%$0.00043.6s0%
198GPT-4o, Aug. 6th (temp=0)0.0%$0.00071.9s0%
199DeepSeek V4 Pro 0813 (Reasoning, High)90.0%$0.0392.5m40%
200DeepSeek V4 Pro (Reasoning)70.0%$0.00974.8m8%
85.95%

Individual Scenarios

Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Claude Opus 5.5 (Reasoning)100100100100100100.0%
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Claude Haiku 5.5 (Reasoning, Max)100100100 – – 100.0%
GPT-6.1 Sol (Reasoning, Medium)100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning, Medium)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, High)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
Muse Spark 1.3 (Reasoning, Medium)100100100100100100.0%
GPT-6 Luna (Reasoning, High)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning, Medium)100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Kimi K3 (Reasoning, High)100100100100100100.0%
Claude Sonnet 5.5 (Reasoning)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
GPT-6 Sol (Reasoning, Medium)100100100100100100.0%
Grok 4.7 (Reasoning, High)100100100100100100.0%
Kimi K2.6100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning, Medium)100100100100100100.0%
GPT-6 Luna (Reasoning, Medium)100100100100100100.0%
Aion 3.5 Mini (Reasoning, High)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Mistral Large 4.0 (Reasoning)100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
Aion 3.5 (Reasoning, High)100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100.0%
Xiaomi MIMO v2.6 Pro100100100100100100.0%
GPT-5100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100.0%
Kimi K2.5100100100100100100.0%
Thinking Machines Inkling (Reasoning)100100100100100100.0%
GPT-5.1100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
GPT-5.6 Luna (Reasoning, Medium)100100100100100100.0%
MiniMax M3100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
Qwen 3.5 122B100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100.0%
GPT-6 Sol100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
Gemini 3 Flash (Preview, Reasoning)100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Gemma 4 31B (Reasoning)100100100100100100.0%
Claude Opus 4.5100100100100100100.0%
Z.AI GLM 5100100100100100100.0%
ByteDance Seed 1.6100100100100100100.0%
GPT-5.2100100100100100100.0%
Claude Haiku 5.5 (Adaptive)100100100100100100.0%
GPT-5.5100100100100100100.0%
Gemma 4 26B (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
Gemini 2.5 Pro100100100100100100.0%
Qwen 3.6 27B100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
DeepSeek V4 Flash (Reasoning)100100100100100100.0%
DeepSeek V4 Flash 0731 (Reasoning, High)100100100100100100.0%
Z.AI GLM 4.7100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Claude Haiku 5.5 (Reasoning, Low)100100 – – – 100.0%
Z.AI GLM 4.6100100100100100100.0%
Claude Sonnet 4100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Thinking Machines Inkling Small (Reasoning, High)100100100100100100.0%
Claude Sonnet 5100100100100100100.0%
Claude Opus 4100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
GPT-4.1100100100100100100.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100100.0%
Aion 2.0100100100100100100.0%
MiniMax M2.7100100100100100100.0%
Qwen 3.5 Plus (2026-02-15)100100100100100100.0%
Gemini 3.1 Flash Lite (Reasoning)100100100100100100.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100100100100.0%
ByteDance Seed 2.0 Mini100100100100100100.0%
Gemini 3.1 Flash Lite (Preview)100100100100100100.0%
Mistral Medium 3.5 (Reasoning)100100100100100100.0%
Gemma 4 31B100100100100100100.0%
Gemini 3.1 Flash Lite100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Z.AI GLM 4.5100100100100100100.0%
Gemma 4 26B100100100100100100.0%
GPT-OSS 120B100100100100100100.0%
Mistral Large 4.0100100100100100100.0%
Mistral Medium 3.5100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning)100100100100100100.0%
Mistral Large 3100100100100100100.0%
ByteDance Seed 2.0 Lite100100100100100100.0%
Claude Haiku 5.5 (Reasoning, Medium)100100100100100100.0%
DeepSeek-V2 Chat100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
GPT-5.4 Mini (Reasoning, Low)100100100100100100.0%
DeepSeek V3 (2024-12-26)100100100100100100.0%
DeepSeek V3.1100100100100100100.0%
DeepSeek V3.2100100100100100100.0%
Z.AI GLM 4.7 Flash100100100100100100.0%
Mistral Large 2100100100100100100.0%
Hermes 3 405B100100100100100100.0%
Z.AI GLM 4.5 Air100100100100100100.0%
GPT-5.4 Nano (Reasoning)100100100100100100.0%
Laguna S 2.1100100100100100100.0%
DeepSeek V3 (2025-03-24)100100100100100100.0%
Ministral 3 3B100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100080.0%
Z.AI GLM 5.1100100100100080.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100080.0%
GPT-5 Mini100100100100080.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100080.0%
Aion 3.0100100100100080.0%
o4 Mini High100100100100080.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100100080.0%
Xiaomi MIMO v2.6 Flash100100100100080.0%
MiniMax M2.5100100100100080.0%
Xiaomi MIMO v2.5 Pro100100100100080.0%
Qwen 3.5 Flash100100100100080.0%
Gemini 3 Flash (Preview)100100100100080.0%
Gemini 2.5 Flash (Reasoning)100100100100080.0%
GPT-6 Luna100100100100080.0%
Aion 3.0 Mini100100100100080.0%
Claude Haiku 4.5100100100100080.0%
Gemini 2.5 Flash Lite (Reasoning)100100100100080.0%
DeepSeek V4 Flash100100100100080.0%
GPT-4.1 Mini100100100100080.0%
Gemini 2.5 Flash100100100100080.0%
GPT-5 Nano100100100100080.0%
Gemini 2.5 Flash Lite100100100100080.0%
Qwen 3 32B100100100100080.0%
Writer: Palmyra X5100100100100080.0%
Qwen 3 235B A22B Instruct 2507100100100100080.0%
Grok 4.3100100100100080.0%
GPT-5.4 Nano (Reasoning, Low)100100100100080.0%
Thinking Machines Inkling100100100100080.0%
Cydonia 24B V4.1100100100100080.0%
WizardLM 2 8x22b100100100100080.0%
Mistral NeMO100100100100080.0%
GPT-5.6 Sol1001001000060.0%
Qwen 3.7 Flash (Reasoning)1001001000060.0%
GPT-5.41001001000060.0%
Xiaomi MIMO v2.51001001000060.0%
Inception Mercury 21001001000060.0%
GPT-5.4 Mini1001001000060.0%
Nemotron 3 Nano1001001000060.0%
Gemma 3 4B1001001000060.0%
Qwen 3.6 Flash10010000040.0%
DeepSeek V4 Pro (Reasoning)10010000040.0%
o4 Mini10010000040.0%
Nemotron 3 Super10010000040.0%
Grok 4.2010010000040.0%
GPT-5.4 Nano10010000040.0%
ByteDance Seed 1.6 Flash10010000040.0%
GPT-4.1 Nano10010000040.0%
Arcee AI: Trinity Mini10010000040.0%
Cohere Command R+ (Aug. 2024)10010000040.0%
Ministral 8B10010000040.0%
Ministral 3B10010000040.0%
GPT-4o, Aug. 6th (temp=1)100000020.0%
Llama 3.1 70B100000020.0%
Laguna XS 2.1100000020.0%
Hermes 3 70B100000020.0%
GPT-4o, Aug. 6th (temp=0)000000.0%
DeepSeek V4 Pro000000.0%
Mistral Small 4 (Reasoning)000000.0%
GPT-4o Mini (temp=1)000000.0%
Mistral Small 3.2 24B000000.0%
GPT-4o Mini (temp=0)000000.0%
Mistral Medium 3.1000000.0%
Gemma 3 12B000000.0%
Gemma 3 27B000000.0%
Mistral Small 4000000.0%
Qwen 2.5 72B000000.0%
Ministral 3 14B000000.0%
Ministral 3 8B000000.0%
Model # 1 # 2 # 3 # 4 # 5 Avg ▼
Claude Opus 5.5 (Reasoning)100100100100100100.0%
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100.0%
Claude Haiku 5.5 (Reasoning, Max)100100 – – – 100.0%
GPT-6.1 Sol (Reasoning, Medium)100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)100100100100100100.0%
GPT-5.6 Sol (Reasoning, Medium)100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100.0%
Qwen 3.7 Max100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)100100100100100100.0%
Qwen 3.8 Flash (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, High)100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100.0%
GPT-6 Luna (Reasoning, High)100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100.0%
Z.AI GLM 5.1100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100.0%
GPT-5.5 (Reasoning, Medium)100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100.0%
Gemini 3.5 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100.0%
Kimi K3 (Reasoning, High)100100100100100100.0%
Claude Sonnet 5.5 (Reasoning)100100100100100100.0%
Grok 4.6 (Reasoning, High)100100100100100100.0%
GPT-6 Sol (Reasoning, Medium)100100100100100100.0%
Grok 4.7 (Reasoning, High)100100100100100100.0%
Kimi K2.6100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100.0%
GPT-5.6 Terra (Reasoning, Medium)100100100100100100.0%
GPT-6 Luna (Reasoning, Medium)100100100100100100.0%
Aion 3.5 Mini (Reasoning, High)100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100.0%
Claude Opus 4.6100100100100100100.0%
Mistral Large 4.0 (Reasoning)100100100100100100.0%
Kimi K3 (Reasoning, Low)100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100.0%
Aion 3.5 (Reasoning, High)100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100.0%
Xiaomi MIMO v2.6 Pro100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100.0%
GPT-5 Mini100100100100100100.0%
Claude Opus 5 (Reasoning)100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100.0%
Kimi K2.5100100100100100100.0%
Thinking Machines Inkling (Reasoning)100100100100100100.0%
GPT-5.6 Sol100100100100100100.0%
Claude Sonnet 4.6100100100100100100.0%
GPT-5.6 Luna (Reasoning, Medium)100100100100100100.0%
MiniMax M3100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100.0%
Qwen 3.5 122B100100100100100100.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100.0%
GPT-6 Sol100100100100100100.0%
Qwen 3.5 27B100100100100100100.0%
Claude Opus 5100100100100100100.0%
Gemini 3 Flash (Preview, Reasoning)100100100100100100.0%
Claude Opus 4.7100100100100100100.0%
GPT-5.4 Mini (Reasoning)100100100100100100.0%
Qwen 3.5 Plus (2026-04-20)100100100100100100.0%
Gemma 4 31B (Reasoning)100100100100100100.0%
Claude Opus 4.5100100100100100100.0%
Z.AI GLM 5100100100100100100.0%
ByteDance Seed 1.6100100100100100100.0%
Claude Haiku 5.5 (Adaptive)100100100100100100.0%
GPT-5.5100100100100100100.0%
Qwen 3.6 Flash100100100100100100.0%
DeepSeek V4 Pro (Reasoning)100100100100100100.0%
Gemma 4 26B (Reasoning)100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100.0%
Aion 3.0100100100100100100.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)100100100100100100.0%
Qwen 3.7 Flash (Reasoning)100100100100100100.0%
Gemini 2.5 Pro100100100100100100.0%
Qwen 3.6 27B100100100100100100.0%
GPT-5.6 Terra100100100100100100.0%
DeepSeek V4 Flash (Reasoning)100100100100100100.0%
Z.AI GLM 4.7100100100100100100.0%
Qwen 3.6 35B100100100100100100.0%
Claude Haiku 5.5 (Reasoning, Low)100100 – – – 100.0%
Z.AI GLM 4.6100100100100100100.0%
Claude Sonnet 4100100100100100100.0%
Claude Sonnet 4.5100100100100100100.0%
Thinking Machines Inkling Small (Reasoning, High)100100100100100100.0%
Claude Opus 4100100100100100100.0%
Qwen 3.5 35B100100100100100100.0%
MiniMax M2.5100100100100100100.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100100.0%
Aion 2.0100100100100100100.0%
o4 Mini100100100100100100.0%
MiniMax M2.7100100100100100100.0%
Qwen 3.5 Plus (2026-02-15)100100100100100100.0%
Gemini 3.1 Flash Lite (Reasoning)100100100100100100.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100100100100.0%
ByteDance Seed 2.0 Mini100100100100100100.0%
Qwen 3.5 Flash100100100100100100.0%
Gemini 3 Flash (Preview)100100100100100100.0%
Gemini 3.1 Flash Lite (Preview)100100100100100100.0%
Mistral Medium 3.5 (Reasoning)100100100100100100.0%
GPT-5.6 Luna100100100100100100.0%
Gemma 4 26B100100100100100100.0%
Mistral Large 4.0100100100100100100.0%
Mistral Medium 3.5100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning)100100100100100100.0%
GPT-5.4100100100100100100.0%
Mistral Large 3100100100100100100.0%
ByteDance Seed 2.0 Lite100100100100100100.0%
Claude Haiku 5.5 (Reasoning, Medium)100100100100100100.0%
DeepSeek-V2 Chat100100100100100100.0%
Qwen 3.5 9B100100100100100100.0%
GPT-5.4 Mini (Reasoning, Low)100100100100100100.0%
Claude Haiku 4.5100100100100100100.0%
DeepSeek V3 (2024-12-26)100100100100100100.0%
DeepSeek V3.1100100100100100100.0%
DeepSeek V3.2100100100100100100.0%
Z.AI GLM 4.7 Flash100100100100100100.0%
DeepSeek V4 Pro100100100100100100.0%
DeepSeek V4 Flash100100100100100100.0%
Mistral Large 2100100100100100100.0%
Hermes 3 405B100100100100100100.0%
Z.AI GLM 4.5 Air100100100100100100.0%
Laguna S 2.1100100100100100100.0%
DeepSeek V3 (2025-03-24)100100100100100100.0%
Gemini 2.5 Flash Lite100100100100100100.0%
GPT-4o Mini (temp=1)100100100100100100.0%
Llama 3.1 70B100100100100100100.0%
Mistral Small 3.2 24B100100100100100100.0%
GPT-4o Mini (temp=0)100100100100100100.0%
Gemma 3 12B100100100100100100.0%
Nemotron 3 Nano100100100100100100.0%
Cydonia 24B V4.1100100100100100100.0%
WizardLM 2 8x22b100100100100100100.0%
Cohere Command R+ (Aug. 2024)100100100100100100.0%
Gemma 3 4B100100100100100100.0%
Ministral 3 3B100100100100100100.0%
Mistral NeMO100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100080.0%
GPT-5100100100100080.0%
GPT-5.1100100100100080.0%
GPT-5.2100100100100080.0%
DeepSeek V4 Flash 0731 (Reasoning, High)100100100100080.0%
Claude Sonnet 5100100100100080.0%
Xiaomi MIMO v2.6 Flash100100100100080.0%
GPT-4.1100100100100080.0%
Xiaomi MIMO v2.5 Pro100100100100080.0%
Gemma 4 31B100100100100080.0%
Gemini 3.1 Flash Lite100100100100080.0%
Z.AI GLM 4.5100100100100080.0%
GPT-OSS 120B100100100100080.0%
Gemini 2.5 Flash (Reasoning)100100100100080.0%
GPT-6 Luna100100100100080.0%
Aion 3.0 Mini100100100100080.0%
Gemini 2.5 Flash Lite (Reasoning)100100100100080.0%
Gemini 2.5 Flash100100100100080.0%
GPT-5.4 Mini100100100100080.0%
Qwen 3 32B100100100100080.0%
Qwen 2.5 72B100100100100080.0%
Hermes 3 70B100100100100080.0%
Muse Spark 1.3 (Reasoning, Medium)1001001000060.0%
o4 Mini High1001001000060.0%
Xiaomi MIMO v2.51001001000060.0%
Inception Mercury 21001001000060.0%
Mistral Small 4 (Reasoning)1001001000060.0%
Grok 4.31001001000060.0%
Gemma 3 27B1001001000060.0%
Laguna XS 2.11001001000060.0%
Ministral 8B1001001000060.0%
GPT-4.1 Mini10010000040.0%
GPT-4o, Aug. 6th (temp=1)10010000040.0%
Grok 4.2010010000040.0%
GPT-5 Nano10010000040.0%
Qwen 3 235B A22B Instruct 250710010000040.0%
GPT-5.4 Nano (Reasoning, Low)10010000040.0%
GPT-5.4 Nano10010000040.0%
ByteDance Seed 1.6 Flash10010000040.0%
Arcee AI: Trinity Mini10010000040.0%
Nemotron 3 Super100000020.0%
GPT-5.4 Nano (Reasoning)100000020.0%
Writer: Palmyra X5100000020.0%
Mistral Small 4100000020.0%
GPT-4.1 Nano100000020.0%
Ministral 3B100000020.0%
GPT-4o, Aug. 6th (temp=0)000000.0%
Mistral Medium 3.1000000.0%
Thinking Machines Inkling000000.0%
Ministral 3 14B000000.0%
Ministral 3 8B000000.0%