Either/Or composite

Test: Novel outline

Avg. Score
75.5%
Scenarios
1

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1Gemini 2.5 Flash Lite100.0%$0.00031.0s100%
2Laguna S 2.1100.0%$0.00014.0s100%
3DeepSeek V4.1 Flash (Reasoning, High)100.0%$0.00053.1s100%
4Claude Haiku 5.5 (Reasoning, Low)100.0%$0.00064.6s100%
5Mistral Large 4.0100.0%$0.00103.4s100%
6GPT-5.4 Nano (Reasoning)100.0%$0.00084.8s100%
7GPT-6.1 Sol (Reasoning, Medium)100.0%$0.00115.2s100%
8DeepSeek V4 Flash 0731 (Reasoning, High)100.0%$0.00038.0s100%
9Z.AI GLM 4.5100.0%$0.00098.1s100%
10GPT-5.6 Terra (Reasoning, Medium)100.0%$0.00371.8s100%
11Z.AI GLM 5 Turbo100.0%$0.00307.2s100%
12Muse Spark 1.1 (Reasoning, Minimal)100.0%$0.00404.3s100%
13Qwen 3 235B A22B Instruct 2507100.0%$0.000416.4s100%
14ByteDance Seed 1.6 Flash100.0%$0.001015.0s100%
15Gemini 3 Flash (Preview, Reasoning)100.0%$0.00416.0s100%
16Gemini 3.8 Flash (Reasoning, Medium)100.0%$0.00544.2s100%
17GPT-5.4 (Reasoning, Low)100.0%$0.00515.3s100%
18Muse Spark 1.1 (Reasoning, Medium)100.0%$0.00515.6s100%
19Qwen 3.8 27B (Reasoning, XHigh)100.0%$0.002712.8s100%
20Qwen 3.6 Flash100.0%$0.003510.6s100%
21Z.AI GLM 5.2 (Reasoning, High)100.0%$0.003810.7s100%
22Muse Glimmer 30B (Reasoning, Medium)100.0%$0.001617.5s100%
23DeepSeek V4 Pro 0813 (Reasoning, High)100.0%$0.00449.3s100%
24Qwen 3.5 Plus (2026-02-15)100.0%$0.002116.3s100%
25GPT-5.2100.0%$0.00556.4s100%
26Gemini 3.7 Flash (Reasoning, Medium)100.0%$0.00576.2s100%
27GPT-5.6 Sol (Reasoning, Medium)100.0%$0.00702.5s100%
28Qwen 3.5 Flash100.0%$0.001120.6s100%
29Writer: Palmyra X5100.0%$0.003912.4s100%
30Muse Spark 1.2 (Reasoning, Medium)100.0%$0.00665.5s100%
31Qwen 3.6 35B100.0%$0.003016.3s100%
32Mistral Large 4.0 (Reasoning)100.0%$0.003018.3s100%
33Z.AI GLM 5100.0%$0.003221.5s100%
34Kimi K2.5100.0%$0.003323.3s100%
35Aion 2.0100.0%$0.002824.9s100%
36Claude Sonnet 5100.0%$0.00976.0s100%
37Aion 3.0100.0%$0.006117.8s100%
38Aion 3.5 (Reasoning, High)100.0%$0.006118.0s100%
39Qwen 3.8 Max (Reasoning, XHigh)100.0%$0.007215.1s100%
40Gemini 3.6 Flash (Reasoning)100.0%$0.0114.8s100%
41GPT-5.4 (Reasoning)100.0%$0.006218.8s100%
42Z.AI GLM 4.6100.0%$0.002334.1s100%
43Qwen 3.5 35B100.0%$0.007823.2s100%
44Gemini 2.5 Pro100.0%$0.0139.0s100%
45Claude Sonnet 5 (Reasoning, Low)100.0%$0.0138.4s100%
46Claude Sonnet 5 (Reasoning)100.0%$0.0138.9s100%
47Qwen 3.5 122B100.0%$0.009121.8s100%
48Claude Sonnet 4.6 (Reasoning)100.0%$0.0149.3s100%
49GPT-5.5 (Reasoning, Low)100.0%$0.0155.3s100%
50Claude Haiku 5.5 (Adaptive)95.0%$0.00063.0s70%
51GPT-5.4 Nano (Reasoning, Low)95.0%$0.00073.2s70%
52Kimi K2.6100.0%$0.005039.7s100%
53Claude Haiku 5.5 (Reasoning, Medium)95.0%$0.00064.9s70%
54GPT-5.6 Luna (Reasoning, Medium)95.0%$0.00162.0s70%
55GPT-5.5 (Reasoning, Medium)100.0%$0.0175.3s100%
56Hy4 Preview (Reasoning, High)100.0%$0.006736.8s100%
57Gemini 2.5 Flash Lite (Reasoning)95.0%$0.00095.1s70%
58Gemini 3.1 Pro (Preview)100.0%$0.01613.7s100%
59Qwen 3.7 Flash (Reasoning)95.0%$0.000312.7s70%
60Claude Opus 4.6 (Reasoning)100.0%$0.01910.4s100%
61DeepSeek-V2 Chat95.0%$0.000317.9s70%
62Z.AI GLM 5.3 Flash (Reasoning, Max)95.0%$0.000320.8s70%
63Qwen 3.5 397B A17B100.0%$0.007748.3s100%
64Claude Opus 5.5 (Reasoning)100.0%$0.0227.3s100%
65Claude Opus 4.7 (Reasoning)100.0%$0.0234.5s100%
66Qwen 3.7 Max100.0%$0.01726.5s100%
67Qwen 3.5 27B100.0%$0.006259.6s100%
68o4 Mini High95.0%$0.005413.6s70%
69Aion 3.5 Mini (Reasoning, High)95.0%$0.001825.1s70%
70Qwen 3.8 Flash (Reasoning)95.0%$0.000429.3s70%
71Muse Spark 1.3 (Reasoning, Medium)95.0%$0.005814.1s70%
72DeepSeek V4 Flash (Reasoning)90.0%$0.000310.5s60%
73Z.AI GLM 5.3 (Reasoning, Max)95.0%$0.005717.3s70%
74MiniMax M2.790.0%$0.000911.7s60%
75Claude Opus 4.7100.0%$0.0274.8s100%
76GPT-5 Mini90.0%$0.001611.1s60%
77Thinking Machines Inkling (Reasoning)95.0%$0.005421.8s70%
78MiniMax M390.0%$0.001117.6s60%
79GPT-595.0%$0.009314.9s70%
80Claude Sonnet 5.5 (Reasoning)95.0%$0.0126.4s70%
81Claude Opus 4.8 (Reasoning)100.0%$0.0297.4s100%
82Xiaomi MIMO v2.6 Pro85.0%$0.00058.5s54%
83Gemma 4 31B (Reasoning)95.0%$0.000545.5s70%
84Thinking Machines Inkling Small (Reasoning, High)85.0%$0.00188.1s54%
85GPT-5.4 Mini (Reasoning)85.0%$0.00325.8s54%
86ByteDance Seed 2.0 Lite95.0%$0.003941.7s70%
87Qwen 3.5 Plus (2026-04-20)95.0%$0.005836.0s70%
88Qwen 3.6 Max Preview100.0%$0.01752.2s100%
89MiniMax M2.585.0%$0.001016.4s54%
90Qwen 3.6 27B95.0%$0.008132.0s70%
91Aion 3.0 Mini90.0%$0.002130.3s60%
92Mistral Large 390.0%$0.00124.8s40%
93Gemini 3.5 Flash (Reasoning)95.0%$0.0186.9s70%
94Nemotron 3 Super80.0%$0.000013.6s51%
95Gemini 3.5 Flash Lite (Reasoning)85.0%$0.00141.2s36%
96Xiaomi MIMO v2.6 Flash85.0%$0.00017.7s36%
97Gemini 3.1 Flash Lite (Preview)80.0%$0.00101.7s34%
98Gemini 3.5 Flash Lite (Reasoning, Minimal)80.0%$0.00121.1s34%
99 Kimi K3 (Reasoning, High)90.0%$0.01221.4s60%
100Kimi K3 (Reasoning, Low)80.0%$0.006112.9s51%
101Z.AI GLM 5.3 Flash (Reasoning, Low)80.0%$0.00018.0s34%
102Z.AI GLM 4.790.0%$0.002951.1s60%
103GPT-4.185.0%$0.00467.3s36%
104Gemini 2.5 Flash (Reasoning)80.0%$0.00243.9s34%
105Gemma 3 12B75.0%$0.00029.5s38%
106Gemini 3.1 Flash Lite (Reasoning)75.0%$0.00091.6s33%
107GPT-4o, Aug. 6th (temp=0)75.0%$0.00371.1s38%
108GPT-5.185.0%$0.00569.0s36%
109o4 Mini85.0%$0.004911.6s36%
110DeepSeek V4 Pro (Reasoning)85.0%$0.002746.4s54%
111Qwen 3.5 9B95.0%$0.00111.5m70%
112ByteDance Seed 1.680.0%$0.003434.0s51%
113GPT-4o Mini (temp=0)50.0%$0.00021.5s50%
114GPT-6 Luna (Reasoning, High)50.0%$0.00014.4s50%
115GPT-6 Luna (Reasoning, Medium)50.0%$0.00024.9s50%
116Z.AI GLM 5.190.0%$0.006029.6s40%
117Grok 4.20 (Reasoning)75.0%$0.004512.1s38%
118Gemma 4 26B (Reasoning)90.0%$0.00051.3m60%
119GPT-4o, Aug. 6th (temp=1)75.0%$0.00593.9s33%
120Gemini 3.1 Flash Lite75.0%$0.00091.6s19%
121GPT-4.1 Nano65.0%$0.00014.1s27%
122Inception Mercury 255.0%$0.0005836ms35%
123GPT-4o Mini (temp=1)60.0%$0.00031.9s30%
124Xiaomi MIMO v2.575.0%$0.00135.9s19%
125Mistral Small 4 (Reasoning)70.0%$0.001310.5s25%
126Claude Opus 4.8 (Reasoning, Low)90.0%$0.0297.2s60%
127Qwen 2.5 72B70.0%$0.000814.9s25%
128Mistral Medium 3.560.0%$0.00341.5s30%
129Mistral Small 465.0%$0.00032.8s18%
130Qwen 3 32B75.0%$0.001036.8s33%
131Claude Sonnet 4.680.0%$0.00873.6s20%
132Gemini 2.5 Flash60.0%$0.0005886ms20%
133Gemma 4 31B60.0%$0.00022.8s20%
134GPT-4.1 Mini65.0%$0.00075.8s16%
135Ministral 3 8B50.0%$0.00032.3s28%
136Llama 3.1 70B70.0%$0.001217.6s20%
137GPT-5 Nano70.0%$0.000926.9s26%
138GPT-OSS 120B55.0%$0.000322.8s35%
139Claude Sonnet 470.0%$0.00995.6s25%
140Mistral Medium 3.5 (Reasoning)55.0%$0.00391.8s23%
141Claude Haiku 4.565.0%$0.00323.1s10%
142DeepSeek V4 Flash60.0%$0.00015.3s10%
143Z.AI GLM 4.7 Flash70.0%$0.001039.3s25%
144Gemini 3.6 Flash (Reasoning, Minimal)60.0%$0.0028924ms10%
145Gemini 3.5 Flash (Reasoning, Minimal)60.0%$0.00411.5s13%
146Mistral Large 250.0%$0.00487.9s28%
147ByteDance Seed 2.0 Mini95.0%$0.00242.3m70%
148Ministral 3 3B40.0%$0.00021.5s20%
149Thinking Machines Inkling60.0%$0.002313.5s13%
150WizardLM 2 8x22b55.0%$0.001911.7s15%
151Laguna XS 2.155.0%$0.00012.5s4%
152Arcee AI: Trinity Mini35.0%$0.00026.7s27%
153Claude Opus 495.0%$0.04711.4s70%
154Xiaomi MIMO v2.5 Pro60.0%$0.002411.9s10%
155Gemini 3 Flash (Preview)40.0%$0.00131.7s20%
156Grok 4.2045.0%$0.00193.6s15%
157Z.AI GLM 4.5 Air55.0%$0.000912.3s8%
158DeepSeek V3.155.0%$0.000513.6s8%
159Claude Opus 5 (Reasoning)80.0%$0.03410.6s51%
160GPT-5.4 Nano45.0%$0.00061.9s8%
161DeepSeek V3.250.0%$0.000513.5s11%
162Ministral 3B45.0%$0.00013.9s8%
163DeepSeek V3 (2024-12-26)55.0%$0.000810.1s4%
164Hermes 3 70B55.0%$0.000610.8s4%
165GPT-6 Sol (Reasoning, Medium)30.0%$0.00153.2s26%
166Cohere Command R+ (Aug. 2024)40.0%$0.00462.4s20%
167Ministral 3 14B35.0%$0.00045.0s18%
168DeepSeek V4 Pro45.0%$0.00066.3s8%
169Hermes 3 405B30.0%$0.000011.9s26%
170Gemma 4 26B60.0%$0.000320.4s2%
171GPT-5.4 Mini (Reasoning, Low)35.0%$0.00213.2s18%
172Gemma 3 27B40.0%$0.00029.7s13%
173Grok 4.7 (Reasoning, High)60.0%$0.00619.5s2%
174Claude Opus 4.555.0%$0.0164.9s23%
175Nemotron 3 Nano35.0%$0.000532.9s27%
176Mistral NeMO35.0%$0.00033.5s5%
177Grok 4.3 (Reasoning)65.0%$0.005836.0s10%
178Claude Opus 575.0%$0.03211.1s38%
179GPT-5.4 Mini25.0%$0.0013851ms13%
180Claude Sonnet 4.550.0%$0.00944.5s5%
181GPT-5.6 Sol25.0%$0.00221.1s13%
182Claude Opus 5 (Reasoning, Low)75.0%$0.03411.2s38%
183GPT-5.435.0%$0.00352.7s5%
184Cydonia 24B V4.125.0%$0.00036.4s0%
185GPT-5.525.0%$0.00831.4s13%
186Gemma 3 4B20.0%$0.00013.5s0%
187DeepSeek V3 (2025-03-24)25.0%$0.00089.5s0%
188Grok 4.5 (Reasoning, Low)30.0%$0.00546.6s0%
189Grok 4.315.0%$0.0017955ms0%
190Claude Opus 4.640.0%$0.0125.5s0%
191Ministral 8B15.0%$0.00028.4s0%
192GPT-5.6 Luna10.0%$0.00051.2s0%
193GPT-6 Sol10.0%$0.00092.0s0%
194Grok 4.5 (Reasoning, High)25.0%$0.00618.1s0%
195Mistral Medium 3.110.0%$0.00135.3s0%
196Mistral Small 3.2 24B5.0%$0.00023.0s0%
197GPT-6 Luna0.0%$0.00001.5s0%
198GPT-5.6 Terra0.0%$0.00121.2s0%
199Grok 4.6 (Reasoning, High)10.0%$0.007112.0s0%
75.48%

Individual Scenarios

pov-count

Model # 1 # 2 # 3 # 4 # 5 # 6 # 7 # 8 # 9 # 10 Avg ▼
Claude Opus 5.5 (Reasoning)100100100100100100100100100100100.0%
Qwen 3.8 Max (Reasoning, XHigh)100100100100100100100100100100100.0%
GPT-6.1 Sol (Reasoning, Medium)100100100100100100100100100100100.0%
Gemini 3.8 Flash (Reasoning, Medium)100100100100100100100100100100100.0%
GPT-5.6 Sol (Reasoning, Medium)100100100100100100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100100100100100100.0%
Gemini 3.7 Flash (Reasoning, Medium)100100100100100100100100100100100.0%
Hy4 Preview (Reasoning, High)100100100100100100100100100100100.0%
Muse Spark 1.2 (Reasoning, Medium)100100100100100100100100100100100.0%
Qwen 3.7 Max100100100100100100100100100100100.0%
DeepSeek V4.1 Flash (Reasoning, High)100100100100100100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100100100100100100.0%
Qwen 3.6 Max Preview100100100100100100100100100100100.0%
GPT-5.5 (Reasoning, Medium)100100100100100100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100100100100100100.0%
Qwen 3.8 27B (Reasoning, XHigh)100100100100100100100100100100100.0%
Kimi K2.6100100100100100100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100100100100100100.0%
GPT-5.6 Terra (Reasoning, Medium)100100100100100100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100100100100100100.0%
Mistral Large 4.0 (Reasoning)100100100100100100100100100100100.0%
Aion 3.5 (Reasoning, High)100100100100100100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100100100100100100.0%
Kimi K2.5100100100100100100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100100100100100100.0%
Qwen 3.5 122B100100100100100100100100100100100.0%
DeepSeek V4 Pro 0813 (Reasoning, High)100100100100100100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100100100100100100.0%
Qwen 3.5 27B100100100100100100100100100100100.0%
Gemini 3 Flash (Preview, Reasoning)100100100100100100100100100100100.0%
Claude Opus 4.7100100100100100100100100100100100.0%
Z.AI GLM 5100100100100100100100100100100100.0%
GPT-5.2100100100100100100100100100100100.0%
Qwen 3.6 Flash100100100100100100100100100100100.0%
Muse Glimmer 30B (Reasoning, Medium)100100100100100100100100100100100.0%
Aion 3.0100100100100100100100100100100100.0%
Gemini 2.5 Pro100100100100100100100100100100100.0%
DeepSeek V4 Flash 0731 (Reasoning, High)100100100100100100100100100100100.0%
Qwen 3.6 35B100100100100100100100100100100100.0%
Claude Haiku 5.5 (Reasoning, Low)100100 – – – – – – – – 100.0%
Z.AI GLM 4.6100100100100100100100100100100100.0%
Claude Sonnet 5100100100100100100100100100100100.0%
Qwen 3.5 35B100100100100100100100100100100100.0%
Aion 2.0100100100100100100100100100100100.0%
Qwen 3.5 Plus (2026-02-15)100100100100100100100100100100100.0%
Qwen 3.5 Flash100100100100100100100100100100100.0%
Z.AI GLM 4.5100100100100100100100100100100100.0%
Mistral Large 4.0100100100100100100100100100100100.0%
GPT-5.4 Nano (Reasoning)100100100100100100100100100100100.0%
Laguna S 2.1100100100100100100100100100100100.0%
Gemini 2.5 Flash Lite100100100100100100100100100100100.0%
Writer: Palmyra X5100100100100100100100100100100100.0%
Qwen 3 235B A22B Instruct 2507100100100100100100100100100100100.0%
ByteDance Seed 1.6 Flash100100100100100100100100100100100.0%
Z.AI GLM 5.3 (Reasoning, Max)1001001001001001001001001005095.0%
Z.AI GLM 5.3 Flash (Reasoning, Max)1001001001001001001001001005095.0%
Qwen 3.8 Flash (Reasoning)1001001001001001001001001005095.0%
Muse Spark 1.3 (Reasoning, Medium)1001001001001001001001001005095.0%
Gemini 3.5 Flash (Reasoning)1001001001001001001001001005095.0%
Claude Sonnet 5.5 (Reasoning)1001001001001001001001001005095.0%
Aion 3.5 Mini (Reasoning, High)1001001001001001001001001005095.0%
GPT-51001001001001001001001001005095.0%
Thinking Machines Inkling (Reasoning)1001001001001001001001001005095.0%
GPT-5.6 Luna (Reasoning, Medium)1001001001001001001001001005095.0%
Qwen 3.5 Plus (2026-04-20)1001001001001001001001001005095.0%
Gemma 4 31B (Reasoning)1001001001001001001001001005095.0%
Claude Haiku 5.5 (Adaptive)1001001001001001001001001005095.0%
o4 Mini High1001001001001001001001001005095.0%
Qwen 3.7 Flash (Reasoning)1001001001001001001001001005095.0%
Qwen 3.6 27B1001001001001001001001001005095.0%
Claude Opus 41001001001001001001001001005095.0%
ByteDance Seed 2.0 Mini1001001001001001001001001005095.0%
ByteDance Seed 2.0 Lite1001001001001001001001001005095.0%
Claude Haiku 5.5 (Reasoning, Medium)1001001001001001001001001005095.0%
DeepSeek-V2 Chat1001001001001001001001001005095.0%
Qwen 3.5 9B1001001001001001001001001005095.0%
Gemini 2.5 Flash Lite (Reasoning)1001001001001001001001001005095.0%
GPT-5.4 Nano (Reasoning, Low)1001001001001001001001001005095.0%
Z.AI GLM 5.1100100100100100100100100100090.0%
Kimi K3 (Reasoning, High)100100100100100100100100505090.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100100100505090.0%
GPT-5 Mini100100100100100100100100505090.0%
MiniMax M3100100100100100100100100505090.0%
Gemma 4 26B (Reasoning)100100100100100100100100505090.0%
DeepSeek V4 Flash (Reasoning)100100100100100100100100505090.0%
Z.AI GLM 4.7100100100100100100100100505090.0%
MiniMax M2.7100100100100100100100100505090.0%
Mistral Large 3100100100100100100100100100090.0%
Aion 3.0 Mini100100100100100100100100505090.0%
Xiaomi MIMO v2.6 Pro10010010010010010010050505085.0%
GPT-5.110010010010010010010010050085.0%
GPT-5.4 Mini (Reasoning)10010010010010010010050505085.0%
DeepSeek V4 Pro (Reasoning)10010010010010010010050505085.0%
Thinking Machines Inkling Small (Reasoning, High)10010010010010010010050505085.0%
Xiaomi MIMO v2.6 Flash10010010010010010010010050085.0%
GPT-4.110010010010010010010010050085.0%
MiniMax M2.510010010010010010010050505085.0%
o4 Mini10010010010010010010010050085.0%
Gemini 3.5 Flash Lite (Reasoning)10010010010010010010010050085.0%
Kimi K3 (Reasoning, Low)1001001001001001005050505080.0%
Claude Opus 5 (Reasoning)1001001001001001005050505080.0%
Claude Sonnet 4.61001001001001001001001000080.0%
ByteDance Seed 1.61001001001001001005050505080.0%
Z.AI GLM 5.3 Flash (Reasoning, Low)1001001001001001001005050080.0%
Gemini 3.1 Flash Lite (Preview)1001001001001001001005050080.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)1001001001001001001005050080.0%
Gemini 2.5 Flash (Reasoning)1001001001001001001005050080.0%
Nemotron 3 Super1001001001001001005050505080.0%
Claude Opus 5 (Reasoning, Low)100100100100100505050505075.0%
Grok 4.20 (Reasoning)100100100100100505050505075.0%
Claude Opus 5100100100100100505050505075.0%
Gemini 3.1 Flash Lite (Reasoning)100100100100100100505050075.0%
Gemini 3.1 Flash Lite100100100100100100100500075.0%
Xiaomi MIMO v2.5100100100100100100100500075.0%
GPT-4o, Aug. 6th (temp=0)100100100100100505050505075.0%
GPT-4o, Aug. 6th (temp=1)100100100100100100505050075.0%
Qwen 3 32B100100100100100100505050075.0%
Gemma 3 12B100100100100100505050505075.0%
Claude Sonnet 410010010010010050505050070.0%
Z.AI GLM 4.7 Flash10010010010010050505050070.0%
GPT-5 Nano10010010010050505050505070.0%
Mistral Small 4 (Reasoning)10010010010010050505050070.0%
Llama 3.1 70B10010010010010010050500070.0%
Qwen 2.5 72B10010010010010050505050070.0%
Grok 4.3 (Reasoning)1001001001001001005000065.0%
Claude Haiku 4.51001001001001001005000065.0%
GPT-4.1 Mini1001001001001005050500065.0%
Mistral Small 41001001001005050505050065.0%
GPT-4.1 Nano1001001005050505050505065.0%
Grok 4.7 (Reasoning, High)100100100100100100000060.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100505000060.0%
Xiaomi MIMO v2.5 Pro100100100100100505000060.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100100505050500060.0%
Gemma 4 31B100100100505050505050060.0%
Gemma 4 26B100100100100100100000060.0%
Mistral Medium 3.5100100505050505050505060.0%
DeepSeek V4 Flash100100100100100505000060.0%
Gemini 2.5 Flash100100100505050505050060.0%
GPT-4o Mini (temp=1)100100505050505050505060.0%
Thinking Machines Inkling100100100100505050500060.0%
Claude Opus 4.510010050505050505050055.0%
Mistral Medium 3.5 (Reasoning)10010050505050505050055.0%
GPT-OSS 120B10050505050505050505055.0%
DeepSeek V3 (2024-12-26)10010010010010050000055.0%
DeepSeek V3.110010010010050505000055.0%
Inception Mercury 210050505050505050505055.0%
Z.AI GLM 4.5 Air10010010010050505000055.0%
Laguna XS 2.110010010010010050000055.0%
WizardLM 2 8x22b10010010050505050500055.0%
Hermes 3 70B10010010010010050000055.0%
GPT-6 Luna (Reasoning, High)5050505050505050505050.0%
GPT-6 Luna (Reasoning, Medium)5050505050505050505050.0%
Claude Sonnet 4.51001001001005050000050.0%
DeepSeek V3.21001001005050505000050.0%
Mistral Large 21005050505050505050050.0%
GPT-4o Mini (temp=0)5050505050505050505050.0%
Ministral 3 8B1005050505050505050050.0%
DeepSeek V4 Pro100100100505050000045.0%
Grok 4.20100100505050505000045.0%
GPT-5.4 Nano100100100505050000045.0%
Ministral 3B100100100505050000045.0%
Claude Opus 4.610010010010000000040.0%
Gemini 3 Flash (Preview)10050505050505000040.0%
Gemma 3 27B10010050505050000040.0%
Cohere Command R+ (Aug. 2024)10050505050505000040.0%
Ministral 3 3B10050505050505000040.0%
GPT-5.41001005050500000035.0%
GPT-5.4 Mini (Reasoning, Low)1005050505050000035.0%
Nemotron 3 Nano5050505050505000035.0%
Ministral 3 14B1005050505050000035.0%
Arcee AI: Trinity Mini5050505050505000035.0%
Mistral NeMO1001005050500000035.0%
GPT-6 Sol (Reasoning, Medium)505050505050000030.0%
Grok 4.5 (Reasoning, Low)100100505000000030.0%
Hermes 3 405B505050505050000030.0%
Grok 4.5 (Reasoning, High)10010050000000025.0%
GPT-5.6 Sol50505050500000025.0%
GPT-5.550505050500000025.0%
GPT-5.4 Mini50505050500000025.0%
DeepSeek V3 (2025-03-24)10050505000000025.0%
Cydonia 24B V4.110050505000000025.0%
Gemma 3 4B5050505000000020.0%
Grok 4.3505050000000015.0%
Ministral 8B100500000000015.0%
Grok 4.6 (Reasoning, High)50500000000010.0%
GPT-6 Sol50500000000010.0%
GPT-5.6 Luna50500000000010.0%
Mistral Medium 3.150500000000010.0%
Mistral Small 3.2 24B500000000005.0%
GPT-5.6 Terra00000000000.0%
GPT-6 Luna00000000000.0%