Either/Or composite

Test: Novel outline

Avg. Score
73.9%
Scenarios
1

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1Gemini 2.5 Flash Lite100.0%$0.00031.0s100%
2Laguna S 2.1100.0%$0.00014.0s100%
3GPT-5.4 Nano (Reasoning)100.0%$0.00084.8s100%
4Z.AI GLM 4.5100.0%$0.00098.1s100%
5GPT-5.6 Terra (Reasoning)100.0%$0.00371.8s100%
6Z.AI GLM 5 Turbo100.0%$0.00307.2s100%
7Muse Spark 1.1 (Reasoning, Minimal)100.0%$0.00404.3s100%
8Qwen3 235B A22B Instruct 2507100.0%$0.000416.4s100%
9ByteDance Seed 1.6 Flash100.0%$0.001015.0s100%
10Gemini 3 Flash (Preview, Reasoning)100.0%$0.00416.0s100%
11GPT-5.4 (Reasoning, Low)100.0%$0.00515.3s100%
12Muse Spark 1.1 (Reasoning, Medium)100.0%$0.00515.6s100%
13Qwen 3.6 Flash100.0%$0.003510.6s100%
14Z.AI GLM 5.2 (Reasoning, High)100.0%$0.003810.7s100%
15Qwen 3.5 Plus (2026-02-15)100.0%$0.002116.3s100%
16GPT-5.2100.0%$0.00556.4s100%
17GPT-5.6 Sol (Reasoning)100.0%$0.00702.5s100%
18Qwen 3.5 Flash100.0%$0.001120.6s100%
19Writer: Palmyra X5100.0%$0.003912.4s100%
20Qwen 3.6 35B100.0%$0.003016.3s100%
21Z.AI GLM 5100.0%$0.003221.5s100%
22MoonshotAI: Kimi K2.5100.0%$0.003323.3s100%
23Aion 2.0100.0%$0.002824.9s100%
24Claude Sonnet 5100.0%$0.00976.0s100%
25Aion 3.0100.0%$0.006117.8s100%
26Gemini 3.6 Flash (Reasoning)100.0%$0.0114.8s100%
27GPT-5.4 (Reasoning)100.0%$0.006218.8s100%
28Z.AI GLM 4.6100.0%$0.002334.1s100%
29Qwen 3.5 35B100.0%$0.007823.2s100%
30Gemini 2.5 Pro100.0%$0.0139.0s100%
31Claude Sonnet 5 (Reasoning, Low)100.0%$0.0138.4s100%
32Claude Sonnet 5 (Reasoning)100.0%$0.0138.9s100%
33Qwen 3.5 122B100.0%$0.009121.8s100%
34Claude Sonnet 4.6 (Reasoning)100.0%$0.0149.3s100%
35GPT-5.5 (Reasoning, Low)100.0%$0.0155.3s100%
36GPT-5.4 Nano (Reasoning, Low)95.0%$0.00073.2s70%
37MoonshotAI: Kimi K2.6100.0%$0.005039.7s100%
38GPT-5.6 Luna (Reasoning)95.0%$0.00162.0s70%
39GPT-5.5 (Reasoning)100.0%$0.0175.3s100%
40Gemini 2.5 Flash Lite (Reasoning)95.0%$0.00095.1s70%
41Gemini 3.1 Pro (Preview)100.0%$0.01613.7s100%
42Claude Opus 4.6 (Reasoning)100.0%$0.01910.4s100%
43DeepSeek-V2 Chat95.0%$0.000317.9s70%
44Qwen 3.5 397B A17B100.0%$0.007748.3s100%
45Claude Opus 4.7 (Reasoning)100.0%$0.0234.5s100%
46Qwen3.7 Max100.0%$0.01726.5s100%
47Qwen 3.5 27B100.0%$0.006259.6s100%
48o4 Mini High95.0%$0.005413.6s70%
49DeepSeek V4 Flash (Reasoning)90.0%$0.000310.5s60%
50MiniMax M2.790.0%$0.000911.7s60%
51Claude Opus 4.7100.0%$0.0274.8s100%
52GPT-5 Mini90.0%$0.001611.1s60%
53Thinking Machines Inkling (Reasoning)95.0%$0.005421.8s70%
54MiniMax M390.0%$0.001117.6s60%
55GPT-595.0%$0.009314.9s70%
56Claude Opus 4.8 (Reasoning)100.0%$0.0297.4s100%
57Gemma 4 31B (Reasoning)95.0%$0.000545.5s70%
58GPT-5.4 Mini (Reasoning)85.0%$0.00325.8s54%
59ByteDance Seed 2.0 Lite95.0%$0.003941.7s70%
60Qwen 3.5 Plus (2026-04-20)95.0%$0.005836.0s70%
61Qwen3.6 Max Preview100.0%$0.01752.2s100%
62MiniMax M2.585.0%$0.001016.4s54%
63Qwen 3.6 27B95.0%$0.008132.0s70%
64Aion 3.0 Mini90.0%$0.002130.3s60%
65Mistral Large 390.0%$0.00124.8s40%
66Gemini 3.5 Flash (Reasoning)95.0%$0.0186.9s70%
67Nemotron 3 Super80.0%$0.000013.6s51%
68Gemini 3.5 Flash Lite (Reasoning)85.0%$0.00141.2s36%
69Gemini 3.1 Flash Lite (Preview)80.0%$0.00101.7s34%
70Gemini 3.5 Flash Lite (Reasoning, Minimal)80.0%$0.00121.1s34%
71MoonshotAI: Kimi K3 (Reasoning, High)90.0%$0.01221.4s60%
72MoonshotAI: Kimi K3 (Reasoning, Low)80.0%$0.006112.9s51%
73Z.AI GLM 4.790.0%$0.002951.1s60%
74GPT-4.185.0%$0.00467.3s36%
75Gemini 2.5 Flash (Reasoning)80.0%$0.00243.9s34%
76Gemma 3 12B75.0%$0.00029.5s38%
77Gemini 3.1 Flash Lite (Reasoning)75.0%$0.00091.6s33%
78GPT-4o, Aug. 6th (temp=0)75.0%$0.00371.1s38%
79GPT-5.185.0%$0.00569.0s36%
80o4 Mini85.0%$0.004911.6s36%
81DeepSeek V4 Pro (Reasoning)85.0%$0.002746.4s54%
82Qwen 3.5 9B95.0%$0.00111.5m70%
83ByteDance Seed 1.680.0%$0.003434.0s51%
84GPT-4o Mini (temp=0)50.0%$0.00021.5s50%
85Z.AI GLM 5.190.0%$0.006029.6s40%
86Grok 4.20 (Reasoning)75.0%$0.004512.1s38%
87Gemma 4 26B (Reasoning)90.0%$0.00051.3m60%
88GPT-4o, Aug. 6th (temp=1)75.0%$0.00593.9s33%
89Gemini 3.1 Flash Lite75.0%$0.00091.6s19%
90GPT-4.1 Nano65.0%$0.00014.1s27%
91Inception Mercury 255.0%$0.0005836ms35%
92GPT-4o Mini (temp=1)60.0%$0.00031.9s30%
93Xiaomi MIMO v2.575.0%$0.00135.9s19%
94Mistral Small 4 (Reasoning)70.0%$0.001310.5s25%
95Claude Opus 4.8 (Reasoning, Low)90.0%$0.0297.2s60%
96Qwen 2.5 72B70.0%$0.000814.9s25%
97Mistral Small 465.0%$0.00032.8s18%
98Qwen 3 32B75.0%$0.001036.8s33%
99Claude Sonnet 4.680.0%$0.00873.6s20%
100Gemini 2.5 Flash60.0%$0.0005886ms20%
101Gemma 4 31B60.0%$0.00022.8s20%
102GPT-4.1 Mini65.0%$0.00075.8s16%
103Ministral 3 8B50.0%$0.00032.3s28%
104Llama 3.1 70B70.0%$0.001217.6s20%
105GPT-5 Nano70.0%$0.000926.9s26%
106GPT-OSS 120B55.0%$0.000322.8s35%
107Claude Sonnet 470.0%$0.00995.6s25%
108Claude Haiku 4.565.0%$0.00323.1s10%
109DeepSeek V4 Flash60.0%$0.00015.3s10%
110Z.AI GLM 4.7 Flash70.0%$0.001039.3s25%
111Gemini 3.6 Flash (Reasoning, Minimal)60.0%$0.0028924ms10%
112Gemini 3.5 Flash (Reasoning, Minimal)60.0%$0.00411.5s13%
113Mistral Large 250.0%$0.00487.9s28%
114ByteDance Seed 2.0 Mini95.0%$0.00242.3m70%
115Ministral 3 3B40.0%$0.00021.5s20%
116Thinking Machines Inkling60.0%$0.002313.5s13%
117WizardLM 2 8x22b55.0%$0.001911.7s15%
118Laguna XS 2.155.0%$0.00012.5s4%
119Arcee AI: Trinity Mini35.0%$0.00026.7s27%
120Claude Opus 495.0%$0.04711.4s70%
121Xiaomi MIMO v2.5 Pro60.0%$0.002411.9s10%
122Gemini 3 Flash (Preview)40.0%$0.00131.7s20%
123Grok 4.2045.0%$0.00193.6s15%
124Z.AI GLM 4.5 Air55.0%$0.000912.3s8%
125DeepSeek V3.155.0%$0.000513.6s8%
126Claude Opus 5 (Reasoning)80.0%$0.03410.6s51%
127GPT-5.4 Nano45.0%$0.00061.9s8%
128DeepSeek V3.250.0%$0.000513.5s11%
129Ministral 3B45.0%$0.00013.9s8%
130DeepSeek V3 (2024-12-26)55.0%$0.000810.1s4%
131Hermes 3 70B55.0%$0.000610.8s4%
132Cohere Command R+ (Aug. 2024)40.0%$0.00462.4s20%
133Ministral 3 14B35.0%$0.00045.0s18%
134DeepSeek V4 Pro45.0%$0.00066.3s8%
135Hermes 3 405B30.0%$0.000011.9s26%
136Gemma 4 26B60.0%$0.000320.4s2%
137GPT-5.4 Mini (Reasoning, Low)35.0%$0.00213.2s18%
138Gemma 3 27B40.0%$0.00029.7s13%
139Claude Opus 4.555.0%$0.0164.9s23%
140Nemotron 3 Nano35.0%$0.000532.9s27%
141Mistral NeMO35.0%$0.00033.5s5%
142Grok 4.3 (Reasoning)65.0%$0.005836.0s10%
143Claude Opus 575.0%$0.03211.1s38%
144GPT-5.4 Mini25.0%$0.0013851ms13%
145Claude Sonnet 4.550.0%$0.00944.5s5%
146GPT-5.6 Sol25.0%$0.00221.1s13%
147Claude Opus 5 (Reasoning, Low)75.0%$0.03411.2s38%
148GPT-5.435.0%$0.00352.7s5%
149Cydonia 24B V4.125.0%$0.00036.4s0%
150GPT-5.525.0%$0.00831.4s13%
151Gemma 3 4B20.0%$0.00013.5s0%
152DeepSeek V3 (2025-03-24)25.0%$0.00089.5s0%
153Grok 4.5 (Reasoning, Low)30.0%$0.00546.6s0%
154Grok 4.315.0%$0.0017955ms0%
155Claude Opus 4.640.0%$0.0125.5s0%
156Ministral 8B15.0%$0.00028.4s0%
157GPT-5.6 Luna10.0%$0.00051.2s0%
158Grok 4.5 (Reasoning, High)25.0%$0.00618.1s0%
159Mistral Medium 3.110.0%$0.00135.3s0%
160Mistral Small 3.2 24B5.0%$0.00023.0s0%
161GPT-5.6 Terra0.0%$0.00121.2s0%
73.94%

Individual Scenarios

pov-count

Model # 1 # 2 # 3 # 4 # 5 # 6 # 7 # 8 # 9 # 10 Avg ▼
GPT-5.6 Sol (Reasoning)100100100100100100100100100100100.0%
Claude Opus 4.6 (Reasoning)100100100100100100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100100100100100100.0%
Qwen3.7 Max100100100100100100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100100100100100100.0%
GPT-5.4 (Reasoning)100100100100100100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100100100100100100.0%
Qwen3.6 Max Preview100100100100100100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100100100100100100.0%
MoonshotAI: Kimi K2.6100100100100100100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100100100100100100.0%
Qwen 3.5 397B A17B100100100100100100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100100100100100100.0%
MoonshotAI: Kimi K2.5100100100100100100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100100100100100100.0%
Qwen 3.5 122B100100100100100100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100100100100100100.0%
Qwen 3.5 27B100100100100100100100100100100100.0%
Gemini 3 Flash (Preview, Reasoning)100100100100100100100100100100100.0%
Claude Opus 4.7100100100100100100100100100100100.0%
Z.AI GLM 5100100100100100100100100100100100.0%
GPT-5.2100100100100100100100100100100100.0%
Qwen 3.6 Flash100100100100100100100100100100100.0%
Aion 3.0100100100100100100100100100100100.0%
Gemini 2.5 Pro100100100100100100100100100100100.0%
Qwen 3.6 35B100100100100100100100100100100100.0%
Z.AI GLM 4.6100100100100100100100100100100100.0%
Claude Sonnet 5100100100100100100100100100100100.0%
Qwen 3.5 35B100100100100100100100100100100100.0%
Aion 2.0100100100100100100100100100100100.0%
Qwen 3.5 Plus (2026-02-15)100100100100100100100100100100100.0%
Qwen 3.5 Flash100100100100100100100100100100100.0%
Z.AI GLM 4.5100100100100100100100100100100100.0%
GPT-5.4 Nano (Reasoning)100100100100100100100100100100100.0%
Laguna S 2.1100100100100100100100100100100100.0%
Gemini 2.5 Flash Lite100100100100100100100100100100100.0%
Writer: Palmyra X5100100100100100100100100100100100.0%
Qwen3 235B A22B Instruct 2507100100100100100100100100100100100.0%
ByteDance Seed 1.6 Flash100100100100100100100100100100100.0%
Gemini 3.5 Flash (Reasoning)1001001001001001001001001005095.0%
GPT-51001001001001001001001001005095.0%
Thinking Machines Inkling (Reasoning)1001001001001001001001001005095.0%
GPT-5.6 Luna (Reasoning)1001001001001001001001001005095.0%
Qwen 3.5 Plus (2026-04-20)1001001001001001001001001005095.0%
Gemma 4 31B (Reasoning)1001001001001001001001001005095.0%
o4 Mini High1001001001001001001001001005095.0%
Qwen 3.6 27B1001001001001001001001001005095.0%
Claude Opus 41001001001001001001001001005095.0%
ByteDance Seed 2.0 Mini1001001001001001001001001005095.0%
ByteDance Seed 2.0 Lite1001001001001001001001001005095.0%
DeepSeek-V2 Chat1001001001001001001001001005095.0%
Qwen 3.5 9B1001001001001001001001001005095.0%
Gemini 2.5 Flash Lite (Reasoning)1001001001001001001001001005095.0%
GPT-5.4 Nano (Reasoning, Low)1001001001001001001001001005095.0%
Z.AI GLM 5.1100100100100100100100100100090.0%
MoonshotAI: Kimi K3 (Reasoning, High)100100100100100100100100505090.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100100100505090.0%
GPT-5 Mini100100100100100100100100505090.0%
MiniMax M3100100100100100100100100505090.0%
Gemma 4 26B (Reasoning)100100100100100100100100505090.0%
DeepSeek V4 Flash (Reasoning)100100100100100100100100505090.0%
Z.AI GLM 4.7100100100100100100100100505090.0%
MiniMax M2.7100100100100100100100100505090.0%
Mistral Large 3100100100100100100100100100090.0%
Aion 3.0 Mini100100100100100100100100505090.0%
GPT-5.110010010010010010010010050085.0%
GPT-5.4 Mini (Reasoning)10010010010010010010050505085.0%
DeepSeek V4 Pro (Reasoning)10010010010010010010050505085.0%
GPT-4.110010010010010010010010050085.0%
MiniMax M2.510010010010010010010050505085.0%
o4 Mini10010010010010010010010050085.0%
Gemini 3.5 Flash Lite (Reasoning)10010010010010010010010050085.0%
MoonshotAI: Kimi K3 (Reasoning, Low)1001001001001001005050505080.0%
Claude Opus 5 (Reasoning)1001001001001001005050505080.0%
Claude Sonnet 4.61001001001001001001001000080.0%
ByteDance Seed 1.61001001001001001005050505080.0%
Gemini 3.1 Flash Lite (Preview)1001001001001001001005050080.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)1001001001001001001005050080.0%
Gemini 2.5 Flash (Reasoning)1001001001001001001005050080.0%
Nemotron 3 Super1001001001001001005050505080.0%
Claude Opus 5 (Reasoning, Low)100100100100100505050505075.0%
Grok 4.20 (Reasoning)100100100100100505050505075.0%
Claude Opus 5100100100100100505050505075.0%
Gemini 3.1 Flash Lite (Reasoning)100100100100100100505050075.0%
Gemini 3.1 Flash Lite100100100100100100100500075.0%
Xiaomi MIMO v2.5100100100100100100100500075.0%
GPT-4o, Aug. 6th (temp=0)100100100100100505050505075.0%
GPT-4o, Aug. 6th (temp=1)100100100100100100505050075.0%
Qwen 3 32B100100100100100100505050075.0%
Gemma 3 12B100100100100100505050505075.0%
Claude Sonnet 410010010010010050505050070.0%
Z.AI GLM 4.7 Flash10010010010010050505050070.0%
GPT-5 Nano10010010010050505050505070.0%
Mistral Small 4 (Reasoning)10010010010010050505050070.0%
Llama 3.1 70B10010010010010010050500070.0%
Qwen 2.5 72B10010010010010050505050070.0%
Grok 4.3 (Reasoning)1001001001001001005000065.0%
Claude Haiku 4.51001001001001001005000065.0%
GPT-4.1 Mini1001001001001005050500065.0%
Mistral Small 41001001001005050505050065.0%
GPT-4.1 Nano1001001005050505050505065.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100505000060.0%
Xiaomi MIMO v2.5 Pro100100100100100505000060.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100100505050500060.0%
Gemma 4 31B100100100505050505050060.0%
Gemma 4 26B100100100100100100000060.0%
DeepSeek V4 Flash100100100100100505000060.0%
Gemini 2.5 Flash100100100505050505050060.0%
GPT-4o Mini (temp=1)100100505050505050505060.0%
Thinking Machines Inkling100100100100505050500060.0%
Claude Opus 4.510010050505050505050055.0%
GPT-OSS 120B10050505050505050505055.0%
DeepSeek V3 (2024-12-26)10010010010010050000055.0%
DeepSeek V3.110010010010050505000055.0%
Inception Mercury 210050505050505050505055.0%
Z.AI GLM 4.5 Air10010010010050505000055.0%
Laguna XS 2.110010010010010050000055.0%
WizardLM 2 8x22b10010010050505050500055.0%
Hermes 3 70B10010010010010050000055.0%
Claude Sonnet 4.51001001001005050000050.0%
DeepSeek V3.21001001005050505000050.0%
Mistral Large 21005050505050505050050.0%
GPT-4o Mini (temp=0)5050505050505050505050.0%
Ministral 3 8B1005050505050505050050.0%
DeepSeek V4 Pro100100100505050000045.0%
Grok 4.20100100505050505000045.0%
GPT-5.4 Nano100100100505050000045.0%
Ministral 3B100100100505050000045.0%
Claude Opus 4.610010010010000000040.0%
Gemini 3 Flash (Preview)10050505050505000040.0%
Gemma 3 27B10010050505050000040.0%
Cohere Command R+ (Aug. 2024)10050505050505000040.0%
Ministral 3 3B10050505050505000040.0%
GPT-5.41001005050500000035.0%
GPT-5.4 Mini (Reasoning, Low)1005050505050000035.0%
Nemotron 3 Nano5050505050505000035.0%
Ministral 3 14B1005050505050000035.0%
Arcee AI: Trinity Mini5050505050505000035.0%
Mistral NeMO1001005050500000035.0%
Grok 4.5 (Reasoning, Low)100100505000000030.0%
Hermes 3 405B505050505050000030.0%
Grok 4.5 (Reasoning, High)10010050000000025.0%
GPT-5.6 Sol50505050500000025.0%
GPT-5.550505050500000025.0%
GPT-5.4 Mini50505050500000025.0%
DeepSeek V3 (2025-03-24)10050505000000025.0%
Cydonia 24B V4.110050505000000025.0%
Gemma 3 4B5050505000000020.0%
Grok 4.3505050000000015.0%
Ministral 8B100500000000015.0%
GPT-5.6 Luna50500000000010.0%
Mistral Medium 3.150500000000010.0%
Mistral Small 3.2 24B500000000005.0%
GPT-5.6 Terra00000000000.0%