Non-passive narration preserved

Test: Text Replacement

Avg. Score
89.2%
Scenarios
2

Overall Performance

Rank ▲ Model Score Avg. Cost Avg. Time Stability
1Claude Haiku 4.5100.0%$0.00515.8s100%
2Gemma 4 26B100.0%$0.000327.1s100%
3Claude Sonnet 4.6100.0%$0.0157.5s100%
4Claude Sonnet 4100.0%$0.0159.4s100%
5Qwen 3.5 Plus (2026-02-15)99.1%$0.002210.2s94%
6Gemini 2.5 Flash Lite98.2%$0.00042.5s91%
7Claude Opus 4.5100.0%$0.0268.1s100%
8Claude Opus 4.6100.0%$0.0268.7s100%
9Thinking Machines Inkling99.1%$0.003830.5s94%
10Gemma 4 31B99.1%$0.000444.2s94%
11Gemini 2.5 Flash95.5%$0.00213.0s88%
12Claude Opus 4.7100.0%$0.0367.3s100%
13Xiaomi MIMO v2.594.6%$0.004015.0s88%
14Claude Sonnet 4.596.4%$0.0157.2s89%
15Qwen 2.5 72B94.6%$0.000416.3s84%
16Z.AI GLM 5.2 (Reasoning, High)98.2%$0.01344.0s91%
17Claude Sonnet 595.5%$0.01411.8s88%
18Mistral Small 3.2 24B93.8%$0.00036.9s82%
19Laguna S 2.193.8%$0.00028.9s82%
20Gemini 3 Flash (Preview)93.8%$0.00274.3s82%
21DeepSeek V3.295.5%$0.000753.2s88%
22Grok 4.2093.8%$0.00296.5s82%
23Mistral Large 393.8%$0.001610.5s82%
24Gemini 3.5 Flash Lite (Reasoning)92.9%$0.00211.9s82%
25Writer: Palmyra X593.8%$0.005013.7s84%
26MiniMax M2.597.3%$0.00211.3m90%
27Gemini 3.6 Flash (Reasoning, Minimal)93.8%$0.00703.1s82%
28Gemini 3.5 Flash (Reasoning, Minimal)93.8%$0.00813.5s82%
29Mistral Large 293.8%$0.006210.5s82%
30Ministral 3 14B92.9%$0.00035.7s79%
31GPT-4o Mini (temp=1)87.5%$0.000612.4s88%
32GPT-4o Mini (temp=0)87.5%$0.000613.8s88%
33ByteDance Seed 1.6 Flash92.9%$0.001221.9s82%
34DeepSeek V4 Pro92.9%$0.002022.3s82%
35Gemini 3.5 Flash Lite (Reasoning, Minimal)92.0%$0.00212.0s77%
36Gemma 3 12B92.9%$0.000112.8s77%
37Gemini 3.1 Flash Lite (Preview)89.3%$0.00132.4s80%
38Gemini 3.1 Flash Lite89.3%$0.00132.4s80%
39Gemini 3.1 Flash Lite (Reasoning)88.4%$0.00138.2s82%
40Xiaomi MIMO v2.5 Pro93.8%$0.007332.3s82%
41Hermes 3 405B87.5%$0.001731.7s88%
42GPT-4.1 Mini88.4%$0.001510.3s82%
43Cydonia 24B V4.192.0%$0.000618.0s78%
44Muse Spark 1.1 (Reasoning, Medium)93.8%$0.01517.3s82%
45Grok 4.5 (Reasoning, Low)93.8%$0.01421.2s82%
46GPT-5.6 Luna (Reasoning)92.9%$0.01010.6s79%
47GPT-5.5 (Reasoning, Low)94.6%$0.03211.5s88%
48GPT-5.4 Mini (Reasoning, Low)91.1%$0.00527.9s78%
49DeepSeek V3 (2024-12-26)91.1%$0.001223.1s78%
50GPT-5.4 (Reasoning, Low)93.8%$0.02014.1s82%
51GPT-5.4 Mini87.5%$0.00403.2s79%
52GPT-5 Mini93.8%$0.008250.8s82%
53GPT-5.6 Terra92.9%$0.0134.2s77%
54Claude Sonnet 5 (Reasoning, Low)95.5%$0.03426.8s88%
55Gemma 3 27B86.6%$0.000324.0s82%
56GPT-5.593.8%$0.0266.8s82%
57Z.AI GLM 4.693.8%$0.007857.8s82%
58Gemini 2.5 Flash Lite (Reasoning)92.0%$0.003332.9s77%
59GPT-5.6 Terra (Reasoning)93.8%$0.02612.5s82%
60Claude Opus 4.8 (Reasoning)100.0%$0.07224.8s100%
61Claude Sonnet 5 (Reasoning)94.6%$0.03426.1s88%
62Qwen3 235B A22B Instruct 250791.1%$0.000419.2s73%
63Mistral Small 484.8%$0.00064.5s79%
64Claude Opus 4.7 (Reasoning)99.1%$0.06413.9s94%
65GPT-5.491.1%$0.0138.3s75%
66Arcee AI: Trinity Mini86.6%$0.000311.2s75%
67Gemini 2.5 Flash (Reasoning)90.2%$0.01422.4s79%
68Z.AI GLM 4.592.0%$0.006352.4s77%
69Claude Opus 593.8%$0.03611.5s82%
70Z.AI GLM 5 Turbo93.8%$0.02250.4s82%
71Gemma 3 4B88.4%$0.000110.1s70%
72GPT-5.6 Luna88.4%$0.00535.4s71%
73Grok 4.20 (Reasoning)93.8%$0.0181.1m82%
74Claude Opus 4.8 (Reasoning, Low)99.1%$0.07124.9s94%
75Claude Opus 5 (Reasoning)98.2%$0.06522.6s91%
76Muse Spark 1.1 (Reasoning, Minimal)91.1%$0.01011.8s70%
77Mistral Medium 3.182.1%$0.00186.3s77%
78ByteDance Seed 1.687.5%$0.00771.4m88%
79Qwen 3.6 Flash89.3%$0.01445.2s80%
80GPT-5.4 Mini (Reasoning)89.3%$0.01837.8s80%
81Gemini 3 Flash (Preview, Reasoning)88.4%$0.02236.9s82%
82GPT-5.6 Sol90.2%$0.0266.5s75%
83MoonshotAI: Kimi K3 (Reasoning, Low)93.8%$0.03155.2s82%
84Z.AI GLM 4.5 Air91.1%$0.00591.5m78%
85GPT-5.192.0%$0.02934.1s77%
86GPT-5.288.4%$0.02522.2s77%
87DeepSeek V4 Flash (Reasoning)92.0%$0.00132.3m77%
88GPT-5.6 Sol (Reasoning)93.8%$0.05822.4s82%
89Claude Opus 5 (Reasoning, Low)95.5%$0.07525.2s88%
90DeepSeek V4 Flash92.0%$0.000310.6s49%
91Ministral 3 8B83.9%$0.00024.2s57%
92Grok 4.5 (Reasoning, High)93.8%$0.0451.3m82%
93GPT-4.180.4%$0.00766.4s66%
94Ministral 8B83.0%$0.00023.9s57%
95GPT-5.5 (Reasoning)93.8%$0.06825.1s82%
96Qwen 3 32B87.5%$0.001043.4s58%
97Gemma 4 26B (Reasoning)93.8%$0.00423.4m82%
98Qwen 3.5 Plus (2026-04-20)88.4%$0.0202.1m82%
99GPT-5.4 Nano80.4%$0.00113.8s59%
100GPT-5.4 (Reasoning)92.9%$0.05247.2s77%
101DeepSeek V3.188.4%$0.000935.4s52%
102Grok 4.3 (Reasoning)91.1%$0.0191.5m70%
103Gemini 2.5 Pro92.9%$0.05641.9s77%
104Gemini 3.6 Flash (Reasoning)93.8%$0.07136.0s82%
105GPT-5.4 Nano (Reasoning)79.5%$0.003422.3s63%
106Mistral Small 4 (Reasoning)86.6%$0.003634.3s55%
107Grok 4.387.5%$0.00306.0s47%
108Qwen 3.5 35B89.3%$0.0251.3m71%
109ByteDance Seed 2.0 Lite85.7%$0.00851.6m69%
110Llama 3.1 70B77.7%$0.000718.9s61%
111Laguna XS 2.186.6%$0.000416.1s46%
112Qwen 3.5 Flash87.5%$0.00501.4m61%
113GPT-592.0%$0.0501.3m77%
114Qwen 3.6 35B84.8%$0.0111.0m61%
115GPT-5.4 Nano (Reasoning, Low)77.7%$0.00147.4s56%
116Claude Opus 491.1%$0.07713.4s78%
117MoonshotAI: Kimi K3 (Reasoning, High)93.8%$0.0551.9m82%
118GPT-OSS 120B84.8%$0.001046.5s52%
119Z.AI GLM 4.792.0%$0.0173.0m77%
120Qwen 3.5 122B90.2%$0.0411.9m79%
121Aion 3.094.6%$0.0542.9m88%
122DeepSeek V4 Pro (Reasoning)92.0%$0.0133.5m77%
123Gemini 3.5 Flash (Reasoning)89.3%$0.07733.0s80%
124Qwen 3.5 397B A17B90.2%$0.0113.7m79%
125Z.AI GLM 591.1%$0.0233.2m78%
126GPT-4o, Aug. 6th (temp=0)81.3%$0.00913.9s46%
127DeepSeek V3 (2025-03-24)82.1%$0.000842.6s46%
128Qwen 3.5 27B91.1%$0.0372.9m78%
129ByteDance Seed 2.0 Mini89.3%$0.00364.0m74%
130Z.AI GLM 4.7 Flash84.8%$0.00342.4m55%
131Aion 2.085.7%$0.00691.5m45%
132GPT-4.1 Nano75.0%$0.00045.0s39%
133Z.AI GLM 5.192.9%$0.0443.4m77%
134WizardLM 2 8x22b82.1%$0.00141.5m45%
135o4 Mini83.0%$0.02639.2s44%
136Qwen3.7 Max88.4%$0.0722.1m77%
137GPT-5 Nano78.6%$0.00521.9m52%
138Thinking Machines Inkling (Reasoning)93.8%$0.0414.8m82%
139DeepSeek-V2 Chat75.9%$0.001121.5s33%
140Ministral 3B71.4%$0.00012.9s32%
141Gemma 4 31B (Reasoning)92.9%$0.00276.3m77%
142Inception Mercury 267.9%$0.00273.7s38%
143Claude Sonnet 4.6 (Reasoning)93.8%$0.1231.5m82%
144MiniMax M392.9%$0.0176.0m77%
145GPT-4o, Aug. 6th (temp=1)71.4%$0.00864.1s31%
146Aion 3.0 Mini86.6%$0.0102.9m44%
147o4 Mini High83.9%$0.0561.4m54%
148MiniMax M2.785.7%$0.0143.1m49%
149Claude Opus 4.6 (Reasoning)91.1%$0.1291.1m78%
150Qwen3.6 Max Preview92.0%$0.0664.0m77%
151Qwen 3.5 9B76.8%$0.00202.9m45%
152Qwen 3.6 27B82.1%$0.0271.9m32%
153Ministral 3 3B60.7%$0.00022.9s25%
154MoonshotAI: Kimi K2.591.1%$0.0296.5m70%
155Gemini 3.1 Pro (Preview)93.8%$0.1682.6m82%
156Mistral NeMO53.6%$0.00023.1s14%
157Nemotron 3 Super61.6%$0.00002.5m24%
158MoonshotAI: Kimi K2.692.9%$0.0727.6m77%
159Nemotron 3 Nano63.4%$0.00344.0m27%
160Cohere Command R+ (Aug. 2024)36.6%$0.009218.4s17%
161Hermes 3 70B57.1%$0.00222.8m10%
89.19%

Individual Scenarios

Generic Prompt

Model # 1 # 2 # 3 # 4 # 5 # 6 # 7 Avg ▼
Claude Opus 4.8 (Reasoning)100100100100100100100100.0%
Claude Opus 4.6100100100100100100100100.0%
Claude Sonnet 4.6100100100100100100100100.0%
Claude Opus 4.7100100100100100100100100.0%
Claude Opus 4.5100100100100100100100100.0%
Claude Sonnet 4100100100100100100100100.0%
Gemma 4 26B100100100100100100100100.0%
Claude Haiku 4.5100100100100100100100100.0%
Claude Opus 4.7 (Reasoning)1001001001001001008898.2%
Claude Opus 4.8 (Reasoning, Low)1001001001001001008898.2%
Claude Opus 5 (Reasoning)1001001001001001008898.2%
MiniMax M2.51001001001001001008898.2%
Qwen 3.5 Plus (2026-02-15)1001001001001001008898.2%
Gemma 4 31B1001001001001001008898.2%
Thinking Machines Inkling1001001001001001008898.2%
Z.AI GLM 5.2 (Reasoning, High)100100100100100888896.4%
Gemini 2.5 Flash Lite100100100100100888896.4%
Z.AI GLM 4.61001001008888888892.9%
Claude Sonnet 4.51001001008888888892.9%
MiniMax M2.71001001008888888892.9%
Xiaomi MIMO v2.51001001008888888892.9%
DeepSeek V3.21001001008888888892.9%
Claude Opus 5 (Reasoning, Low)100100888888888891.1%
Claude Sonnet 5 (Reasoning, Low)100100888888888891.1%
Claude Sonnet 5100100888888888891.1%
GPT-5.4 Mini (Reasoning, Low)100100888888888891.1%
Gemini 2.5 Flash100100888888888891.1%
Qwen 2.5 72B1001001008888887591.1%
GPT-5.5 (Reasoning, Low)10088888888888889.3%
Claude Sonnet 5 (Reasoning)10088888888888889.3%
Aion 3.010088888888888889.3%
Xiaomi MIMO v2.5 Pro10088888888888889.3%
DeepSeek V3 (2024-12-26)10088888888888889.3%
GPT-5.4 Mini10088888888888889.3%
GPT-5.6 Sol (Reasoning)8888888888888887.5%
Claude Opus 4.6 (Reasoning)8888888888888887.5%
Gemini 3.6 Flash (Reasoning)8888888888888887.5%
Grok 4.5 (Reasoning, High)8888888888888887.5%
Gemini 3.1 Pro (Preview)8888888888888887.5%
GPT-5.4 (Reasoning)8888888888888887.5%
Muse Spark 1.1 (Reasoning, Medium)8888888888888887.5%
Z.AI GLM 5.18888888888888887.5%
Qwen3.6 Max Preview8888888888888887.5%
GPT-5.5 (Reasoning)8888888888888887.5%
Claude Sonnet 4.6 (Reasoning)8888888888888887.5%
Gemini 3.5 Flash (Reasoning)8888888888888887.5%
Z.AI GLM 5 Turbo8888888888888887.5%
MoonshotAI: Kimi K3 (Reasoning, High)8888888888888887.5%
MoonshotAI: Kimi K2.68888888888888887.5%
GPT-5.6 Terra (Reasoning)8888888888888887.5%
MoonshotAI: Kimi K3 (Reasoning, Low)8888888888888887.5%
GPT-58888888888888887.5%
GPT-5 Mini8888888888888887.5%
Qwen 3.5 397B A17B8888888888888887.5%
Grok 4.5 (Reasoning, Low)8888888888888887.5%
GPT-5.4 (Reasoning, Low)8888888888888887.5%
Grok 4.20 (Reasoning)8888888888888887.5%
MoonshotAI: Kimi K2.58888888888888887.5%
Thinking Machines Inkling (Reasoning)8888888888888887.5%
GPT-5.6 Sol8888888888888887.5%
GPT-5.18888888888888887.5%
MiniMax M38888888888888887.5%
Qwen 3.5 122B8888888888888887.5%
Qwen 3.5 27B8888888888888887.5%
Claude Opus 58888888888888887.5%
Gemini 3 Flash (Preview, Reasoning)8888888888888887.5%
GPT-5.4 Mini (Reasoning)8888888888888887.5%
Qwen 3.5 Plus (2026-04-20)8888888888888887.5%
Gemma 4 31B (Reasoning)8888888888888887.5%
Z.AI GLM 58888888888888887.5%
ByteDance Seed 1.68888888888888887.5%
GPT-5.58888888888888887.5%
Qwen 3.6 Flash8888888888888887.5%
DeepSeek V4 Pro (Reasoning)8888888888888887.5%
Gemma 4 26B (Reasoning)8888888888888887.5%
Gemini 2.5 Pro8888888888888887.5%
GPT-5.6 Terra8888888888888887.5%
DeepSeek V4 Flash (Reasoning)8888888888888887.5%
Z.AI GLM 4.78888888888888887.5%
Claude Opus 48888888888888887.5%
Gemini 3.6 Flash (Reasoning, Minimal)8888888888888887.5%
Aion 2.08888888888888887.5%
Gemini 3.1 Flash Lite (Reasoning)8888888888888887.5%
Gemini 3.5 Flash (Reasoning, Minimal)8888888888888887.5%
Qwen 3.5 Flash8888888888888887.5%
Gemini 3 Flash (Preview)8888888888888887.5%
Gemini 3.1 Flash Lite (Preview)8888888888888887.5%
Gemini 3.1 Flash Lite8888888888888887.5%
Z.AI GLM 4.58888888888888887.5%
GPT-OSS 120B8888888888888887.5%
Mistral Large 38888888888888887.5%
ByteDance Seed 2.0 Lite8888888888888887.5%
Gemini 2.5 Flash (Reasoning)8888888888888887.5%
DeepSeek-V2 Chat8888888888888887.5%
Aion 3.0 Mini8888888888888887.5%
Gemini 2.5 Flash Lite (Reasoning)8888888888888887.5%
DeepSeek V3.1100100100100100882587.5%
Z.AI GLM 4.7 Flash10088888888887587.5%
Mistral Large 28888888888888887.5%
GPT-4.1 Mini8888888888888887.5%
Grok 4.208888888888888887.5%
Hermes 3 405B8888888888888887.5%
Z.AI GLM 4.5 Air8888888888888887.5%
Laguna S 2.18888888888888887.5%
DeepSeek V3 (2025-03-24)10088888888887587.5%
Mistral Small 4 (Reasoning)10088888888887587.5%
Writer: Palmyra X510088888888887587.5%
GPT-4o Mini (temp=1)8888888888888887.5%
Mistral Small 3.2 24B8888888888888887.5%
GPT-4o Mini (temp=0)8888888888888887.5%
Gemma 3 12B8888888888888887.5%
Qwen3.7 Max8888888888887585.7%
GPT-5.6 Luna (Reasoning)8888888888887585.7%
GPT-5.28888888888887585.7%
Gemini 3.5 Flash Lite (Reasoning)10088888888757585.7%
DeepSeek V4 Pro10088888888757585.7%
Gemma 3 27B8888888888887585.7%
ByteDance Seed 1.6 Flash10088888888757585.7%
Ministral 3 14B8888888888887585.7%
Hermes 3 70B100100888888756385.7%
Qwen 3.5 35B8888888888886383.9%
GPT-4.18888888888757583.9%
ByteDance Seed 2.0 Mini8888888888757583.9%
Gemini 3.5 Flash Lite (Reasoning, Minimal)8888888888757583.9%
DeepSeek V4 Flash10010010010010088083.9%
Qwen 3 32B8888888888886383.9%
Mistral Small 48888888888757583.9%
Cydonia 24B V4.110088888888756383.9%
Muse Spark 1.1 (Reasoning, Minimal)8888888888885082.1%
Grok 4.3 (Reasoning)8888888888885082.1%
GPT-5.48888888875757582.1%
Qwen3 235B A22B Instruct 25078888888888756382.1%
Arcee AI: Trinity Mini8888888875757582.1%
Qwen 3.5 9B8888888888755080.4%
Inception Mercury 28888888888636380.4%
Qwen 3.6 35B8888888888505076.8%
GPT-5.6 Luna8875757575757576.8%
Grok 4.3100100100888863076.8%
Llama 3.1 70B8888887575755076.8%
Mistral Medium 3.18875757575757576.8%
Gemma 3 4B8888757575756376.8%
GPT-4o, Aug. 6th (temp=0)888888888888075.0%
o4 Mini High8888888875632573.2%
Laguna XS 2.1888888888875073.2%
WizardLM 2 8x22b100100888888381373.2%
GPT-4o, Aug. 6th (temp=1)888888888863071.4%
o4 Mini8888888875252567.9%
GPT-5.4 Nano (Reasoning)8875636363636367.9%
GPT-5.4 Nano7575756363636367.9%
Ministral 3 8B7575757563635067.9%
GPT-5 Nano8888757550503866.1%
Ministral 8B7575636363636366.1%
Qwen 3.6 27B100888888880064.3%
GPT-5.4 Nano (Reasoning, Low)7575756363505064.3%
GPT-4.1 Nano1008875635038058.9%
Nemotron 3 Super888850505050053.6%
Ministral 3B6363505050383850.0%
Nemotron 3 Nano8875503825251344.6%
Ministral 3 3B6363502525251337.5%
Mistral NeMO38252513130016.1%
Cohere Command R+ (Aug. 2024)501313000010.7%

Specific Prompt

Model # 1 # 2 # 3 # 4 # 5 # 6 # 7 Avg ▼
GPT-5.6 Sol (Reasoning)100100100100100100100100.0%
Gemini 3.6 Flash (Reasoning)100100100100100100100100.0%
Grok 4.5 (Reasoning, High)100100100100100100100100.0%
Gemini 3.1 Pro (Preview)100100100100100100100100.0%
Muse Spark 1.1 (Reasoning, Medium)100100100100100100100100.0%
GPT-5.5 (Reasoning)100100100100100100100100.0%
Claude Sonnet 4.6 (Reasoning)100100100100100100100100.0%
Z.AI GLM 5.2 (Reasoning, High)100100100100100100100100.0%
Z.AI GLM 5 Turbo100100100100100100100100.0%
MoonshotAI: Kimi K3 (Reasoning, High)100100100100100100100100.0%
Claude Opus 4.7 (Reasoning)100100100100100100100100.0%
GPT-5.5 (Reasoning, Low)100100100100100100100100.0%
GPT-5.6 Terra (Reasoning)100100100100100100100100.0%
Claude Opus 4.8 (Reasoning)100100100100100100100100.0%
Claude Opus 4.6100100100100100100100100.0%
MoonshotAI: Kimi K3 (Reasoning, Low)100100100100100100100100.0%
Claude Opus 5 (Reasoning, Low)100100100100100100100100.0%
Claude Opus 4.8 (Reasoning, Low)100100100100100100100100.0%
Muse Spark 1.1 (Reasoning, Minimal)100100100100100100100100.0%
GPT-5 Mini100100100100100100100100.0%
Grok 4.3 (Reasoning)100100100100100100100100.0%
Grok 4.5 (Reasoning, Low)100100100100100100100100.0%
GPT-5.4 (Reasoning, Low)100100100100100100100100.0%
Grok 4.20 (Reasoning)100100100100100100100100.0%
Thinking Machines Inkling (Reasoning)100100100100100100100100.0%
Claude Sonnet 4.6100100100100100100100100.0%
GPT-5.6 Luna (Reasoning)100100100100100100100100.0%
Claude Sonnet 5 (Reasoning)100100100100100100100100.0%
Claude Sonnet 5 (Reasoning, Low)100100100100100100100100.0%
Claude Opus 5100100100100100100100100.0%
Claude Opus 4.7100100100100100100100100.0%
Claude Opus 4.5100100100100100100100100.0%
GPT-5.5100100100100100100100100.0%
Gemma 4 26B (Reasoning)100100100100100100100100.0%
Aion 3.0100100100100100100100100.0%
Qwen 3.6 27B100100100100100100100100.0%
Claude Sonnet 4100100100100100100100100.0%
Claude Sonnet 4.5100100100100100100100100.0%
Claude Sonnet 5100100100100100100100100.0%
Gemini 3.6 Flash (Reasoning, Minimal)100100100100100100100100.0%
Qwen 3.5 Plus (2026-02-15)100100100100100100100100.0%
Gemini 3.5 Flash (Reasoning, Minimal)100100100100100100100100.0%
Gemini 3 Flash (Preview)100100100100100100100100.0%
Gemma 4 31B100100100100100100100100.0%
GPT-5.6 Luna100100100100100100100100.0%
Gemma 4 26B100100100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100100100100100100100100.0%
Gemini 3.5 Flash Lite (Reasoning)100100100100100100100100.0%
GPT-5.4100100100100100100100100.0%
Mistral Large 3100100100100100100100100.0%
Claude Haiku 4.5100100100100100100100100.0%
DeepSeek V4 Pro100100100100100100100100.0%
DeepSeek V4 Flash100100100100100100100100.0%
Mistral Large 2100100100100100100100100.0%
Grok 4.20100100100100100100100100.0%
Gemini 2.5 Flash100100100100100100100100.0%
Laguna S 2.1100100100100100100100100.0%
Gemini 2.5 Flash Lite100100100100100100100100.0%
Writer: Palmyra X5100100100100100100100100.0%
Qwen3 235B A22B Instruct 2507100100100100100100100100.0%
Mistral Small 3.2 24B100100100100100100100100.0%
Laguna XS 2.1100100100100100100100100.0%
Thinking Machines Inkling100100100100100100100100.0%
Cydonia 24B V4.1100100100100100100100100.0%
ByteDance Seed 1.6 Flash100100100100100100100100.0%
Ministral 3 14B100100100100100100100100.0%
Ministral 3 8B100100100100100100100100.0%
Gemma 3 4B100100100100100100100100.0%
Ministral 8B100100100100100100100100.0%
GPT-5.4 (Reasoning)1001001001001001008898.2%
Z.AI GLM 5.11001001001001001008898.2%
MoonshotAI: Kimi K2.61001001001001001008898.2%
Claude Opus 5 (Reasoning)1001001001001001008898.2%
MiniMax M31001001001001001008898.2%
Gemma 4 31B (Reasoning)1001001001001001008898.2%
Gemini 2.5 Pro1001001001001001008898.2%
GPT-5.6 Terra1001001001001001008898.2%
o4 Mini1001001001001001008898.2%
Xiaomi MIMO v2.5 Pro1001001001001001008898.2%
DeepSeek V3.21001001001001001008898.2%
Grok 4.31001001001001001008898.2%
Gemma 3 12B1001001001001001008898.2%
Qwen 2.5 72B1001001001001001008898.2%
Qwen3.6 Max Preview100100100100100888896.4%
GPT-5100100100100100888896.4%
GPT-5.1100100100100100888896.4%
DeepSeek V4 Pro (Reasoning)100100100100100888896.4%
DeepSeek V4 Flash (Reasoning)100100100100100888896.4%
Z.AI GLM 4.7100100100100100888896.4%
MiniMax M2.5100100100100100888896.4%
Z.AI GLM 4.5100100100100100888896.4%
Xiaomi MIMO v2.5100100100100100888896.4%
Gemini 2.5 Flash Lite (Reasoning)100100100100100888896.4%
Claude Opus 4.6 (Reasoning)10010010010088888894.6%
MoonshotAI: Kimi K2.51001001001001001006394.6%
Qwen 3.5 27B10010010010088888894.6%
Z.AI GLM 510010010010088888894.6%
o4 Mini High10010010010088888894.6%
Z.AI GLM 4.610010010010088888894.6%
Claude Opus 410010010010088888894.6%
Qwen 3.5 35B10010010010088888894.6%
ByteDance Seed 2.0 Mini10010010010088888894.6%
Z.AI GLM 4.5 Air10010010010088888894.6%
Qwen 3.5 397B A17B1001001008888888892.9%
GPT-5.6 Sol10010010010088887592.9%
Qwen 3.5 122B1001001008888888892.9%
Qwen 3.6 35B1001001008888888892.9%
Gemini 2.5 Flash (Reasoning)1001001008888888892.9%
DeepSeek V3 (2024-12-26)1001001008888888892.9%
GPT-5.4 Nano1001001008888888892.9%
Ministral 3B100100100100100886392.9%
Qwen3.7 Max100100888888888891.1%
Gemini 3.5 Flash (Reasoning)100100888888888891.1%
GPT-5.4 Mini (Reasoning)100100888888888891.1%
GPT-5.2100100888888888891.1%
Qwen 3.6 Flash100100888888888891.1%
Gemini 3.1 Flash Lite (Preview)100100888888888891.1%
Gemini 3.1 Flash Lite100100888888888891.1%
GPT-5.4 Mini (Reasoning, Low)100100888888888891.1%
GPT-5 Nano10010010010088886391.1%
GPT-5.4 Nano (Reasoning)100100888888888891.1%
Qwen 3 32B1001001001001001003891.1%
GPT-5.4 Nano (Reasoning, Low)100100888888888891.1%
WizardLM 2 8x22b100100888888888891.1%
GPT-4.1 Nano100100888888888891.1%
Arcee AI: Trinity Mini100100888888888891.1%
Mistral NeMO100100888888888891.1%
Gemini 3 Flash (Preview, Reasoning)10088888888888889.3%
Qwen 3.5 Plus (2026-04-20)10088888888888889.3%
Gemini 3.1 Flash Lite (Reasoning)10088888888888889.3%
DeepSeek V3.1100100100100100883889.3%
GPT-4.1 Mini10088888888888889.3%
ByteDance Seed 1.68888888888888887.5%
Qwen 3.5 Flash10010010010088883887.5%
GPT-4o, Aug. 6th (temp=0)1001001008875757587.5%
Hermes 3 405B8888888888888887.5%
GPT-4o Mini (temp=1)8888888888888887.5%
GPT-4o Mini (temp=0)8888888888888887.5%
Mistral Medium 3.18888888888888887.5%
Gemma 3 27B8888888888888887.5%
Aion 3.0 Mini100100100100100100085.7%
GPT-5.4 Mini8888888888887585.7%
Mistral Small 4 (Reasoning)10010010010088882585.7%
Mistral Small 48888888888887585.7%
Aion 2.010010010010010088083.9%
ByteDance Seed 2.0 Lite10088888888885083.9%
Ministral 3 3B10010010010063636383.9%
GPT-OSS 120B100100100100100383882.1%
Z.AI GLM 4.7 Flash10010010010088503882.1%
Nemotron 3 Nano1001001008888633882.1%
MiniMax M2.710010010010088501378.6%
Llama 3.1 70B8888757575757578.6%
GPT-4.18875757575757576.8%
DeepSeek V3 (2025-03-24)10010088888875076.8%
Qwen 3.5 9B10010010010038383873.2%
GPT-4o, Aug. 6th (temp=1)10010075757575071.4%
Nemotron 3 Super100100887563382569.6%
DeepSeek-V2 Chat100888888880064.3%
Cohere Command R+ (Aug. 2024)8875636363503862.5%
Inception Mercury 2100100383838383855.4%
Hermes 3 70B1001000000028.6%