Reasoning

21 scenarios across 2 subcategories. 161 models scored.

Subcategories

Subcategory Avg Score Best Model Best Score
Deduction 72.79% GPT-5.6 Sol (Reasoning) 98.99%
Attention 80.66% Claude Opus 4.6 (Reasoning) 95.74%

Model Leaderboard

All models ranked by their Reasoning category score.

# Model Reasoning Deduction Attention Overall
1 GPT-5.6 Sol (Reasoning) 96.86% 98.99% 94.73% 95.15%
2 GPT-5.4 (Reasoning) 94.89% 95.95% 93.83% 93.85%
3 Gemini 3.6 Flash (Reasoning) 94.48% 93.67% 95.29% 94.90%
4 Grok 4.5 (Reasoning, High) 94.45% 95.35% 93.54% 94.12%
5 Claude Opus 4.6 (Reasoning) 93.19% 90.64% 95.74% 95.06%
6 GPT-5.5 (Reasoning) 92.87% 92.17% 93.57% 93.72%
7 Claude Opus 4.8 (Reasoning) 91.76% 88.50% 95.02% 92.33%
8 MoonshotAI: Kimi K2.6 91.69% 90.61% 92.77% 92.57%
9 GPT-5.6 Sol 91.25% 89.65% 92.84% 90.76%
10 GPT-5.6 Terra (Reasoning) 91.03% 89.85% 92.21% 92.49%
11 Z.AI GLM 5.1 90.64% 87.24% 94.04% 93.74%
12 MoonshotAI: Kimi K3 (Reasoning, High) 90.48% 87.24% 93.71% 92.99%
13 Claude Opus 4.6 89.75% 86.15% 93.35% 92.31%
14 Claude Sonnet 4.6 (Reasoning) 89.61% 85.00% 94.22% 93.64%
15 Grok 4.5 (Reasoning, Low) 89.59% 86.44% 92.75% 90.94%
16 MoonshotAI: Kimi K3 (Reasoning, Low) 89.46% 86.14% 92.77% 92.07%
17 GPT-5 89.34% 85.13% 93.55% 91.48%
18 Gemini 2.5 Pro 89.21% 86.38% 92.04% 88.44%
19 Muse Spark 1.1 (Reasoning, Medium) 89.03% 85.67% 92.40% 93.81%
20 Claude Opus 5 (Reasoning, Low) 88.95% 86.32% 91.59% 92.06%
21 GPT-5.5 (Reasoning, Low) 88.87% 87.08% 90.66% 92.51%
22 Claude Opus 4.8 (Reasoning, Low) 88.83% 85.19% 92.47% 91.89%
23 Claude Opus 4.7 (Reasoning) 88.52% 85.06% 91.99% 92.53%
24 Claude Opus 4.7 88.29% 85.68% 90.91% 89.90%
25 Gemini 3.5 Flash (Reasoning) 88.22% 85.49% 90.96% 93.35%
26 Gemini 3.1 Pro (Preview) 88.20% 86.52% 89.89% 94.08%
27 MoonshotAI: Kimi K2.5 87.99% 86.07% 89.91% 90.86%
28 Claude Sonnet 5 (Reasoning, Low) 87.78% 83.40% 92.17% 90.16%
29 Claude Sonnet 5 (Reasoning) 87.77% 83.41% 92.12% 90.40%
30 GPT-5.5 87.68% 85.39% 89.98% 89.37%
31 GPT-5.4 (Reasoning, Low) 86.99% 83.06% 90.91% 90.91%
32 Z.AI GLM 5 Turbo 86.87% 83.04% 90.71% 93.29%
33 Aion 3.0 86.56% 84.03% 89.10% 88.78%
34 MiniMax M3 86.27% 83.04% 89.51% 90.45%
35 Gemini 3 Flash (Preview, Reasoning) 86.16% 83.35% 88.97% 89.93%
36 GPT-5.4 Mini (Reasoning) 86.10% 82.62% 89.58% 89.82%
37 Thinking Machines Inkling (Reasoning) 86.03% 81.28% 90.78% 90.78%
38 Z.AI GLM 5.2 (Reasoning, High) 85.81% 80.97% 90.66% 93.41%
39 Qwen3.6 Max Preview 85.79% 79.68% 91.90% 93.72%
40 Claude Opus 5 85.64% 82.80% 88.48% 89.97%
41 GPT-5.2 85.61% 81.54% 89.68% 89.45%
42 DeepSeek V4 Flash (Reasoning) 85.45% 83.08% 87.83% 88.06%
43 Claude Opus 5 (Reasoning) 85.32% 82.56% 88.08% 91.15%
44 Muse Spark 1.1 (Reasoning, Minimal) 85.18% 80.90% 89.46% 91.43%
45 GPT-5.6 Terra 84.98% 80.74% 89.22% 88.23%
46 GPT-5.6 Luna (Reasoning) 84.74% 82.29% 87.19% 90.61%
47 Claude Opus 4.5 84.25% 77.87% 90.63% 89.60%
48 Z.AI GLM 5 84.09% 79.21% 88.97% 89.60%
49 DeepSeek V4 Pro (Reasoning) 83.52% 76.94% 90.10% 89.28%
50 Qwen3.7 Max 83.47% 83.59% 83.35% 94.55%
51 Gemini 3.6 Flash (Reasoning, Minimal) 83.40% 81.93% 84.87% 86.68%
52 GPT-5 Mini 83.31% 78.44% 88.18% 91.31%
53 GPT-5.1 82.57% 79.33% 85.81% 90.73%
54 o4 Mini High 82.51% 77.69% 87.32% 88.78%
55 Z.AI GLM 4.7 82.43% 79.52% 85.33% 87.67%
56 Qwen 3.5 397B A17B 81.97% 75.79% 88.15% 91.09%
57 Qwen 3.5 Plus (2026-02-15) 81.81% 75.68% 87.94% 86.17%
58 Xiaomi MIMO v2.5 81.80% 74.69% 88.92% 83.95%
59 ByteDance Seed 2.0 Lite 81.47% 75.38% 87.56% 84.27%
60 Z.AI GLM 4.6 81.01% 77.79% 84.23% 87.64%
61 Gemini 3 Flash (Preview) 80.99% 75.02% 86.97% 85.47%
62 GPT-5.4 80.92% 75.68% 86.16% 84.31%
63 Qwen 3.5 Plus (2026-04-20) 80.60% 73.17% 88.02% 89.79%
64 o4 Mini 80.39% 76.48% 84.29% 86.56%
65 Gemma 4 31B (Reasoning) 80.14% 74.02% 86.25% 89.64%
66 Qwen 3.6 27B 79.84% 72.95% 86.74% 88.33%
67 ByteDance Seed 2.0 Mini 79.82% 72.65% 86.98% 85.69%
68 ByteDance Seed 1.6 79.79% 74.00% 85.57% 89.59%
69 Xiaomi MIMO v2.5 Pro 79.73% 73.13% 86.34% 86.05%
70 Claude Sonnet 4.6 79.62% 72.09% 87.14% 90.66%
71 Qwen 3.6 Flash 79.51% 71.49% 87.53% 89.31%
72 Qwen 3.5 27B 79.44% 76.50% 82.38% 90.05%
73 Qwen 3.5 Flash 79.34% 71.85% 86.84% 85.66%
74 Qwen 3.5 122B 79.24% 71.05% 87.43% 90.32%
75 Gemini 2.5 Flash 79.09% 74.16% 84.03% 80.61%
76 Gemini 3.5 Flash (Reasoning, Minimal) 78.93% 72.73% 85.12% 85.88%
77 Aion 2.0 78.64% 74.98% 82.30% 86.66%
78 Claude Sonnet 4.5 78.61% 70.37% 86.85% 87.54%
79 Gemma 4 31B 78.18% 69.61% 86.75% 85.23%
80 GPT-5.4 Nano (Reasoning) 77.96% 76.88% 79.04% 80.02%
81 Qwen 3.5 35B 77.89% 68.75% 87.03% 87.01%
82 Nemotron 3 Super 77.87% 75.92% 79.82% 81.69%
83 Z.AI GLM 4.5 77.00% 72.94% 81.07% 84.95%
84 GPT-OSS 120B 77.00% 71.54% 82.46% 84.81%
85 Claude Opus 4 76.72% 67.28% 86.16% 87.22%
86 Qwen 3.6 35B 76.37% 68.80% 83.95% 87.66%
87 Inception Mercury 2 76.23% 71.53% 80.92% 81.99%
88 Claude Sonnet 4 75.86% 67.21% 84.52% 87.64%
89 Aion 3.0 Mini 75.86% 80.61% 71.10% 83.69%
90 Mistral Large 2 75.76% 69.57% 81.95% 81.50%
91 Gemini 3.1 Flash Lite (Preview) 75.75% 66.64% 84.86% 85.41%
92 Grok 4.3 (Reasoning) 75.64% 68.02% 83.26% 90.99%
93 DeepSeek V3.2 75.48% 69.80% 81.17% 82.22%
94 GPT-4o, Aug. 6th (temp=0) 75.40% 72.24% 78.55% 82.18%
95 Claude Sonnet 5 75.35% 66.73% 83.97% 87.34%
96 Gemini 3.1 Flash Lite (Reasoning) 75.32% 66.95% 83.69% 85.91%
97 Mistral Large 3 75.26% 69.47% 81.06% 84.29%
98 Gemini 3.1 Flash Lite 74.62% 66.65% 82.59% 85.09%
99 GPT-5.4 Mini (Reasoning, Low) 74.50% 66.36% 82.64% 83.57%
100 GPT-4.1 74.40% 68.81% 79.99% 86.82%
101 MiniMax M2.5 74.33% 71.72% 76.93% 86.71%
102 Grok 4.20 (Reasoning) 74.28% 60.08% 88.49% 90.87%
103 Gemini 3.5 Flash Lite (Reasoning) 74.16% 71.41% 76.90% 84.34%
104 Gemma 4 26B (Reasoning) 74.05% 68.86% 79.24% 89.02%
105 Gemma 4 26B 73.83% 66.56% 81.09% 84.89%
106 Gemini 3.5 Flash Lite (Reasoning, Minimal) 73.22% 71.77% 74.67% 84.45%
107 GPT-5.6 Luna 72.88% 66.67% 79.09% 85.06%
108 MiniMax M2.7 72.76% 67.57% 77.95% 86.23%
109 Gemini 2.5 Flash (Reasoning) 72.63% 72.79% 72.48% 84.14%
110 Gemini 2.5 Flash Lite (Reasoning) 72.51% 71.64% 73.38% 83.10%
111 Grok 4.20 72.46% 66.13% 78.80% 81.21%
112 DeepSeek V3.1 72.08% 67.31% 76.85% 82.35%
113 Mistral Medium 3.1 71.84% 69.60% 74.07% 76.08%
114 DeepSeek V4 Pro 71.72% 61.62% 81.82% 82.05%
115 Qwen 3.5 9B 70.90% 65.74% 76.05% 84.05%
116 DeepSeek-V2 Chat 70.75% 62.62% 78.87% 84.09%
117 GPT-4o, Aug. 6th (temp=1) 70.58% 66.52% 74.64% 81.28%
118 GPT-5 Nano 70.50% 66.00% 75.00% 80.16%
119 Grok 4.3 70.17% 60.21% 80.13% 78.00%
120 GPT-5.4 Mini 70.07% 64.78% 75.36% 80.45%
121 Z.AI GLM 4.7 Flash 69.68% 67.90% 71.45% 82.21%
122 Writer: Palmyra X5 69.64% 63.44% 75.85% 78.11%
123 Laguna S 2.1 69.59% 62.23% 76.95% 79.98%
124 DeepSeek V3 (2025-03-24) 69.32% 66.68% 71.96% 79.93%
125 DeepSeek V3 (2024-12-26) 69.12% 63.28% 74.95% 82.62%
126 DeepSeek V4 Flash 68.68% 53.69% 83.66% 82.02%
127 Z.AI GLM 4.5 Air 68.46% 60.93% 75.99% 80.74%
128 Qwen3 235B A22B Instruct 2507 68.43% 62.64% 74.23% 78.07%
129 Claude Haiku 4.5 67.77% 58.43% 77.12% 83.36%
130 Ministral 3 14B 67.43% 68.13% 66.73% 70.45%
131 GPT-4.1 Mini 67.35% 60.26% 74.43% 81.40%
132 Laguna XS 2.1 67.05% 62.87% 71.22% 75.42%
133 Mistral Small 4 (Reasoning) 66.73% 62.74% 70.72% 79.48%
134 Qwen 3 32B 66.35% 64.44% 68.27% 79.37%
135 Gemini 2.5 Flash Lite 65.19% 63.84% 66.54% 79.91%
136 Nemotron 3 Nano 65.05% 68.20% 61.91% 74.50%
137 Thinking Machines Inkling 64.85% 54.93% 74.76% 73.96%
138 Hermes 3 405B 64.59% 59.50% 69.68% 80.80%
139 GPT-5.4 Nano (Reasoning, Low) 64.43% 65.86% 63.00% 77.46%
140 Mistral Small 3.2 24B 63.87% 57.06% 70.67% 77.36%
141 ByteDance Seed 1.6 Flash 63.50% 67.00% 60.00% 70.92%
142 Ministral 8B 63.20% 58.16% 68.24% 63.77%
143 GPT-4o Mini (temp=1) 62.26% 62.17% 62.34% 77.82%
144 GPT-4o Mini (temp=0) 62.17% 60.87% 63.47% 76.86%
145 Qwen 2.5 72B 61.71% 57.16% 66.25% 73.17%
146 Mistral Small 4 61.67% 61.55% 61.79% 75.23%
147 Gemma 3 27B 61.51% 58.39% 64.63% 75.70%
148 Llama 3.1 70B 61.45% 55.78% 67.13% 77.41%
149 WizardLM 2 8x22b 60.41% 56.40% 64.41% 71.45%
150 Ministral 3 8B 59.53% 50.65% 68.42% 69.98%
151 GPT-5.4 Nano 58.53% 59.95% 57.12% 72.16%
152 Cydonia 24B V4.1 56.95% 58.13% 55.78% 72.68%
153 Gemma 3 12B 56.28% 72.50% 40.06% 76.07%
154 Hermes 3 70B 56.20% 57.86% 54.53% 69.74%
155 Arcee AI: Trinity Mini 55.45% 54.53% 56.36% 67.68%
156 GPT-4.1 Nano 54.55% 61.83% 47.26% 69.90%
157 Ministral 3 3B 54.06% 50.62% 57.49% 65.02%
158 Ministral 3B 53.21% 49.47% 56.95% 59.25%
159 Gemma 3 4B 52.86% 60.65% 45.06% 66.33%
160 Cohere Command R+ (Aug. 2024) 51.60% 51.97% 51.23% 67.04%
161 Mistral NeMO 44.87% 52.31% 37.43% 63.80%