Deduction

Subcategory of Reasoning. 161 models scored.

Model Leaderboard

All models ranked by their Deduction subcategory score.

# Model Deduction Reasoning Overall
1 GPT-5.6 Sol (Reasoning) 98.99% 96.86% 95.15%
2 GPT-5.4 (Reasoning) 95.95% 94.89% 93.85%
3 Grok 4.5 (Reasoning, High) 95.35% 94.45% 94.12%
4 Gemini 3.6 Flash (Reasoning) 93.67% 94.48% 94.90%
5 GPT-5.5 (Reasoning) 92.17% 92.87% 93.72%
6 Claude Opus 4.6 (Reasoning) 90.64% 93.19% 95.06%
7 MoonshotAI: Kimi K2.6 90.61% 91.69% 92.57%
8 GPT-5.6 Terra (Reasoning) 89.85% 91.03% 92.49%
9 GPT-5.6 Sol 89.65% 91.25% 90.76%
10 Claude Opus 4.8 (Reasoning) 88.50% 91.76% 92.33%
11 MoonshotAI: Kimi K3 (Reasoning, High) 87.24% 90.48% 92.99%
12 Z.AI GLM 5.1 87.24% 90.64% 93.74%
13 GPT-5.5 (Reasoning, Low) 87.08% 88.87% 92.51%
14 Gemini 3.1 Pro (Preview) 86.52% 88.20% 94.08%
15 Grok 4.5 (Reasoning, Low) 86.44% 89.59% 90.94%
16 Gemini 2.5 Pro 86.38% 89.21% 88.44%
17 Claude Opus 5 (Reasoning, Low) 86.32% 88.95% 92.06%
18 Claude Opus 4.6 86.15% 89.75% 92.31%
19 MoonshotAI: Kimi K3 (Reasoning, Low) 86.14% 89.46% 92.07%
20 MoonshotAI: Kimi K2.5 86.07% 87.99% 90.86%
21 Claude Opus 4.7 85.68% 88.29% 89.90%
22 Muse Spark 1.1 (Reasoning, Medium) 85.67% 89.03% 93.81%
23 Gemini 3.5 Flash (Reasoning) 85.49% 88.22% 93.35%
24 GPT-5.5 85.39% 87.68% 89.37%
25 Claude Opus 4.8 (Reasoning, Low) 85.19% 88.83% 91.89%
26 GPT-5 85.13% 89.34% 91.48%
27 Claude Opus 4.7 (Reasoning) 85.06% 88.52% 92.53%
28 Claude Sonnet 4.6 (Reasoning) 85.00% 89.61% 93.64%
29 Aion 3.0 84.03% 86.56% 88.78%
30 Qwen3.7 Max 83.59% 83.47% 94.55%
31 Claude Sonnet 5 (Reasoning) 83.41% 87.77% 90.40%
32 Claude Sonnet 5 (Reasoning, Low) 83.40% 87.78% 90.16%
33 Gemini 3 Flash (Preview, Reasoning) 83.35% 86.16% 89.93%
34 DeepSeek V4 Flash (Reasoning) 83.08% 85.45% 88.06%
35 GPT-5.4 (Reasoning, Low) 83.06% 86.99% 90.91%
36 Z.AI GLM 5 Turbo 83.04% 86.87% 93.29%
37 MiniMax M3 83.04% 86.27% 90.45%
38 Claude Opus 5 82.80% 85.64% 89.97%
39 GPT-5.4 Mini (Reasoning) 82.62% 86.10% 89.82%
40 Claude Opus 5 (Reasoning) 82.56% 85.32% 91.15%
41 GPT-5.6 Luna (Reasoning) 82.29% 84.74% 90.61%
42 Gemini 3.6 Flash (Reasoning, Minimal) 81.93% 83.40% 86.68%
43 GPT-5.2 81.54% 85.61% 89.45%
44 Thinking Machines Inkling (Reasoning) 81.28% 86.03% 90.78%
45 Z.AI GLM 5.2 (Reasoning, High) 80.97% 85.81% 93.41%
46 Muse Spark 1.1 (Reasoning, Minimal) 80.90% 85.18% 91.43%
47 GPT-5.6 Terra 80.74% 84.98% 88.23%
48 Aion 3.0 Mini 80.61% 75.86% 83.69%
49 Qwen3.6 Max Preview 79.68% 85.79% 93.72%
50 Z.AI GLM 4.7 79.52% 82.43% 87.67%
51 GPT-5.1 79.33% 82.57% 90.73%
52 Z.AI GLM 5 79.21% 84.09% 89.60%
53 GPT-5 Mini 78.44% 83.31% 91.31%
54 Claude Opus 4.5 77.87% 84.25% 89.60%
55 Z.AI GLM 4.6 77.79% 81.01% 87.64%
56 o4 Mini High 77.69% 82.51% 88.78%
57 DeepSeek V4 Pro (Reasoning) 76.94% 83.52% 89.28%
58 GPT-5.4 Nano (Reasoning) 76.88% 77.96% 80.02%
59 Qwen 3.5 27B 76.50% 79.44% 90.05%
60 o4 Mini 76.48% 80.39% 86.56%
61 Nemotron 3 Super 75.92% 77.87% 81.69%
62 Qwen 3.5 397B A17B 75.79% 81.97% 91.09%
63 GPT-5.4 75.68% 80.92% 84.31%
64 Qwen 3.5 Plus (2026-02-15) 75.68% 81.81% 86.17%
65 ByteDance Seed 2.0 Lite 75.38% 81.47% 84.27%
66 Gemini 3 Flash (Preview) 75.02% 80.99% 85.47%
67 Aion 2.0 74.98% 78.64% 86.66%
68 Xiaomi MIMO v2.5 74.69% 81.80% 83.95%
69 Gemini 2.5 Flash 74.16% 79.09% 80.61%
70 Gemma 4 31B (Reasoning) 74.02% 80.14% 89.64%
71 ByteDance Seed 1.6 74.00% 79.79% 89.59%
72 Qwen 3.5 Plus (2026-04-20) 73.17% 80.60% 89.79%
73 Xiaomi MIMO v2.5 Pro 73.13% 79.73% 86.05%
74 Qwen 3.6 27B 72.95% 79.84% 88.33%
75 Z.AI GLM 4.5 72.94% 77.00% 84.95%
76 Gemini 2.5 Flash (Reasoning) 72.79% 72.63% 84.14%
77 Gemini 3.5 Flash (Reasoning, Minimal) 72.73% 78.93% 85.88%
78 ByteDance Seed 2.0 Mini 72.65% 79.82% 85.69%
79 Gemma 3 12B 72.50% 56.28% 76.07%
80 GPT-4o, Aug. 6th (temp=0) 72.24% 75.40% 82.18%
81 Claude Sonnet 4.6 72.09% 79.62% 90.66%
82 Qwen 3.5 Flash 71.85% 79.34% 85.66%
83 Gemini 3.5 Flash Lite (Reasoning, Minimal) 71.77% 73.22% 84.45%
84 MiniMax M2.5 71.72% 74.33% 86.71%
85 Gemini 2.5 Flash Lite (Reasoning) 71.64% 72.51% 83.10%
86 GPT-OSS 120B 71.54% 77.00% 84.81%
87 Inception Mercury 2 71.53% 76.23% 81.99%
88 Qwen 3.6 Flash 71.49% 79.51% 89.31%
89 Gemini 3.5 Flash Lite (Reasoning) 71.41% 74.16% 84.34%
90 Qwen 3.5 122B 71.05% 79.24% 90.32%
91 Claude Sonnet 4.5 70.37% 78.61% 87.54%
92 DeepSeek V3.2 69.80% 75.48% 82.22%
93 Gemma 4 31B 69.61% 78.18% 85.23%
94 Mistral Medium 3.1 69.60% 71.84% 76.08%
95 Mistral Large 2 69.57% 75.76% 81.50%
96 Mistral Large 3 69.47% 75.26% 84.29%
97 Gemma 4 26B (Reasoning) 68.86% 74.05% 89.02%
98 GPT-4.1 68.81% 74.40% 86.82%
99 Qwen 3.6 35B 68.80% 76.37% 87.66%
100 Qwen 3.5 35B 68.75% 77.89% 87.01%
101 Nemotron 3 Nano 68.20% 65.05% 74.50%
102 Ministral 3 14B 68.13% 67.43% 70.45%
103 Grok 4.3 (Reasoning) 68.02% 75.64% 90.99%
104 Z.AI GLM 4.7 Flash 67.90% 69.68% 82.21%
105 MiniMax M2.7 67.57% 72.76% 86.23%
106 DeepSeek V3.1 67.31% 72.08% 82.35%
107 Claude Opus 4 67.28% 76.72% 87.22%
108 Claude Sonnet 4 67.21% 75.86% 87.64%
109 ByteDance Seed 1.6 Flash 67.00% 63.50% 70.92%
110 Gemini 3.1 Flash Lite (Reasoning) 66.95% 75.32% 85.91%
111 Claude Sonnet 5 66.73% 75.35% 87.34%
112 DeepSeek V3 (2025-03-24) 66.68% 69.32% 79.93%
113 GPT-5.6 Luna 66.67% 72.88% 85.06%
114 Gemini 3.1 Flash Lite 66.65% 74.62% 85.09%
115 Gemini 3.1 Flash Lite (Preview) 66.64% 75.75% 85.41%
116 Gemma 4 26B 66.56% 73.83% 84.89%
117 GPT-4o, Aug. 6th (temp=1) 66.52% 70.58% 81.28%
118 GPT-5.4 Mini (Reasoning, Low) 66.36% 74.50% 83.57%
119 Grok 4.20 66.13% 72.46% 81.21%
120 GPT-5 Nano 66.00% 70.50% 80.16%
121 GPT-5.4 Nano (Reasoning, Low) 65.86% 64.43% 77.46%
122 Qwen 3.5 9B 65.74% 70.90% 84.05%
123 GPT-5.4 Mini 64.78% 70.07% 80.45%
124 Qwen 3 32B 64.44% 66.35% 79.37%
125 Gemini 2.5 Flash Lite 63.84% 65.19% 79.91%
126 Writer: Palmyra X5 63.44% 69.64% 78.11%
127 DeepSeek V3 (2024-12-26) 63.28% 69.12% 82.62%
128 Laguna XS 2.1 62.87% 67.05% 75.42%
129 Mistral Small 4 (Reasoning) 62.74% 66.73% 79.48%
130 Qwen3 235B A22B Instruct 2507 62.64% 68.43% 78.07%
131 DeepSeek-V2 Chat 62.62% 70.75% 84.09%
132 Laguna S 2.1 62.23% 69.59% 79.98%
133 GPT-4o Mini (temp=1) 62.17% 62.26% 77.82%
134 GPT-4.1 Nano 61.83% 54.55% 69.90%
135 DeepSeek V4 Pro 61.62% 71.72% 82.05%
136 Mistral Small 4 61.55% 61.67% 75.23%
137 Z.AI GLM 4.5 Air 60.93% 68.46% 80.74%
138 GPT-4o Mini (temp=0) 60.87% 62.17% 76.86%
139 Gemma 3 4B 60.65% 52.86% 66.33%
140 GPT-4.1 Mini 60.26% 67.35% 81.40%
141 Grok 4.3 60.21% 70.17% 78.00%
142 Grok 4.20 (Reasoning) 60.08% 74.28% 90.87%
143 GPT-5.4 Nano 59.95% 58.53% 72.16%
144 Hermes 3 405B 59.50% 64.59% 80.80%
145 Claude Haiku 4.5 58.43% 67.77% 83.36%
146 Gemma 3 27B 58.39% 61.51% 75.70%
147 Ministral 8B 58.16% 63.20% 63.77%
148 Cydonia 24B V4.1 58.13% 56.95% 72.68%
149 Hermes 3 70B 57.86% 56.20% 69.74%
150 Qwen 2.5 72B 57.16% 61.71% 73.17%
151 Mistral Small 3.2 24B 57.06% 63.87% 77.36%
152 WizardLM 2 8x22b 56.40% 60.41% 71.45%
153 Llama 3.1 70B 55.78% 61.45% 77.41%
154 Thinking Machines Inkling 54.93% 64.85% 73.96%
155 Arcee AI: Trinity Mini 54.53% 55.45% 67.68%
156 DeepSeek V4 Flash 53.69% 68.68% 82.02%
157 Mistral NeMO 52.31% 44.87% 63.80%
158 Cohere Command R+ (Aug. 2024) 51.97% 51.60% 67.04%
159 Ministral 3 8B 50.65% 59.53% 69.98%
160 Ministral 3 3B 50.62% 54.06% 65.02%
161 Ministral 3B 49.47% 53.21% 59.25%