Attention

Subcategory of Reasoning. 161 models scored.

Model Leaderboard

All models ranked by their Attention subcategory score.

# Model Attention Reasoning Overall
1 Claude Opus 4.6 (Reasoning) 95.74% 93.19% 95.06%
2 Gemini 3.6 Flash (Reasoning) 95.29% 94.48% 94.90%
3 Claude Opus 4.8 (Reasoning) 95.02% 91.76% 92.33%
4 GPT-5.6 Sol (Reasoning) 94.73% 96.86% 95.15%
5 Claude Sonnet 4.6 (Reasoning) 94.22% 89.61% 93.64%
6 Z.AI GLM 5.1 94.04% 90.64% 93.74%
7 GPT-5.4 (Reasoning) 93.83% 94.89% 93.85%
8 MoonshotAI: Kimi K3 (Reasoning, High) 93.71% 90.48% 92.99%
9 GPT-5.5 (Reasoning) 93.57% 92.87% 93.72%
10 GPT-5 93.55% 89.34% 91.48%
11 Grok 4.5 (Reasoning, High) 93.54% 94.45% 94.12%
12 Claude Opus 4.6 93.35% 89.75% 92.31%
13 GPT-5.6 Sol 92.84% 91.25% 90.76%
14 MoonshotAI: Kimi K3 (Reasoning, Low) 92.77% 89.46% 92.07%
15 MoonshotAI: Kimi K2.6 92.77% 91.69% 92.57%
16 Grok 4.5 (Reasoning, Low) 92.75% 89.59% 90.94%
17 Claude Opus 4.8 (Reasoning, Low) 92.47% 88.83% 91.89%
18 Muse Spark 1.1 (Reasoning, Medium) 92.40% 89.03% 93.81%
19 GPT-5.6 Terra (Reasoning) 92.21% 91.03% 92.49%
20 Claude Sonnet 5 (Reasoning, Low) 92.17% 87.78% 90.16%
21 Claude Sonnet 5 (Reasoning) 92.12% 87.77% 90.40%
22 Gemini 2.5 Pro 92.04% 89.21% 88.44%
23 Claude Opus 4.7 (Reasoning) 91.99% 88.52% 92.53%
24 Qwen3.6 Max Preview 91.90% 85.79% 93.72%
25 Claude Opus 5 (Reasoning, Low) 91.59% 88.95% 92.06%
26 Gemini 3.5 Flash (Reasoning) 90.96% 88.22% 93.35%
27 GPT-5.4 (Reasoning, Low) 90.91% 86.99% 90.91%
28 Claude Opus 4.7 90.91% 88.29% 89.90%
29 Thinking Machines Inkling (Reasoning) 90.78% 86.03% 90.78%
30 Z.AI GLM 5 Turbo 90.71% 86.87% 93.29%
31 GPT-5.5 (Reasoning, Low) 90.66% 88.87% 92.51%
32 Z.AI GLM 5.2 (Reasoning, High) 90.66% 85.81% 93.41%
33 Claude Opus 4.5 90.63% 84.25% 89.60%
34 DeepSeek V4 Pro (Reasoning) 90.10% 83.52% 89.28%
35 GPT-5.5 89.98% 87.68% 89.37%
36 MoonshotAI: Kimi K2.5 89.91% 87.99% 90.86%
37 Gemini 3.1 Pro (Preview) 89.89% 88.20% 94.08%
38 GPT-5.2 89.68% 85.61% 89.45%
39 GPT-5.4 Mini (Reasoning) 89.58% 86.10% 89.82%
40 MiniMax M3 89.51% 86.27% 90.45%
41 Muse Spark 1.1 (Reasoning, Minimal) 89.46% 85.18% 91.43%
42 GPT-5.6 Terra 89.22% 84.98% 88.23%
43 Aion 3.0 89.10% 86.56% 88.78%
44 Gemini 3 Flash (Preview, Reasoning) 88.97% 86.16% 89.93%
45 Z.AI GLM 5 88.97% 84.09% 89.60%
46 Xiaomi MIMO v2.5 88.92% 81.80% 83.95%
47 Grok 4.20 (Reasoning) 88.49% 74.28% 90.87%
48 Claude Opus 5 88.48% 85.64% 89.97%
49 GPT-5 Mini 88.18% 83.31% 91.31%
50 Qwen 3.5 397B A17B 88.15% 81.97% 91.09%
51 Claude Opus 5 (Reasoning) 88.08% 85.32% 91.15%
52 Qwen 3.5 Plus (2026-04-20) 88.02% 80.60% 89.79%
53 Qwen 3.5 Plus (2026-02-15) 87.94% 81.81% 86.17%
54 DeepSeek V4 Flash (Reasoning) 87.83% 85.45% 88.06%
55 ByteDance Seed 2.0 Lite 87.56% 81.47% 84.27%
56 Qwen 3.6 Flash 87.53% 79.51% 89.31%
57 Qwen 3.5 122B 87.43% 79.24% 90.32%
58 o4 Mini High 87.32% 82.51% 88.78%
59 GPT-5.6 Luna (Reasoning) 87.19% 84.74% 90.61%
60 Claude Sonnet 4.6 87.14% 79.62% 90.66%
61 Qwen 3.5 35B 87.03% 77.89% 87.01%
62 ByteDance Seed 2.0 Mini 86.98% 79.82% 85.69%
63 Gemini 3 Flash (Preview) 86.97% 80.99% 85.47%
64 Claude Sonnet 4.5 86.85% 78.61% 87.54%
65 Qwen 3.5 Flash 86.84% 79.34% 85.66%
66 Gemma 4 31B 86.75% 78.18% 85.23%
67 Qwen 3.6 27B 86.74% 79.84% 88.33%
68 Xiaomi MIMO v2.5 Pro 86.34% 79.73% 86.05%
69 Gemma 4 31B (Reasoning) 86.25% 80.14% 89.64%
70 Claude Opus 4 86.16% 76.72% 87.22%
71 GPT-5.4 86.16% 80.92% 84.31%
72 GPT-5.1 85.81% 82.57% 90.73%
73 ByteDance Seed 1.6 85.57% 79.79% 89.59%
74 Z.AI GLM 4.7 85.33% 82.43% 87.67%
75 Gemini 3.5 Flash (Reasoning, Minimal) 85.12% 78.93% 85.88%
76 Gemini 3.6 Flash (Reasoning, Minimal) 84.87% 83.40% 86.68%
77 Gemini 3.1 Flash Lite (Preview) 84.86% 75.75% 85.41%
78 Claude Sonnet 4 84.52% 75.86% 87.64%
79 o4 Mini 84.29% 80.39% 86.56%
80 Z.AI GLM 4.6 84.23% 81.01% 87.64%
81 Gemini 2.5 Flash 84.03% 79.09% 80.61%
82 Claude Sonnet 5 83.97% 75.35% 87.34%
83 Qwen 3.6 35B 83.95% 76.37% 87.66%
84 Gemini 3.1 Flash Lite (Reasoning) 83.69% 75.32% 85.91%
85 DeepSeek V4 Flash 83.66% 68.68% 82.02%
86 Qwen3.7 Max 83.35% 83.47% 94.55%
87 Grok 4.3 (Reasoning) 83.26% 75.64% 90.99%
88 GPT-5.4 Mini (Reasoning, Low) 82.64% 74.50% 83.57%
89 Gemini 3.1 Flash Lite 82.59% 74.62% 85.09%
90 GPT-OSS 120B 82.46% 77.00% 84.81%
91 Qwen 3.5 27B 82.38% 79.44% 90.05%
92 Aion 2.0 82.30% 78.64% 86.66%
93 Mistral Large 2 81.95% 75.76% 81.50%
94 DeepSeek V4 Pro 81.82% 71.72% 82.05%
95 DeepSeek V3.2 81.17% 75.48% 82.22%
96 Gemma 4 26B 81.09% 73.83% 84.89%
97 Z.AI GLM 4.5 81.07% 77.00% 84.95%
98 Mistral Large 3 81.06% 75.26% 84.29%
99 Inception Mercury 2 80.92% 76.23% 81.99%
100 Grok 4.3 80.13% 70.17% 78.00%
101 GPT-4.1 79.99% 74.40% 86.82%
102 Nemotron 3 Super 79.82% 77.87% 81.69%
103 Gemma 4 26B (Reasoning) 79.24% 74.05% 89.02%
104 GPT-5.6 Luna 79.09% 72.88% 85.06%
105 GPT-5.4 Nano (Reasoning) 79.04% 77.96% 80.02%
106 DeepSeek-V2 Chat 78.87% 70.75% 84.09%
107 Grok 4.20 78.80% 72.46% 81.21%
108 GPT-4o, Aug. 6th (temp=0) 78.55% 75.40% 82.18%
109 MiniMax M2.7 77.95% 72.76% 86.23%
110 Claude Haiku 4.5 77.12% 67.77% 83.36%
111 Laguna S 2.1 76.95% 69.59% 79.98%
112 MiniMax M2.5 76.93% 74.33% 86.71%
113 Gemini 3.5 Flash Lite (Reasoning) 76.90% 74.16% 84.34%
114 DeepSeek V3.1 76.85% 72.08% 82.35%
115 Qwen 3.5 9B 76.05% 70.90% 84.05%
116 Z.AI GLM 4.5 Air 75.99% 68.46% 80.74%
117 Writer: Palmyra X5 75.85% 69.64% 78.11%
118 GPT-5.4 Mini 75.36% 70.07% 80.45%
119 GPT-5 Nano 75.00% 70.50% 80.16%
120 DeepSeek V3 (2024-12-26) 74.95% 69.12% 82.62%
121 Thinking Machines Inkling 74.76% 64.85% 73.96%
122 Gemini 3.5 Flash Lite (Reasoning, Minimal) 74.67% 73.22% 84.45%
123 GPT-4o, Aug. 6th (temp=1) 74.64% 70.58% 81.28%
124 GPT-4.1 Mini 74.43% 67.35% 81.40%
125 Qwen3 235B A22B Instruct 2507 74.23% 68.43% 78.07%
126 Mistral Medium 3.1 74.07% 71.84% 76.08%
127 Gemini 2.5 Flash Lite (Reasoning) 73.38% 72.51% 83.10%
128 Gemini 2.5 Flash (Reasoning) 72.48% 72.63% 84.14%
129 DeepSeek V3 (2025-03-24) 71.96% 69.32% 79.93%
130 Z.AI GLM 4.7 Flash 71.45% 69.68% 82.21%
131 Laguna XS 2.1 71.22% 67.05% 75.42%
132 Aion 3.0 Mini 71.10% 75.86% 83.69%
133 Mistral Small 4 (Reasoning) 70.72% 66.73% 79.48%
134 Mistral Small 3.2 24B 70.67% 63.87% 77.36%
135 Hermes 3 405B 69.68% 64.59% 80.80%
136 Ministral 3 8B 68.42% 59.53% 69.98%
137 Qwen 3 32B 68.27% 66.35% 79.37%
138 Ministral 8B 68.24% 63.20% 63.77%
139 Llama 3.1 70B 67.13% 61.45% 77.41%
140 Ministral 3 14B 66.73% 67.43% 70.45%
141 Gemini 2.5 Flash Lite 66.54% 65.19% 79.91%
142 Qwen 2.5 72B 66.25% 61.71% 73.17%
143 Gemma 3 27B 64.63% 61.51% 75.70%
144 WizardLM 2 8x22b 64.41% 60.41% 71.45%
145 GPT-4o Mini (temp=0) 63.47% 62.17% 76.86%
146 GPT-5.4 Nano (Reasoning, Low) 63.00% 64.43% 77.46%
147 GPT-4o Mini (temp=1) 62.34% 62.26% 77.82%
148 Nemotron 3 Nano 61.91% 65.05% 74.50%
149 Mistral Small 4 61.79% 61.67% 75.23%
150 ByteDance Seed 1.6 Flash 60.00% 63.50% 70.92%
151 Ministral 3 3B 57.49% 54.06% 65.02%
152 GPT-5.4 Nano 57.12% 58.53% 72.16%
153 Ministral 3B 56.95% 53.21% 59.25%
154 Arcee AI: Trinity Mini 56.36% 55.45% 67.68%
155 Cydonia 24B V4.1 55.78% 56.95% 72.68%
156 Hermes 3 70B 54.53% 56.20% 69.74%
157 Cohere Command R+ (Aug. 2024) 51.23% 51.60% 67.04%
158 GPT-4.1 Nano 47.26% 54.55% 69.90%
159 Gemma 3 4B 45.06% 52.86% 66.33%
160 Gemma 3 12B 40.06% 56.28% 76.07%
161 Mistral NeMO 37.43% 44.87% 63.80%