Comprehension

Subcategory of Language. 161 models scored.

Model Leaderboard

All models ranked by their Comprehension subcategory score.

# Model Comprehension Language Overall
1 GPT-5.6 Sol (Reasoning) 100.00% 99.93% 95.15%
2 Claude Opus 4.6 (Reasoning) 100.00% 96.12% 95.06%
3 Gemini 3.6 Flash (Reasoning) 100.00% 98.22% 94.90%
4 Qwen3.7 Max 100.00% 97.05% 94.55%
5 Grok 4.5 (Reasoning, High) 100.00% 99.82% 94.12%
6 Qwen3.6 Max Preview 100.00% 100.00% 93.72%
7 GPT-5.5 (Reasoning) 100.00% 99.69% 93.72%
8 Claude Sonnet 4.6 (Reasoning) 100.00% 97.58% 93.64%
9 Z.AI GLM 5.2 (Reasoning, High) 100.00% 99.82% 93.41%
10 Z.AI GLM 5 Turbo 100.00% 99.90% 93.29%
11 MoonshotAI: Kimi K3 (Reasoning, High) 100.00% 100.00% 92.99%
12 MoonshotAI: Kimi K2.6 100.00% 96.77% 92.57%
13 Claude Opus 4.7 (Reasoning) 100.00% 98.77% 92.53%
14 GPT-5.5 (Reasoning, Low) 100.00% 99.24% 92.51%
15 Claude Opus 4.6 100.00% 96.13% 92.31%
16 MoonshotAI: Kimi K3 (Reasoning, Low) 100.00% 99.90% 92.07%
17 Claude Opus 5 (Reasoning, Low) 100.00% 99.46% 92.06%
18 Claude Opus 5 (Reasoning) 100.00% 99.37% 91.15%
19 Qwen 3.5 397B A17B 100.00% 95.01% 91.09%
20 MoonshotAI: Kimi K2.5 100.00% 97.10% 90.86%
21 Thinking Machines Inkling (Reasoning) 100.00% 95.61% 90.78%
22 Claude Sonnet 4.6 100.00% 100.00% 90.66%
23 MiniMax M3 100.00% 94.71% 90.45%
24 Claude Sonnet 5 (Reasoning) 100.00% 99.04% 90.40%
25 Qwen 3.5 122B 100.00% 95.01% 90.32%
26 Claude Sonnet 5 (Reasoning, Low) 100.00% 98.06% 90.16%
27 Qwen 3.5 27B 100.00% 95.52% 90.05%
28 Claude Opus 5 100.00% 99.73% 89.97%
29 GPT-5.4 Mini (Reasoning) 100.00% 98.12% 89.82%
30 Qwen 3.5 Plus (2026-04-20) 100.00% 97.14% 89.79%
31 Claude Opus 4.5 100.00% 99.66% 89.60%
32 ByteDance Seed 1.6 100.00% 95.63% 89.59%
33 DeepSeek V4 Flash (Reasoning) 100.00% 94.76% 88.06%
34 Z.AI GLM 4.6 100.00% 96.60% 87.64%
35 Claude Opus 4 100.00% 93.01% 87.22%
36 Qwen 3.5 35B 100.00% 91.95% 87.01%
37 Aion 2.0 100.00% 96.17% 86.66%
38 MiniMax M2.7 100.00% 84.80% 86.23%
39 Qwen 3.5 Plus (2026-02-15) 100.00% 95.10% 86.17%
40 GPT-5.6 Luna 100.00% 99.33% 85.06%
41 Mistral Large 3 100.00% 92.02% 84.29%
42 ByteDance Seed 2.0 Lite 100.00% 96.80% 84.27%
43 DeepSeek-V2 Chat 100.00% 100.00% 84.09%
44 DeepSeek V3 (2024-12-26) 100.00% 87.88% 82.62%
45 Mistral Large 2 100.00% 85.22% 81.50%
46 Hermes 3 405B 100.00% 99.57% 80.80%
47 Laguna S 2.1 100.00% 97.91% 79.98%
48 DeepSeek V3 (2025-03-24) 100.00% 86.42% 79.93%
49 Ministral 3 3B 100.00% 68.10% 65.02%
50 Gemini 3.1 Pro (Preview) 95.00% 94.90% 94.08%
51 GPT-5.4 (Reasoning) 95.00% 94.90% 93.85%
52 Muse Spark 1.1 (Reasoning, Medium) 95.00% 97.50% 93.81%
53 Gemini 3.5 Flash (Reasoning) 95.00% 94.41% 93.35%
54 GPT-5.6 Terra (Reasoning) 95.00% 97.22% 92.49%
55 Claude Opus 4.8 (Reasoning) 95.00% 96.38% 92.33%
56 Claude Opus 4.8 (Reasoning, Low) 95.00% 96.31% 91.89%
57 Muse Spark 1.1 (Reasoning, Minimal) 95.00% 97.50% 91.43%
58 GPT-5 Mini 95.00% 96.49% 91.31%
59 Grok 4.3 (Reasoning) 95.00% 97.50% 90.99%
60 Grok 4.5 (Reasoning, Low) 95.00% 94.50% 90.94%
61 Grok 4.20 (Reasoning) 95.00% 96.61% 90.87%
62 GPT-5.6 Luna (Reasoning) 95.00% 96.67% 90.61%
63 Gemini 3 Flash (Preview, Reasoning) 95.00% 94.93% 89.93%
64 Z.AI GLM 5 95.00% 92.06% 89.60%
65 Gemma 4 26B (Reasoning) 95.00% 95.20% 89.02%
66 Claude Sonnet 4.5 95.00% 92.39% 87.54%
67 Claude Sonnet 5 95.00% 95.50% 87.34%
68 MiniMax M2.5 95.00% 96.05% 86.71%
69 Gemini 3.6 Flash (Reasoning, Minimal) 95.00% 97.50% 86.68%
70 Gemini 3.1 Flash Lite (Reasoning) 95.00% 96.70% 85.91%
71 Gemini 3.5 Flash (Reasoning, Minimal) 95.00% 97.50% 85.88%
72 Qwen 3.5 Flash 95.00% 91.94% 85.66%
73 Gemini 3.1 Flash Lite (Preview) 95.00% 94.98% 85.41%
74 Z.AI GLM 4.5 95.00% 97.33% 84.95%
75 GPT-OSS 120B 95.00% 97.18% 84.81%
76 Claude Haiku 4.5 95.00% 91.84% 83.36%
77 DeepSeek V3.1 95.00% 96.87% 82.35%
78 Z.AI GLM 4.7 Flash 95.00% 87.67% 82.21%
79 Z.AI GLM 4.5 Air 95.00% 95.05% 80.74%
80 Cydonia 24B V4.1 95.00% 72.49% 72.68%
81 WizardLM 2 8x22b 95.00% 78.05% 71.45%
82 Mistral NeMO 95.00% 80.80% 63.80%
83 GPT-5.6 Sol 90.00% 94.60% 90.76%
84 GPT-5.1 90.00% 93.64% 90.73%
85 GPT-5.5 90.00% 94.15% 89.37%
86 Gemini 2.5 Pro 90.00% 92.57% 88.44%
87 Qwen 3.6 27B 90.00% 89.01% 88.33%
88 Qwen 3.6 35B 90.00% 93.56% 87.66%
89 Claude Sonnet 4 90.00% 91.31% 87.64%
90 GPT-4.1 90.00% 93.91% 86.82%
91 ByteDance Seed 2.0 Mini 90.00% 90.12% 85.69%
92 Gemini 3 Flash (Preview) 90.00% 95.00% 85.47%
93 Gemma 4 26B 90.00% 92.02% 84.89%
94 Qwen 3.5 9B 90.00% 88.18% 84.05%
95 Aion 3.0 Mini 90.00% 93.68% 83.69%
96 DeepSeek V4 Flash 90.00% 88.50% 82.02%
97 Qwen 3 32B 90.00% 84.61% 79.37%
98 Z.AI GLM 5.1 85.00% 91.57% 93.74%
99 GPT-5 85.00% 91.50% 91.48%
100 GPT-5.2 85.00% 91.19% 89.45%
101 Xiaomi MIMO v2.5 Pro 85.00% 87.69% 86.05%
102 Gemini 3.1 Flash Lite 85.00% 90.90% 85.09%
103 GPT-5.4 (Reasoning, Low) 85.00% 90.79% 90.91%
104 Claude Opus 4.7 85.00% 92.32% 89.90%
105 Qwen 3.6 Flash 85.00% 89.33% 89.31%
106 DeepSeek V4 Pro (Reasoning) 85.00% 88.51% 89.28%
107 GPT-5.6 Terra 85.00% 91.87% 88.23%
108 GPT-5.4 Mini (Reasoning, Low) 85.00% 92.45% 83.57%
109 Aion 3.0 80.00% 86.85% 88.78%
110 Z.AI GLM 4.7 80.00% 85.46% 87.67%
111 Gemini 3.5 Flash Lite (Reasoning, Minimal) 80.00% 87.22% 84.45%
112 Gemini 3.5 Flash Lite (Reasoning) 80.00% 87.69% 84.34%
113 DeepSeek V3.2 80.00% 85.01% 82.22%
114 GPT-4.1 Mini 80.00% 89.64% 81.40%
115 GPT-5.4 Mini 80.00% 88.75% 80.45%
116 Gemini 2.5 Flash Lite 80.00% 82.75% 79.91%
117 Nemotron 3 Nano 80.00% 87.63% 74.50%
118 Gemma 4 31B (Reasoning) 75.00% 83.82% 89.64%
119 Gemini 2.5 Flash (Reasoning) 75.00% 86.06% 84.14%
120 Inception Mercury 2 75.00% 87.32% 81.99%
121 Gemini 2.5 Flash 75.00% 86.23% 80.61%
122 Qwen3 235B A22B Instruct 2507 75.00% 60.83% 78.07%
123 Grok 4.3 75.00% 84.74% 78.00%
124 Llama 3.1 70B 75.00% 80.18% 77.41%
125 Mistral Small 3.2 24B 75.00% 72.77% 77.36%
126 Hermes 3 70B 75.00% 81.66% 69.74%
127 DeepSeek V4 Pro 70.00% 72.80% 82.05%
128 GPT-5.4 Nano (Reasoning) 70.00% 83.99% 80.02%
129 Writer: Palmyra X5 70.00% 56.58% 78.11%
130 GPT-5.4 Nano (Reasoning, Low) 70.00% 81.87% 77.46%
131 Gemma 3 12B 70.00% 80.10% 76.07%
132 Qwen 2.5 72B 70.00% 68.95% 73.17%
133 GPT-5.4 Nano 70.00% 80.82% 72.16%
134 Gemma 3 4B 70.00% 72.28% 66.33%
135 GPT-5.4 65.00% 81.49% 84.31%
136 Gemini 2.5 Flash Lite (Reasoning) 65.00% 74.36% 83.10%
137 Nemotron 3 Super 65.00% 81.41% 81.69%
138 GPT-4o, Aug. 6th (temp=1) 65.00% 82.21% 81.28%
139 Grok 4.20 65.00% 78.86% 81.21%
140 Gemma 3 27B 65.00% 77.21% 75.70%
141 GPT-4.1 Nano 65.00% 78.95% 69.90%
142 Xiaomi MIMO v2.5 65.00% 76.33% 83.95%
143 Thinking Machines Inkling 60.00% 76.49% 73.96%
144 Arcee AI: Trinity Mini 60.00% 70.59% 67.68%
145 o4 Mini High 60.00% 79.76% 88.78%
146 o4 Mini 60.00% 80.00% 86.56%
147 Cohere Command R+ (Aug. 2024) 60.00% 66.58% 67.04%
148 GPT-5 Nano 55.00% 77.18% 80.16%
149 GPT-4o Mini (temp=1) 55.00% 77.50% 77.82%
150 Mistral Small 4 55.00% 51.96% 75.23%
151 Ministral 8B 55.00% 53.91% 63.77%
152 Gemma 4 31B 50.00% 75.00% 85.23%
153 GPT-4o, Aug. 6th (temp=0) 50.00% 75.00% 82.18%
154 Mistral Small 4 (Reasoning) 50.00% 60.53% 79.48%
155 GPT-4o Mini (temp=0) 50.00% 75.00% 76.86%
156 Mistral Medium 3.1 50.00% 49.50% 76.08%
157 Ministral 3 14B 50.00% 30.00% 70.45%
158 Ministral 3 8B 50.00% 48.96% 69.98%
159 ByteDance Seed 1.6 Flash 40.00% 61.23% 70.92%
160 Laguna XS 2.1 35.00% 64.47% 75.42%
161 Ministral 3B 25.00% 42.25% 59.25%