Word Counting

Subcategory of Utility. 161 models scored.

Model Leaderboard

All models ranked by their Word Counting subcategory score.

# Model Word Counting Utility Overall
1 Gemini 3.1 Pro (Preview) 99.56% 99.91% 94.08%
2 GPT-5 Mini 97.93% 98.39% 91.31%
3 Qwen3.7 Max 97.69% 99.54% 94.55%
4 Claude Opus 4.8 (Reasoning, Low) 97.54% 98.00% 91.89%
5 GPT-5.6 Sol (Reasoning) 97.53% 97.51% 95.15%
6 Claude Opus 4.8 (Reasoning) 97.26% 99.26% 92.33%
7 Muse Spark 1.1 (Reasoning, Medium) 96.99% 99.40% 93.81%
8 Gemini 3.5 Flash (Reasoning) 96.80% 98.86% 93.35%
9 GPT-5 96.13% 93.53% 91.48%
10 o4 Mini High 95.97% 98.67% 88.78%
11 Z.AI GLM 5 Turbo 95.82% 96.36% 93.29%
12 Claude Opus 4.6 (Reasoning) 94.65% 98.93% 95.06%
13 MiniMax M2.7 94.05% 95.50% 86.23%
14 Inception Mercury 2 93.76% 92.86% 81.99%
15 Nemotron 3 Super 93.51% 95.29% 81.69%
16 Gemini 3.6 Flash (Reasoning) 92.82% 98.56% 94.90%
17 Z.AI GLM 5.1 92.55% 97.51% 93.74%
18 Muse Spark 1.1 (Reasoning, Minimal) 91.92% 98.38% 91.43%
19 Qwen3.6 Max Preview 91.71% 98.34% 93.72%
20 Grok 4.3 (Reasoning) 91.18% 92.94% 90.99%
21 o4 Mini 90.72% 96.31% 86.56%
22 MoonshotAI: Kimi K2.6 90.45% 97.42% 92.57%
23 Claude Sonnet 4.6 (Reasoning) 90.42% 97.88% 93.64%
24 Claude Opus 5 (Reasoning, Low) 90.25% 92.75% 92.06%
25 Gemini 3.1 Flash Lite (Reasoning) 89.98% 92.32% 85.91%
26 Claude Opus 5 (Reasoning) 89.97% 93.39% 91.15%
27 Z.AI GLM 5.2 (Reasoning, High) 89.64% 96.31% 93.41%
28 Claude Opus 4.7 (Reasoning) 89.46% 97.87% 92.53%
29 Gemini 3.1 Flash Lite (Preview) 89.38% 94.00% 85.41%
30 GPT-OSS 120B 87.79% 92.03% 84.81%
31 Gemini 3.1 Flash Lite 87.68% 92.77% 85.09%
32 Qwen 3.5 397B A17B 87.52% 97.50% 91.09%
33 Claude Opus 4.7 87.30% 95.77% 89.90%
34 Nemotron 3 Nano 86.70% 86.00% 74.50%
35 GPT-5 Nano 86.54% 93.91% 80.16%
36 Grok 4.5 (Reasoning, High) 86.29% 86.69% 94.12%
37 MiniMax M2.5 86.03% 90.42% 86.71%
38 Gemini 3 Flash (Preview, Reasoning) 86.00% 97.20% 89.93%
39 MoonshotAI: Kimi K3 (Reasoning, High) 85.93% 96.19% 92.99%
40 Qwen 3.5 27B 85.82% 95.67% 90.05%
41 GPT-5.1 85.32% 95.33% 90.73%
42 GPT-5.4 Nano (Reasoning) 84.86% 93.34% 80.02%
43 Qwen 3.5 Plus (2026-04-20) 84.60% 96.42% 89.79%
44 GPT-5.4 (Reasoning) 84.46% 96.89% 93.85%
45 GPT-5.2 84.32% 96.22% 89.45%
46 Gemma 4 31B (Reasoning) 84.12% 96.32% 89.64%
47 Gemini 3 Flash (Preview) 83.97% 86.39% 85.47%
48 Claude Opus 4.6 83.65% 90.72% 92.31%
49 Gemma 4 26B (Reasoning) 83.45% 95.69% 89.02%
50 GPT-5.6 Luna (Reasoning) 83.38% 92.18% 90.61%
51 MoonshotAI: Kimi K2.5 83.17% 96.63% 90.86%
52 GPT-5.5 (Reasoning) 83.08% 96.60% 93.72%
53 Qwen 3.6 35B 83.01% 96.20% 87.66%
54 GPT-4o Mini (temp=0) 82.65% 81.43% 76.86%
55 Qwen 3.6 Flash 82.44% 96.09% 89.31%
56 MiniMax M3 82.35% 93.59% 90.45%
57 Qwen 3.5 35B 82.08% 96.42% 87.01%
58 Qwen 3.5 122B 81.81% 96.36% 90.32%
59 GPT-5.5 (Reasoning, Low) 81.80% 96.36% 92.51%
60 GPT-5.4 Mini (Reasoning) 81.72% 94.44% 89.82%
61 GPT-4.1 81.33% 90.57% 86.82%
62 MoonshotAI: Kimi K3 (Reasoning, Low) 81.21% 94.04% 92.07%
63 Qwen 3.6 27B 81.10% 94.32% 88.33%
64 GPT-5.6 Terra (Reasoning) 80.91% 95.58% 92.49%
65 Claude Opus 4.5 80.83% 89.84% 89.60%
66 Qwen 3.5 Flash 80.57% 96.11% 85.66%
67 Z.AI GLM 4.7 78.57% 94.31% 87.67%
68 GPT-4o Mini (temp=1) 78.18% 82.16% 77.82%
69 GPT-4o, Aug. 6th (temp=1) 77.45% 82.44% 81.28%
70 Claude Sonnet 5 (Reasoning) 77.27% 92.87% 90.40%
71 Claude Opus 5 77.05% 90.50% 89.97%
72 GPT-4o, Aug. 6th (temp=0) 77.04% 82.11% 82.18%
73 Thinking Machines Inkling (Reasoning) 76.89% 93.19% 90.78%
74 GPT-5.4 (Reasoning, Low) 76.62% 95.32% 90.91%
75 Claude Sonnet 5 (Reasoning, Low) 75.96% 93.53% 90.16%
76 Grok 4.20 (Reasoning) 75.57% 92.61% 90.87%
77 Z.AI GLM 5 75.55% 94.11% 89.60%
78 DeepSeek V4 Pro (Reasoning) 75.21% 93.24% 89.28%
79 GPT-5.4 Mini (Reasoning, Low) 75.01% 88.49% 83.57%
80 Qwen 3.5 9B 74.59% 94.02% 84.05%
81 Claude Opus 4 74.37% 88.81% 87.22%
82 ByteDance Seed 1.6 74.14% 90.83% 89.59%
83 ByteDance Seed 2.0 Mini 73.92% 91.88% 85.69%
84 Aion 3.0 73.83% 93.57% 88.78%
85 ByteDance Seed 2.0 Lite 73.68% 92.23% 84.27%
86 GPT-5.4 Nano (Reasoning, Low) 73.42% 91.42% 77.46%
87 Grok 4.5 (Reasoning, Low) 73.36% 82.63% 90.94%
88 Gemini 3.5 Flash (Reasoning, Minimal) 73.28% 83.90% 85.88%
89 Claude Sonnet 4.6 71.94% 88.52% 90.66%
90 GPT-5.5 71.88% 81.88% 89.37%
91 Gemini 3.6 Flash (Reasoning, Minimal) 70.95% 84.77% 86.68%
92 GPT-5.6 Sol 69.68% 80.44% 90.76%
93 Z.AI GLM 4.7 Flash 68.93% 88.98% 82.21%
94 GPT-4.1 Mini 66.59% 82.30% 81.40%
95 Gemini 2.5 Pro 66.47% 92.18% 88.44%
96 Gemma 4 26B 66.29% 83.17% 84.89%
97 GPT-5.4 Mini 66.13% 79.37% 80.45%
98 Aion 2.0 65.48% 90.91% 86.66%
99 Aion 3.0 Mini 65.24% 90.76% 83.69%
100 GPT-4.1 Nano 64.57% 68.45% 69.90%
101 Gemma 4 31B 64.43% 86.69% 85.23%
102 Mistral Medium 3.1 64.40% 80.13% 76.08%
103 GPT-5.4 64.23% 81.95% 84.31%
104 Grok 4.20 62.89% 84.11% 81.21%
105 Claude Sonnet 5 59.02% 88.57% 87.34%
106 Claude Sonnet 4.5 58.93% 83.78% 87.54%
107 GPT-5.6 Terra 58.47% 77.09% 88.23%
108 DeepSeek V3 (2025-03-24) 58.32% 80.62% 79.93%
109 DeepSeek V3 (2024-12-26) 58.30% 81.87% 82.62%
110 Llama 3.1 70B 56.62% 81.03% 77.41%
111 Gemini 3.5 Flash Lite (Reasoning, Minimal) 56.05% 84.58% 84.45%
112 Mistral Small 4 (Reasoning) 56.00% 85.61% 79.48%
113 Gemini 2.5 Flash Lite (Reasoning) 55.13% 89.63% 83.10%
114 DeepSeek V4 Flash 54.98% 83.26% 82.02%
115 Gemini 3.5 Flash Lite (Reasoning) 54.88% 85.46% 84.34%
116 Xiaomi MIMO v2.5 54.18% 81.15% 83.95%
117 Claude Sonnet 4 53.92% 84.02% 87.64%
118 Gemini 2.5 Flash Lite 53.37% 80.14% 79.91%
119 Mistral Large 3 52.60% 84.91% 84.29%
120 Xiaomi MIMO v2.5 Pro 52.55% 82.62% 86.05%
121 Claude Haiku 4.5 51.60% 72.48% 83.36%
122 Qwen 2.5 72B 51.43% 76.43% 73.17%
123 Hermes 3 405B 51.42% 69.02% 80.80%
124 Laguna XS 2.1 51.03% 78.98% 75.42%
125 GPT-5.6 Luna 50.02% 75.00% 85.06%
126 DeepSeek V4 Flash (Reasoning) 49.57% 87.53% 88.06%
127 ByteDance Seed 1.6 Flash 48.55% 84.16% 70.92%
128 GPT-5.4 Nano 47.90% 78.57% 72.16%
129 Ministral 3 14B 47.57% 79.03% 70.45%
130 Z.AI GLM 4.6 47.21% 88.58% 87.64%
131 DeepSeek V3.1 47.10% 76.65% 82.35%
132 Gemma 3 12B 46.84% 79.28% 76.07%
133 Mistral Small 4 46.07% 78.28% 75.23%
134 Gemini 2.5 Flash (Reasoning) 46.02% 82.25% 84.14%
135 DeepSeek V3.2 45.81% 81.58% 82.22%
136 Gemma 3 27B 45.66% 76.82% 75.70%
137 DeepSeek V4 Pro 45.34% 77.57% 82.05%
138 Qwen 3.5 Plus (2026-02-15) 44.24% 86.65% 86.17%
139 Mistral Small 3.2 24B 42.38% 73.17% 77.36%
140 DeepSeek-V2 Chat 41.72% 83.82% 84.09%
141 Qwen3 235B A22B Instruct 2507 40.15% 83.15% 78.07%
142 Gemini 2.5 Flash 38.47% 61.45% 80.61%
143 Z.AI GLM 4.5 38.11% 79.19% 84.95%
144 Ministral 3 8B 38.01% 74.43% 69.98%
145 Ministral 3 3B 37.04% 72.38% 65.02%
146 Cydonia 24B V4.1 36.47% 69.32% 72.68%
147 Laguna S 2.1 35.95% 81.67% 79.98%
148 Writer: Palmyra X5 35.61% 79.71% 78.11%
149 Cohere Command R+ (Aug. 2024) 35.13% 59.51% 67.04%
150 Z.AI GLM 4.5 Air 34.68% 76.57% 80.74%
151 Grok 4.3 33.50% 66.41% 78.00%
152 Qwen 3 32B 31.96% 81.66% 79.37%
153 Hermes 3 70B 28.43% 61.15% 69.74%
154 Thinking Machines Inkling 27.40% 65.97% 73.96%
155 Arcee AI: Trinity Mini 26.25% 59.94% 67.68%
156 Gemma 3 4B 22.12% 60.30% 66.33%
157 Ministral 8B 21.93% 46.82% 63.77%
158 Mistral Large 2 21.18% 69.19% 81.50%
159 WizardLM 2 8x22b 20.73% 67.14% 71.45%
160 Ministral 3B 17.87% 49.17% 59.25%
161 Mistral NeMO 15.70% 51.55% 63.80%