Sentence Counting

Subcategory of Utility. 161 models scored.

Model Leaderboard

All models ranked by their Sentence Counting subcategory score.

# Model Sentence Counting Utility Overall
1 Gemini 3.6 Flash (Reasoning) 100.00% 98.56% 94.90%
2 Qwen3.7 Max 100.00% 99.54% 94.55%
3 Gemini 3.1 Pro (Preview) 100.00% 99.91% 94.08%
4 Muse Spark 1.1 (Reasoning, Medium) 100.00% 99.40% 93.81%
5 Z.AI GLM 5.1 100.00% 97.51% 93.74%
6 Qwen3.6 Max Preview 100.00% 98.34% 93.72%
7 Gemini 3.5 Flash (Reasoning) 100.00% 98.86% 93.35%
8 MoonshotAI: Kimi K3 (Reasoning, High) 100.00% 96.19% 92.99%
9 GPT-5.5 (Reasoning, Low) 100.00% 96.36% 92.51%
10 GPT-5 100.00% 93.53% 91.48%
11 Muse Spark 1.1 (Reasoning, Minimal) 100.00% 98.38% 91.43%
12 Qwen 3.5 397B A17B 100.00% 97.50% 91.09%
13 Grok 4.3 (Reasoning) 100.00% 92.94% 90.99%
14 GPT-5.4 (Reasoning, Low) 100.00% 95.32% 90.91%
15 GPT-5.6 Sol 100.00% 80.44% 90.76%
16 Qwen 3.5 122B 100.00% 96.36% 90.32%
17 Qwen 3.5 Plus (2026-04-20) 100.00% 96.42% 89.79%
18 Z.AI GLM 5 100.00% 94.11% 89.60%
19 Qwen 3.6 Flash 100.00% 96.09% 89.31%
20 Gemma 4 26B (Reasoning) 100.00% 95.69% 89.02%
21 Qwen 3.6 27B 100.00% 94.32% 88.33%
22 Qwen 3.5 35B 100.00% 96.42% 87.01%
23 Qwen 3.5 Plus (2026-02-15) 100.00% 86.65% 86.17%
24 Qwen 3.5 Flash 100.00% 96.11% 85.66%
25 GPT-5.4 100.00% 81.95% 84.31%
26 Qwen 3.5 9B 100.00% 94.02% 84.05%
27 GPT-5.4 (Reasoning) 100.00% 96.89% 93.85%
28 MoonshotAI: Kimi K2.6 100.00% 97.42% 92.57%
29 GPT-5 Mini 100.00% 98.39% 91.31%
30 MoonshotAI: Kimi K2.5 100.00% 96.63% 90.86%
31 GPT-5.6 Luna (Reasoning) 100.00% 92.18% 90.61%
32 ByteDance Seed 1.6 100.00% 90.83% 89.59%
33 GPT-5.5 100.00% 81.88% 89.37%
34 GPT-5.6 Terra 100.00% 77.09% 88.23%
35 GPT-5.6 Sol (Reasoning) 100.00% 97.51% 95.15%
36 Z.AI GLM 5 Turbo 100.00% 96.36% 93.29%
37 GPT-5.6 Terra (Reasoning) 100.00% 95.58% 92.49%
38 MoonshotAI: Kimi K3 (Reasoning, Low) 100.00% 94.04% 92.07%
39 Gemini 3 Flash (Preview, Reasoning) 100.00% 97.20% 89.93%
40 GPT-5.4 Mini (Reasoning) 100.00% 94.44% 89.82%
41 Claude Opus 4.6 (Reasoning) 100.00% 98.93% 95.06%
42 Claude Opus 5 (Reasoning, Low) 100.00% 92.75% 92.06%
43 Grok 4.20 (Reasoning) 100.00% 92.61% 90.87%
44 Z.AI GLM 4.7 Flash 100.00% 88.98% 82.21%
45 Z.AI GLM 4.7 99.99% 94.31% 87.67%
46 Gemma 4 31B (Reasoning) 99.99% 96.32% 89.64%
47 Gemma 4 31B 99.99% 86.69% 85.23%
48 GPT-5.6 Luna 99.99% 75.00% 85.06%
49 Claude Opus 5 (Reasoning) 99.99% 93.39% 91.15%
50 Gemini 3 Flash (Preview) 99.99% 86.39% 85.47%
51 Mistral Small 3.2 24B 99.97% 73.17% 77.36%
52 ByteDance Seed 2.0 Lite 99.96% 92.23% 84.27%
53 Claude Sonnet 4.6 (Reasoning) 99.96% 97.88% 93.64%
54 ByteDance Seed 2.0 Mini 99.96% 91.88% 85.69%
55 Mistral Large 3 99.95% 84.91% 84.29%
56 GPT-5.5 (Reasoning) 99.93% 96.60% 93.72%
57 Claude Opus 4.6 99.93% 90.72% 92.31%
58 GPT-5.4 Mini (Reasoning, Low) 99.92% 88.49% 83.57%
59 Claude Opus 4.7 (Reasoning) 99.91% 97.87% 92.53%
60 o4 Mini High 99.90% 98.67% 88.78%
61 GPT-5.1 99.80% 95.33% 90.73%
62 GPT-5.2 99.77% 96.22% 89.45%
63 Claude Opus 4.7 99.57% 95.77% 89.90%
64 DeepSeek V4 Pro (Reasoning) 99.51% 93.24% 89.28%
65 Gemini 2.5 Pro 99.43% 92.18% 88.44%
66 DeepSeek V4 Flash 99.32% 83.26% 82.02%
67 Grok 4.20 99.17% 84.11% 81.21%
68 Claude Opus 4.8 (Reasoning) 99.07% 99.26% 92.33%
69 Gemini 3.1 Flash Lite (Preview) 98.60% 94.00% 85.41%
70 Claude Opus 4.8 (Reasoning, Low) 98.48% 98.00% 91.89%
71 o4 Mini 98.35% 96.31% 86.56%
72 GPT-5.4 Mini 98.23% 79.37% 80.45%
73 Qwen 3.6 35B 98.00% 96.20% 87.66%
74 Aion 3.0 97.99% 93.57% 88.78%
75 GPT-5 Nano 97.99% 93.91% 80.16%
76 Grok 4.5 (Reasoning, High) 97.97% 86.69% 94.12%
77 Nemotron 3 Super 97.96% 95.29% 81.69%
78 DeepSeek V3 (2025-03-24) 97.96% 80.62% 79.93%
79 Z.AI GLM 5.2 (Reasoning, High) 97.93% 96.31% 93.41%
80 DeepSeek-V2 Chat 97.87% 83.82% 84.09%
81 Z.AI GLM 4.6 97.70% 88.58% 87.64%
82 Mistral Medium 3.1 97.23% 80.13% 76.08%
83 Inception Mercury 2 97.02% 92.86% 81.99%
84 Claude Opus 5 96.97% 90.50% 89.97%
85 GPT-OSS 120B 96.88% 92.03% 84.81%
86 Gemini 2.5 Flash Lite (Reasoning) 96.54% 89.63% 83.10%
87 Aion 3.0 Mini 96.54% 90.76% 83.69%
88 Mistral Small 4 (Reasoning) 96.06% 85.61% 79.48%
89 Claude Opus 4.5 95.88% 89.84% 89.60%
90 GPT-5.4 Nano (Reasoning) 95.83% 93.34% 80.02%
91 Qwen 3 32B 95.82% 81.66% 79.37%
92 Grok 4.5 (Reasoning, Low) 95.81% 82.63% 90.94%
93 MiniMax M2.7 95.47% 95.50% 86.23%
94 Gemma 3 27B 95.44% 76.82% 75.70%
95 Gemma 3 4B 95.04% 60.30% 66.33%
96 Thinking Machines Inkling (Reasoning) 94.91% 93.19% 90.78%
97 Gemini 3.1 Flash Lite 94.68% 92.77% 85.09%
98 Claude Sonnet 4.6 94.66% 88.52% 90.66%
99 GPT-5.4 Nano 93.46% 78.57% 72.16%
100 GPT-5.4 Nano (Reasoning, Low) 93.19% 91.42% 77.46%
101 DeepSeek V4 Flash (Reasoning) 93.07% 87.53% 88.06%
102 Nemotron 3 Nano 92.81% 86.00% 74.50%
103 MiniMax M3 92.60% 93.59% 90.45%
104 Qwen 3.5 27B 92.55% 95.67% 90.05%
105 Ministral 3 14B 92.10% 79.03% 70.45%
106 DeepSeek V3.2 92.09% 81.58% 82.22%
107 Claude Sonnet 4.5 91.98% 83.78% 87.54%
108 Claude Sonnet 5 (Reasoning, Low) 91.69% 93.53% 90.16%
109 Gemini 3.5 Flash Lite (Reasoning) 90.94% 85.46% 84.34%
110 Gemini 3.1 Flash Lite (Reasoning) 90.14% 92.32% 85.91%
111 DeepSeek V4 Pro 90.01% 77.57% 82.05%
112 Gemma 4 26B 89.58% 83.17% 84.89%
113 Grok 4.3 89.39% 66.41% 78.00%
114 Aion 2.0 89.10% 90.91% 86.66%
115 DeepSeek V3 (2024-12-26) 88.56% 81.87% 82.62%
116 Claude Sonnet 5 (Reasoning) 88.06% 92.87% 90.40%
117 Gemini 3.6 Flash (Reasoning, Minimal) 87.91% 84.77% 86.68%
118 Gemini 3.5 Flash Lite (Reasoning, Minimal) 87.84% 84.58% 84.45%
119 Xiaomi MIMO v2.5 86.72% 81.15% 83.95%
120 GPT-4.1 86.01% 90.57% 86.82%
121 Mistral Small 4 85.82% 78.28% 75.23%
122 Cydonia 24B V4.1 85.28% 69.32% 72.68%
123 Gemini 2.5 Flash (Reasoning) 85.21% 82.25% 84.14%
124 Claude Sonnet 5 84.82% 88.57% 87.34%
125 Claude Sonnet 4 84.17% 84.02% 87.64%
126 Z.AI GLM 4.5 Air 83.68% 76.57% 80.74%
127 Xiaomi MIMO v2.5 Pro 83.55% 82.62% 86.05%
128 DeepSeek V3.1 83.32% 76.65% 82.35%
129 Laguna S 2.1 82.39% 81.67% 79.98%
130 ByteDance Seed 1.6 Flash 82.27% 84.16% 70.92%
131 Qwen3 235B A22B Instruct 2507 80.58% 83.15% 78.07%
132 Llama 3.1 70B 80.53% 81.03% 77.41%
133 Claude Opus 4 80.19% 88.81% 87.22%
134 Gemma 3 12B 80.06% 79.28% 76.07%
135 Hermes 3 405B 79.99% 69.02% 80.80%
136 Writer: Palmyra X5 79.93% 79.71% 78.11%
137 GPT-4o Mini (temp=1) 79.62% 82.16% 77.82%
138 GPT-4o Mini (temp=0) 79.49% 81.43% 76.86%
139 GPT-4.1 Mini 79.41% 82.30% 81.40%
140 Gemini 3.5 Flash (Reasoning, Minimal) 79.24% 83.90% 85.88%
141 MiniMax M2.5 75.58% 90.42% 86.71%
142 GPT-4.1 Nano 75.17% 68.45% 69.90%
143 Ministral 3 3B 74.85% 72.38% 65.02%
144 Z.AI GLM 4.5 74.82% 79.19% 84.95%
145 Laguna XS 2.1 74.37% 78.98% 75.42%
146 GPT-4o, Aug. 6th (temp=1) 74.24% 82.44% 81.28%
147 Ministral 3 8B 74.12% 74.43% 69.98%
148 GPT-4o, Aug. 6th (temp=0) 74.00% 82.11% 82.18%
149 Gemini 2.5 Flash Lite 73.32% 80.14% 79.91%
150 WizardLM 2 8x22b 71.48% 67.14% 71.45%
151 Claude Haiku 4.5 70.28% 72.48% 83.36%
152 Thinking Machines Inkling 69.78% 65.97% 73.96%
153 Qwen 2.5 72B 66.70% 76.43% 73.17%
154 Gemini 2.5 Flash 64.79% 61.45% 80.61%
155 Ministral 3B 62.17% 49.17% 59.25%
156 Cohere Command R+ (Aug. 2024) 60.43% 59.51% 67.04%
157 Ministral 8B 60.35% 46.82% 63.77%
158 Mistral Large 2 58.78% 69.19% 81.50%
159 Hermes 3 70B 58.14% 61.15% 69.74%
160 Mistral NeMO 47.57% 51.55% 63.80%
161 Arcee AI: Trinity Mini 43.97% 59.94% 67.68%