Constraint Adherence

Subcategory of Rule Following. 161 models scored.

Model Leaderboard

All models ranked by their Constraint Adherence subcategory score.

# Model Constraint Adherence Rule Following Overall
1 Qwen3.7 Max 95.76% 95.76% 94.55%
2 Gemini 3.5 Flash (Reasoning) 92.04% 92.04% 93.35%
3 Gemini 3.1 Pro (Preview) 91.21% 91.21% 94.08%
4 Gemini 3.6 Flash (Reasoning) 90.57% 90.57% 94.90%
5 Claude Opus 4.6 (Reasoning) 89.78% 89.78% 95.06%
6 Z.AI GLM 5.1 88.41% 88.41% 93.74%
7 Grok 4.5 (Reasoning, High) 86.79% 86.79% 94.12%
8 Z.AI GLM 5 Turbo 86.78% 86.78% 93.29%
9 GPT-5.6 Sol (Reasoning) 85.88% 85.88% 95.15%
10 Claude Sonnet 4.6 (Reasoning) 85.73% 85.73% 93.64%
11 Z.AI GLM 5.2 (Reasoning, High) 85.18% 85.18% 93.41%
12 Gemma 4 31B (Reasoning) 85.00% 85.00% 89.64%
13 Claude Opus 4.6 83.11% 83.11% 92.31%
14 Grok 4.3 (Reasoning) 82.80% 82.80% 90.99%
15 Qwen3.6 Max Preview 82.79% 82.79% 93.72%
16 Claude Sonnet 4.6 82.50% 82.50% 90.66%
17 Grok 4.20 (Reasoning) 82.04% 82.04% 90.87%
18 Claude Sonnet 4 81.52% 81.52% 87.64%
19 Muse Spark 1.1 (Reasoning, Medium) 80.48% 80.48% 93.81%
20 Qwen 3.5 122B 80.00% 80.00% 90.32%
21 GPT-5.5 (Reasoning) 79.40% 79.40% 93.72%
22 Qwen 3.5 397B A17B 79.39% 79.39% 91.09%
23 GPT-5.4 (Reasoning) 79.29% 79.29% 93.85%
24 ByteDance Seed 1.6 77.71% 77.71% 89.59%
25 Qwen 3.6 35B 77.34% 77.34% 87.66%
26 GPT-5 77.13% 77.13% 91.48%
27 MoonshotAI: Kimi K2.6 76.94% 76.94% 92.57%
28 GPT-5.5 (Reasoning, Low) 76.90% 76.90% 92.51%
29 Claude Sonnet 4.5 76.80% 76.80% 87.54%
30 Thinking Machines Inkling (Reasoning) 76.65% 76.65% 90.78%
31 Grok 4.5 (Reasoning, Low) 76.44% 76.44% 90.94%
32 GPT-5 Mini 76.44% 76.44% 91.31%
33 Qwen 3.5 27B 76.04% 76.04% 90.05%
34 MoonshotAI: Kimi K3 (Reasoning, High) 75.43% 75.43% 92.99%
35 Gemma 4 26B (Reasoning) 74.75% 74.75% 89.02%
36 Gemini 3 Flash (Preview, Reasoning) 74.48% 74.48% 89.93%
37 GPT-5.6 Sol 74.47% 74.47% 90.76%
38 Claude Sonnet 5 74.36% 74.36% 87.34%
39 GPT-4o, Aug. 6th (temp=0) 74.19% 74.19% 82.18%
40 GPT-5.1 74.05% 74.05% 90.73%
41 Claude Opus 4.7 (Reasoning) 74.04% 74.04% 92.53%
42 GPT-5.6 Terra (Reasoning) 72.99% 72.99% 92.49%
43 GPT-5.6 Terra 72.82% 72.82% 88.23%
44 DeepSeek V4 Pro (Reasoning) 72.74% 72.74% 89.28%
45 Gemma 4 31B 72.72% 72.72% 85.23%
46 o4 Mini High 72.70% 72.70% 88.78%
47 Claude Opus 4.5 72.61% 72.61% 89.60%
48 Claude Opus 5 (Reasoning, Low) 72.36% 72.36% 92.06%
49 GPT-5.5 72.34% 72.34% 89.37%
50 MoonshotAI: Kimi K2.5 72.03% 72.03% 90.86%
51 Muse Spark 1.1 (Reasoning, Minimal) 71.80% 71.80% 91.43%
52 Gemma 4 26B 71.75% 71.75% 84.89%
53 Qwen 3.6 Flash 71.50% 71.50% 89.31%
54 Qwen 3.6 27B 71.37% 71.37% 88.33%
55 MoonshotAI: Kimi K3 (Reasoning, Low) 71.20% 71.20% 92.07%
56 Claude Opus 4.8 (Reasoning, Low) 70.56% 70.56% 91.89%
57 Claude Opus 4 70.37% 70.37% 87.22%
58 Claude Haiku 4.5 70.35% 70.35% 83.36%
59 Claude Opus 4.8 (Reasoning) 70.27% 70.27% 92.33%
60 GPT-5.4 (Reasoning, Low) 70.02% 70.02% 90.91%
61 MiniMax M3 69.18% 69.18% 90.45%
62 Z.AI GLM 4.7 69.16% 69.16% 87.67%
63 Claude Opus 5 (Reasoning) 69.11% 69.11% 91.15%
64 MiniMax M2.7 68.90% 68.90% 86.23%
65 Aion 3.0 68.80% 68.80% 88.78%
66 DeepSeek-V2 Chat 68.78% 68.78% 84.09%
67 Claude Sonnet 5 (Reasoning) 68.34% 68.34% 90.40%
68 Claude Opus 4.7 68.08% 68.08% 89.90%
69 DeepSeek V3 (2025-03-24) 67.94% 67.94% 79.93%
70 GPT-4o, Aug. 6th (temp=1) 67.91% 67.91% 81.28%
71 Z.AI GLM 5 67.78% 67.78% 89.60%
72 Qwen 3.5 Plus (2026-04-20) 67.53% 67.53% 89.79%
73 Qwen 3.5 35B 67.42% 67.42% 87.01%
74 Writer: Palmyra X5 67.19% 67.19% 78.11%
75 GPT-5.2 67.10% 67.10% 89.45%
76 Gemini 2.5 Flash Lite (Reasoning) 66.81% 66.81% 83.10%
77 GPT-4.1 66.78% 66.78% 86.82%
78 Claude Sonnet 5 (Reasoning, Low) 66.62% 66.62% 90.16%
79 DeepSeek V3 (2024-12-26) 66.39% 66.39% 82.62%
80 DeepSeek V3.1 66.15% 66.15% 82.35%
81 Z.AI GLM 4.6 65.85% 65.85% 87.64%
82 Z.AI GLM 4.7 Flash 65.63% 65.63% 82.21%
83 Qwen3 235B A22B Instruct 2507 65.42% 65.42% 78.07%
84 Gemini 3 Flash (Preview) 65.14% 65.14% 85.47%
85 Gemini 3.5 Flash Lite (Reasoning, Minimal) 64.95% 64.95% 84.45%
86 GPT-5.6 Luna (Reasoning) 64.83% 64.83% 90.61%
87 o4 Mini 64.61% 64.61% 86.56%
88 DeepSeek V4 Flash (Reasoning) 64.50% 64.50% 88.06%
89 Mistral Large 3 64.41% 64.41% 84.29%
90 Xiaomi MIMO v2.5 Pro 64.29% 64.29% 86.05%
91 Qwen 3.5 Plus (2026-02-15) 64.21% 64.21% 86.17%
92 Mistral Small 3.2 24B 64.08% 64.08% 77.36%
93 Claude Opus 5 64.01% 64.01% 89.97%
94 Z.AI GLM 4.5 63.79% 63.79% 84.95%
95 Aion 2.0 63.77% 63.77% 86.66%
96 DeepSeek V4 Pro 63.74% 63.74% 82.05%
97 Llama 3.1 70B 63.45% 63.45% 77.41%
98 Qwen 3.5 Flash 63.19% 63.19% 85.66%
99 Mistral Large 2 63.05% 63.05% 81.50%
100 MiniMax M2.5 62.69% 62.69% 86.71%
101 Gemini 3.1 Flash Lite (Reasoning) 62.26% 62.26% 85.91%
102 Gemini 3.5 Flash Lite (Reasoning) 62.22% 62.22% 84.34%
103 Mistral Small 4 62.17% 62.17% 75.23%
104 Thinking Machines Inkling 61.48% 61.48% 73.96%
105 Gemini 3.1 Flash Lite 61.21% 61.21% 85.09%
106 Gemma 3 12B 61.05% 61.05% 76.07%
107 Aion 3.0 Mini 60.98% 60.98% 83.69%
108 Qwen 3.5 9B 60.98% 60.98% 84.05%
109 Gemini 2.5 Pro 60.89% 60.89% 88.44%
110 Xiaomi MIMO v2.5 60.75% 60.75% 83.95%
111 Gemini 3.5 Flash (Reasoning, Minimal) 60.38% 60.38% 85.88%
112 Mistral Small 4 (Reasoning) 60.28% 60.28% 79.48%
113 Gemini 2.5 Flash (Reasoning) 59.97% 59.97% 84.14%
114 Gemini 2.5 Flash Lite 59.96% 59.96% 79.91%
115 Grok 4.20 59.71% 59.71% 81.21%
116 Hermes 3 405B 59.17% 59.17% 80.80%
117 Gemini 3.1 Flash Lite (Preview) 59.04% 59.04% 85.41%
118 GPT-4o Mini (temp=0) 58.84% 58.84% 76.86%
119 ByteDance Seed 2.0 Mini 58.77% 58.77% 85.69%
120 Cohere Command R+ (Aug. 2024) 58.70% 58.70% 67.04%
121 GPT-4.1 Mini 58.59% 58.59% 81.40%
122 GPT-5.4 58.11% 58.11% 84.31%
123 GPT-5 Nano 57.57% 57.57% 80.16%
124 Gemini 2.5 Flash 57.47% 57.47% 80.61%
125 Nemotron 3 Super 57.43% 57.43% 81.69%
126 GPT-5.4 Mini (Reasoning) 57.38% 57.38% 89.82%
127 DeepSeek V4 Flash 57.32% 57.32% 82.02%
128 GPT-4o Mini (temp=1) 56.50% 56.50% 77.82%
129 GPT-OSS 120B 55.03% 55.03% 84.81%
130 GPT-5.6 Luna 54.70% 54.70% 85.06%
131 Inception Mercury 2 54.41% 54.41% 81.99%
132 Gemini 3.6 Flash (Reasoning, Minimal) 54.33% 54.33% 86.68%
133 DeepSeek V3.2 53.75% 53.75% 82.22%
134 Hermes 3 70B 53.00% 53.00% 69.74%
135 Ministral 3 14B 50.83% 50.83% 70.45%
136 Cydonia 24B V4.1 50.36% 50.36% 72.68%
137 Grok 4.3 49.02% 49.02% 78.00%
138 Mistral Medium 3.1 48.60% 48.60% 76.08%
139 Gemma 3 27B 47.98% 47.98% 75.70%
140 ByteDance Seed 1.6 Flash 47.15% 47.15% 70.92%
141 Qwen 3 32B 46.83% 46.83% 79.37%
142 Laguna XS 2.1 46.56% 46.56% 75.42%
143 GPT-5.4 Mini 46.32% 46.32% 80.45%
144 Z.AI GLM 4.5 Air 44.11% 44.11% 80.74%
145 Nemotron 3 Nano 43.47% 43.47% 74.50%
146 GPT-4.1 Nano 40.88% 40.88% 69.90%
147 ByteDance Seed 2.0 Lite 36.85% 36.85% 84.27%
148 Mistral NeMO 34.11% 34.11% 63.80%
149 GPT-5.4 Mini (Reasoning, Low) 33.99% 33.99% 83.57%
150 Laguna S 2.1 33.30% 33.30% 79.98%
151 GPT-5.4 Nano (Reasoning, Low) 31.65% 31.65% 77.46%
152 Qwen 2.5 72B 31.55% 31.55% 73.17%
153 Ministral 3 8B 31.34% 31.34% 69.98%
154 WizardLM 2 8x22b 28.27% 28.27% 71.45%
155 GPT-5.4 Nano (Reasoning) 27.15% 27.15% 80.02%
156 Gemma 3 4B 26.37% 26.37% 66.33%
157 Ministral 3B 24.45% 24.45% 59.25%
158 Arcee AI: Trinity Mini 23.57% 23.57% 67.68%
159 GPT-5.4 Nano 20.94% 20.94% 72.16%
160 Ministral 3 3B 15.87% 15.87% 65.02%
161 Ministral 8B 15.27% 15.27% 63.77%