Tooling

15 scenarios across 1 subcategory. 161 models scored.

Subcategories

Subcategory Avg Score Best Model Best Score
XML 96.38% GPT-5.6 Sol (Reasoning) 100.00%

Model Leaderboard

All models ranked by their Tooling category score.

# Model Tooling XML Overall
1 GPT-5.6 Sol (Reasoning) 100.00% 100.00% 95.15%
2 Claude Opus 4.6 (Reasoning) 100.00% 100.00% 95.06%
3 Gemini 3.6 Flash (Reasoning) 100.00% 100.00% 94.90%
4 Qwen3.7 Max 100.00% 100.00% 94.55%
5 GPT-5.4 (Reasoning) 100.00% 100.00% 93.85%
6 Muse Spark 1.1 (Reasoning, Medium) 100.00% 100.00% 93.81%
7 Z.AI GLM 5.1 100.00% 100.00% 93.74%
8 Qwen3.6 Max Preview 100.00% 100.00% 93.72%
9 GPT-5.5 (Reasoning) 100.00% 100.00% 93.72%
10 Claude Sonnet 4.6 (Reasoning) 100.00% 100.00% 93.64%
11 Gemini 3.5 Flash (Reasoning) 100.00% 100.00% 93.35%
12 MoonshotAI: Kimi K3 (Reasoning, High) 100.00% 100.00% 92.99%
13 Claude Opus 4.7 (Reasoning) 100.00% 100.00% 92.53%
14 Claude Opus 4.6 100.00% 100.00% 92.31%
15 MoonshotAI: Kimi K3 (Reasoning, Low) 100.00% 100.00% 92.07%
16 Grok 4.20 (Reasoning) 100.00% 100.00% 90.87%
17 MoonshotAI: Kimi K2.5 100.00% 100.00% 90.86%
18 Thinking Machines Inkling (Reasoning) 100.00% 100.00% 90.78%
19 GPT-5.6 Sol 100.00% 100.00% 90.76%
20 Claude Sonnet 4.6 100.00% 100.00% 90.66%
21 Gemini 3 Flash (Preview, Reasoning) 100.00% 100.00% 89.93%
22 GPT-5.4 Mini (Reasoning) 100.00% 100.00% 89.82%
23 Claude Opus 4.5 100.00% 100.00% 89.60%
24 GPT-5.2 100.00% 100.00% 89.45%
25 GPT-5.5 100.00% 100.00% 89.37%
26 o4 Mini High 100.00% 100.00% 88.78%
27 Gemini 2.5 Pro 100.00% 100.00% 88.44%
28 Claude Sonnet 4 100.00% 100.00% 87.64%
29 Claude Opus 4 100.00% 100.00% 87.22%
30 o4 Mini 100.00% 100.00% 86.56%
31 Xiaomi MIMO v2.5 Pro 100.00% 100.00% 86.05%
32 Gemini 3.5 Flash (Reasoning, Minimal) 100.00% 100.00% 85.88%
33 Gemma 4 31B 100.00% 100.00% 85.23%
34 GPT-OSS 120B 100.00% 100.00% 84.81%
35 Gemini 2.5 Flash (Reasoning) 100.00% 100.00% 84.14%
36 GPT-5.4 Mini (Reasoning, Low) 100.00% 100.00% 83.57%
37 DeepSeek V3.2 99.99% 99.99% 82.22%
38 Grok 4.5 (Reasoning, High) 99.99% 99.99% 94.12%
39 GPT-5 Mini 99.99% 99.99% 91.31%
40 Gemini 3.1 Flash Lite (Preview) 99.98% 99.98% 85.41%
41 Gemini 3.1 Flash Lite 99.97% 99.97% 85.09%
42 GPT-5.4 (Reasoning, Low) 99.97% 99.97% 90.91%
43 GPT-5.6 Luna (Reasoning) 99.97% 99.97% 90.61%
44 Gemini 2.5 Flash 99.97% 99.97% 80.61%
45 MiniMax M3 99.96% 99.96% 90.45%
46 Gemini 3.5 Flash Lite (Reasoning) 99.96% 99.96% 84.34%
47 GPT-4o, Aug. 6th (temp=0) 99.96% 99.96% 82.18%
48 ByteDance Seed 2.0 Lite 99.93% 99.93% 84.27%
49 Gemini 3.1 Pro (Preview) 99.92% 99.92% 94.08%
50 GPT-5.6 Luna 99.90% 99.90% 85.06%
51 Gemini 3.5 Flash Lite (Reasoning, Minimal) 99.89% 99.89% 84.45%
52 MoonshotAI: Kimi K2.6 99.81% 99.81% 92.57%
53 Qwen 3.5 397B A17B 99.81% 99.81% 91.09%
54 Gemini 3.1 Flash Lite (Reasoning) 99.81% 99.81% 85.91%
55 Qwen 3.5 Plus (2026-02-15) 99.78% 99.78% 86.17%
56 Qwen 3.6 Flash 99.78% 99.78% 89.31%
57 Claude Opus 5 99.77% 99.77% 89.97%
58 Claude Opus 5 (Reasoning, Low) 99.75% 99.75% 92.06%
59 ByteDance Seed 2.0 Mini 99.70% 99.70% 85.69%
60 Claude Opus 5 (Reasoning) 99.58% 99.58% 91.15%
61 DeepSeek V4 Pro 99.57% 99.57% 82.05%
62 Claude Opus 4.8 (Reasoning) 99.53% 99.53% 92.33%
63 Claude Sonnet 5 (Reasoning, Low) 99.52% 99.52% 90.16%
64 Claude Opus 4.8 (Reasoning, Low) 99.48% 99.48% 91.89%
65 Claude Opus 4.7 99.48% 99.48% 89.90%
66 Xiaomi MIMO v2.5 99.46% 99.46% 83.95%
67 DeepSeek V4 Pro (Reasoning) 99.40% 99.40% 89.28%
68 GPT-5 Nano 99.34% 99.34% 80.16%
69 Qwen 3.5 122B 99.33% 99.33% 90.32%
70 GPT-5.6 Terra 99.33% 99.33% 88.23%
71 Gemini 3.6 Flash (Reasoning, Minimal) 99.33% 99.33% 86.68%
72 Grok 4.5 (Reasoning, Low) 99.33% 99.33% 90.94%
73 MiniMax M2.7 99.32% 99.32% 86.23%
74 GPT-5.6 Terra (Reasoning) 99.31% 99.31% 92.49%
75 Claude Sonnet 5 (Reasoning) 99.17% 99.17% 90.40%
76 Qwen 3.5 27B 99.17% 99.17% 90.05%
77 Gemma 4 26B (Reasoning) 99.04% 99.04% 89.02%
78 GPT-4o, Aug. 6th (temp=1) 98.86% 98.86% 81.28%
79 DeepSeek-V2 Chat 98.80% 98.80% 84.09%
80 Laguna S 2.1 98.78% 98.78% 79.98%
81 Z.AI GLM 4.5 Air 98.75% 98.75% 80.74%
82 GPT-4o Mini (temp=1) 98.71% 98.71% 77.82%
83 GPT-5 98.67% 98.67% 91.48%
84 Z.AI GLM 4.7 98.67% 98.67% 87.67%
85 DeepSeek V3 (2024-12-26) 98.58% 98.58% 82.62%
86 Z.AI GLM 4.5 98.58% 98.58% 84.95%
87 GPT-5.4 Mini 98.55% 98.55% 80.45%
88 GPT-5.5 (Reasoning, Low) 98.50% 98.50% 92.51%
89 Gemma 4 31B (Reasoning) 98.50% 98.50% 89.64%
90 Z.AI GLM 5 98.50% 98.50% 89.60%
91 Grok 4.3 (Reasoning) 98.47% 98.47% 90.99%
92 Z.AI GLM 5.2 (Reasoning, High) 98.33% 98.33% 93.41%
93 Muse Spark 1.1 (Reasoning, Minimal) 98.33% 98.33% 91.43%
94 GPT-5.1 98.33% 98.33% 90.73%
95 ByteDance Seed 1.6 98.33% 98.33% 89.59%
96 Inception Mercury 2 98.33% 98.33% 81.99%
97 Gemini 2.5 Flash Lite (Reasoning) 98.28% 98.28% 83.10%
98 MiniMax M2.5 98.27% 98.27% 86.71%
99 GPT-5.4 98.04% 98.04% 84.31%
100 Gemini 3 Flash (Preview) 98.04% 98.04% 85.47%
101 Z.AI GLM 4.6 97.99% 97.99% 87.64%
102 Qwen 3.6 27B 97.91% 97.91% 88.33%
103 Claude Sonnet 4.5 97.75% 97.75% 87.54%
104 GPT-4.1 97.71% 97.71% 86.82%
105 GPT-4o Mini (temp=0) 97.45% 97.45% 76.86%
106 Mistral Large 2 97.31% 97.31% 81.50%
107 Mistral Small 4 (Reasoning) 97.28% 97.28% 79.48%
108 Mistral Large 3 97.22% 97.22% 84.29%
109 Hermes 3 405B 96.98% 96.98% 80.80%
110 GPT-4.1 Mini 96.94% 96.94% 81.40%
111 Qwen 3.5 9B 96.84% 96.84% 84.05%
112 Mistral Small 3.2 24B 96.82% 96.82% 77.36%
113 Qwen 2.5 72B 96.82% 96.82% 73.17%
114 DeepSeek V3.1 96.80% 96.80% 82.35%
115 Claude Haiku 4.5 96.75% 96.75% 83.36%
116 Aion 3.0 96.54% 96.54% 88.78%
117 GPT-5.4 Nano (Reasoning) 96.43% 96.43% 80.02%
118 DeepSeek V4 Flash (Reasoning) 96.17% 96.17% 88.06%
119 Gemma 3 27B 96.15% 96.15% 75.70%
120 Writer: Palmyra X5 96.12% 96.12% 78.11%
121 Gemini 2.5 Flash Lite 96.00% 96.00% 79.91%
122 Claude Sonnet 5 95.99% 95.99% 87.34%
123 Ministral 3 8B 95.77% 95.77% 69.98%
124 Arcee AI: Trinity Mini 95.64% 95.64% 67.68%
125 Qwen 3.5 Plus (2026-04-20) 95.33% 95.33% 89.79%
126 Qwen 3 32B 95.19% 95.19% 79.37%
127 Aion 2.0 95.10% 95.10% 86.66%
128 Grok 4.20 95.00% 95.00% 81.21%
129 Qwen 3.5 35B 94.74% 94.74% 87.01%
130 Hermes 3 70B 94.47% 94.47% 69.74%
131 Z.AI GLM 5 Turbo 94.30% 94.30% 93.29%
132 Mistral Medium 3.1 94.17% 94.17% 76.08%
133 Gemma 3 12B 94.16% 94.16% 76.07%
134 DeepSeek V4 Flash 94.00% 94.00% 82.02%
135 Qwen3 235B A22B Instruct 2507 93.86% 93.86% 78.07%
136 Mistral Small 4 93.85% 93.85% 75.23%
137 Z.AI GLM 4.7 Flash 92.53% 92.53% 82.21%
138 Gemma 3 4B 92.40% 92.40% 66.33%
139 Gemma 4 26B 91.94% 91.94% 84.89%
140 GPT-5.4 Nano 91.85% 91.85% 72.16%
141 GPT-5.4 Nano (Reasoning, Low) 91.46% 91.46% 77.46%
142 WizardLM 2 8x22b 91.22% 91.22% 71.45%
143 Grok 4.3 91.21% 91.21% 78.00%
144 Ministral 3 3B 89.41% 89.41% 65.02%
145 Qwen 3.5 Flash 89.39% 89.39% 85.66%
146 Laguna XS 2.1 88.97% 88.97% 75.42%
147 Nemotron 3 Super 88.08% 88.08% 81.69%
148 Ministral 3 14B 87.84% 87.84% 70.45%
149 Llama 3.1 70B 87.82% 87.82% 77.41%
150 Cohere Command R+ (Aug. 2024) 87.53% 87.53% 67.04%
151 Cydonia 24B V4.1 86.72% 86.72% 72.68%
152 DeepSeek V3 (2025-03-24) 86.36% 86.36% 79.93%
153 Ministral 3B 84.70% 84.70% 59.25%
154 Ministral 8B 84.65% 84.65% 63.77%
155 Nemotron 3 Nano 83.65% 83.65% 74.50%
156 Qwen 3.6 35B 82.67% 82.67% 87.66%
157 Mistral NeMO 79.34% 79.34% 63.80%
158 GPT-4.1 Nano 78.47% 78.47% 69.90%
159 Aion 3.0 Mini 75.94% 75.94% 83.69%
160 Thinking Machines Inkling 56.68% 56.68% 73.96%
161 ByteDance Seed 1.6 Flash 47.33% 47.33% 70.92%