Output Corruption

Subcategory of Hallucination. 179 models scored.

Model Leaderboard

All models ranked by their Output Corruption subcategory score.

# Model Output Corruption Hallucination Overall
1 Qwen 3.8 Max (Reasoning, XHigh) 100.00% 92.76% 96.21%
2 Gemini 3.8 Flash (Reasoning, Medium) 100.00% 96.88% 95.72%
3 Z.AI GLM 5.3 (Reasoning, Max) 100.00% 95.30% 95.20%
4 GPT-5.6 Sol (Reasoning) 100.00% 91.72% 95.15%
5 Claude Opus 4.6 (Reasoning) 100.00% 99.06% 95.06%
6 Gemini 3.6 Flash (Reasoning) 100.00% 97.34% 94.90%
7 Gemini 3.7 Flash (Reasoning, Medium) 100.00% 97.97% 94.85%
8 Hy4 Preview (Reasoning, High) 100.00% 94.17% 94.80%
9 DeepSeek V4.1 Flash (Reasoning, High) 100.00% 95.27% 94.30%
10 Z.AI GLM 5.3 Flash (Reasoning, Max) 100.00% 95.12% 94.28%
11 Grok 4.5 (Reasoning, High) 100.00% 99.06% 94.12%
12 Gemini 3.1 Pro (Preview) 100.00% 94.53% 94.08%
13 GPT-5.4 (Reasoning) 100.00% 95.22% 93.85%
14 Muse Spark 1.1 (Reasoning, Medium) 100.00% 96.79% 93.81%
15 Z.AI GLM 5.1 100.00% 98.84% 93.74%
16 GPT-5.5 (Reasoning) 100.00% 92.12% 93.72%
17 Claude Sonnet 4.6 (Reasoning) 100.00% 96.98% 93.64%
18 Gemini 3.5 Flash (Reasoning) 100.00% 95.61% 93.35%
19 Kimi K3 (Reasoning, High) 100.00% 96.97% 92.99%
20 Kimi K2.6 100.00% 94.43% 92.57%
21 GPT-5.5 (Reasoning, Low) 100.00% 91.37% 92.51%
22 GPT-5.6 Terra (Reasoning) 100.00% 94.98% 92.49%
23 Claude Opus 4.8 (Reasoning) 100.00% 97.41% 92.33%
24 Claude Opus 4.6 100.00% 96.80% 92.31%
25 Claude Opus 4.8 (Reasoning, Low) 100.00% 97.33% 91.89%
26 GPT-5 100.00% 95.92% 91.48%
27 GPT-5 Mini 100.00% 98.28% 91.31%
28 Claude Opus 5 (Reasoning) 100.00% 96.86% 91.15%
29 Grok 4.3 (Reasoning) 100.00% 97.86% 90.99%
30 Grok 4.5 (Reasoning, Low) 100.00% 99.01% 90.94%
31 GPT-5.4 (Reasoning, Low) 100.00% 95.71% 90.91%
32 Grok 4.20 (Reasoning) 100.00% 96.30% 90.87%
33 Kimi K2.5 100.00% 94.01% 90.86%
34 Thinking Machines Inkling (Reasoning) 100.00% 96.34% 90.78%
35 GPT-5.6 Sol 100.00% 95.87% 90.76%
36 GPT-5.1 100.00% 96.22% 90.73%
37 GPT-5.6 Luna (Reasoning) 100.00% 98.65% 90.61%
38 MiniMax M3 100.00% 97.83% 90.45%
39 Claude Sonnet 5 (Reasoning) 100.00% 96.77% 90.40%
40 Qwen 3.5 122B 100.00% 93.29% 90.32%
41 Claude Sonnet 5 (Reasoning, Low) 100.00% 96.44% 90.16%
42 Qwen 3.5 27B 100.00% 93.29% 90.05%
43 Claude Opus 5 100.00% 93.91% 89.97%
44 Claude Opus 4.7 100.00% 92.95% 89.90%
45 Gemma 4 31B (Reasoning) 100.00% 96.37% 89.64%
46 Claude Opus 4.5 100.00% 91.03% 89.60%
47 ByteDance Seed 1.6 100.00% 97.57% 89.59%
48 GPT-5.2 100.00% 97.55% 89.45%
49 GPT-5.5 100.00% 90.28% 89.37%
50 Qwen 3.6 Flash 100.00% 96.13% 89.31%
51 Muse Glimmer 30B (Reasoning, Medium) 100.00% 96.19% 88.81%
52 o4 Mini High 100.00% 99.53% 88.78%
53 Gemini 2.5 Pro 100.00% 93.05% 88.44%
54 GPT-5.6 Terra 100.00% 90.63% 88.23%
55 DeepSeek V4 Flash (Reasoning) 100.00% 96.92% 88.06%
56 Claude Sonnet 4 100.00% 90.04% 87.64%
57 Claude Sonnet 4.5 100.00% 87.78% 87.54%
58 Claude Sonnet 5 100.00% 88.74% 87.34%
59 Claude Opus 4 100.00% 87.84% 87.22%
60 Qwen 3.5 35B 100.00% 89.24% 87.01%
61 Gemini 3.6 Flash (Reasoning, Minimal) 100.00% 96.53% 86.68%
62 Aion 2.0 100.00% 93.10% 86.66%
63 o4 Mini 100.00% 98.54% 86.56%
64 Xiaomi MIMO v2.5 Pro 100.00% 97.02% 86.05%
65 Gemini 3.1 Flash Lite (Reasoning) 100.00% 87.63% 85.91%
66 Gemini 3.5 Flash (Reasoning, Minimal) 100.00% 89.55% 85.88%
67 Gemma 4 31B 100.00% 95.09% 85.23%
68 Gemini 3.1 Flash Lite 100.00% 87.86% 85.09%
69 GPT-5.6 Luna 100.00% 93.37% 85.06%
70 Gemma 4 26B 100.00% 94.22% 84.89%
71 Gemini 3.5 Flash Lite (Reasoning, Minimal) 100.00% 87.57% 84.45%
72 Gemini 3.5 Flash Lite (Reasoning) 100.00% 87.49% 84.34%
73 GPT-5.4 100.00% 86.32% 84.31%
74 Mistral Large 3 100.00% 85.18% 84.29%
75 DeepSeek-V2 Chat 100.00% 82.48% 84.09%
76 Claude Haiku 4.5 100.00% 91.93% 83.36%
77 DeepSeek V3 (2024-12-26) 100.00% 85.69% 82.62%
78 DeepSeek V3.2 100.00% 86.25% 82.22%
79 Z.AI GLM 4.7 Flash 100.00% 90.00% 82.21%
80 GPT-4o, Aug. 6th (temp=0) 100.00% 83.33% 82.18%
81 DeepSeek V4 Flash 100.00% 87.73% 82.02%
82 Nemotron 3 Super 100.00% 97.34% 81.69%
83 Mistral Large 2 100.00% 85.45% 81.50%
84 GPT-4.1 Mini 100.00% 86.23% 81.40%
85 Hermes 3 405B 100.00% 87.02% 80.80%
86 GPT-5.4 Mini 100.00% 81.85% 80.45%
87 GPT-5.4 Nano (Reasoning) 100.00% 96.98% 80.02%
88 Laguna S 2.1 100.00% 93.17% 79.99%
89 Mistral Small 4 (Reasoning) 100.00% 93.18% 79.48%
90 Writer: Palmyra X5 100.00% 80.49% 78.11%
91 GPT-4o Mini (temp=1) 100.00% 85.28% 77.82%
92 GPT-5.4 Nano (Reasoning, Low) 100.00% 95.71% 77.46%
93 GPT-4o Mini (temp=0) 100.00% 82.23% 76.86%
94 Mistral Medium 3.1 100.00% 88.93% 76.08%
95 Gemma 3 12B 100.00% 77.13% 76.07%
96 Gemma 3 27B 100.00% 80.53% 75.70%
97 Mistral Small 4 100.00% 81.83% 75.23%
98 Thinking Machines Inkling 100.00% 92.70% 73.96%
99 GPT-5.4 Nano 100.00% 86.86% 72.16%
100 Ministral 3 14B 100.00% 83.19% 70.45%
101 Ministral 3 8B 100.00% 94.02% 69.98%
102 Arcee AI: Trinity Mini 100.00% 88.35% 67.68%
103 Cohere Command R+ (Aug. 2024) 100.00% 66.30% 67.04%
104 Gemma 3 4B 100.00% 75.94% 66.33%
105 Ministral 3 3B 100.00% 75.10% 65.02%
106 Ministral 8B 100.00% 91.89% 63.77%
107 Ministral 3B 100.00% 73.79% 59.25%
108 GPT-5.4 Mini (Reasoning) 100.00% 98.11% 89.82%
109 Qwen 3.6 Max Preview 100.00% 95.86% 93.72%
110 Z.AI GLM 5 100.00% 98.04% 89.60%
111 Muse Spark 1.3 (Reasoning, Medium) 100.00% 98.57% 94.06%
112 Z.AI GLM 5 Turbo 99.99% 99.32% 93.29%
113 Grok 4.20 99.99% 80.48% 81.21%
114 Inception Mercury 2 99.99% 93.22% 81.99%
115 DeepSeek V4 Flash 0731 (Reasoning, High) 99.98% 94.32% 87.97%
116 Z.AI GLM 5.2 (Reasoning, High) 99.98% 98.99% 93.41%
117 Claude Opus 4.7 (Reasoning) 99.98% 98.69% 92.53%
118 Muse Spark 1.2 (Reasoning, Medium) 99.98% 97.93% 94.71%
119 Qwen 3.5 Flash 99.98% 88.70% 85.66%
120 Thinking Machines Inkling Small (Reasoning, High) 99.98% 94.39% 87.39%
121 DeepSeek V4 Pro 99.98% 89.36% 82.05%
122 GPT-5.4 Mini (Reasoning, Low) 99.98% 98.78% 83.57%
123 Claude Opus 5 (Reasoning, Low) 99.97% 97.34% 92.06%
124 GPT-4.1 99.97% 95.60% 86.82%
125 Gemini 3 Flash (Preview, Reasoning) 99.97% 92.65% 89.93%
126 Qwen 3 235B A22B Instruct 2507 99.97% 76.34% 78.07%
127 Claude Sonnet 4.6 99.97% 94.99% 90.66%
128 Mistral NeMO 99.97% 69.32% 63.80%
129 Gemini 3.1 Flash Lite (Preview) 99.97% 87.29% 85.41%
130 Gemini 2.5 Flash Lite (Reasoning) 99.96% 96.99% 83.10%
131 Grok 4.3 99.96% 87.79% 78.00%
132 GPT-5 Nano 99.96% 92.99% 80.16%
133 Z.AI GLM 4.7 99.96% 94.23% 87.67%
134 Gemini 2.5 Flash Lite 99.96% 88.08% 79.91%
135 Gemini 3 Flash (Preview) 99.95% 85.61% 85.47%
136 Qwen 3.7 Max 99.95% 97.15% 94.55%
137 Gemma 4 26B (Reasoning) 99.95% 98.79% 89.02%
138 Qwen 3.6 27B 99.95% 97.42% 88.33%
139 GPT-4.1 Nano 99.95% 90.07% 69.90%
140 Z.AI GLM 5.3 Flash (Reasoning, Low) 99.94% 99.36% 88.76%
141 Muse Spark 1.1 (Reasoning, Minimal) 99.94% 95.34% 91.43%
142 Gemini 2.5 Flash (Reasoning) 99.94% 97.79% 84.14%
143 Laguna XS 2.1 99.93% 92.09% 75.42%
144 Qwen 3.5 397B A17B 99.93% 90.04% 91.09%
145 Xiaomi MIMO v2.5 99.93% 97.61% 83.95%
146 GPT-OSS 120B 99.92% 97.63% 84.81%
147 Kimi K3 (Reasoning, Low) 99.92% 97.73% 92.07%
148 Grok 4.6 (Reasoning, High) 99.91% 98.25% 92.76%
149 ByteDance Seed 2.0 Mini 99.90% 94.07% 85.69%
150 DeepSeek V3.1 99.89% 85.55% 82.35%
151 Aion 3.0 99.88% 95.57% 88.78%
152 GPT-4o, Aug. 6th (temp=1) 99.82% 86.00% 81.28%
153 MiniMax M2.7 99.72% 94.69% 86.23%
154 Qwen 3.5 Plus (2026-02-15) 99.65% 86.62% 86.17%
155 ByteDance Seed 1.6 Flash 99.57% 90.83% 70.92%
156 MiniMax M2.5 99.50% 94.72% 86.71%
157 Qwen 3 32B 99.39% 89.06% 79.37%
158 Gemini 2.5 Flash 99.08% 85.27% 80.61%
159 Qwen 3.8 Flash (Reasoning) 98.89% 91.39% 94.24%
160 Qwen 3.5 Plus (2026-04-20) 98.89% 98.38% 89.79%
161 DeepSeek V4 Pro (Reasoning) 98.89% 95.25% 89.28%
162 Qwen 3.6 35B 98.89% 94.07% 87.66%
163 Z.AI GLM 4.6 98.89% 94.42% 87.64%
164 Z.AI GLM 4.5 Air 98.87% 94.00% 80.74%
165 Aion 3.0 Mini 98.85% 94.08% 83.69%
166 Z.AI GLM 4.5 98.85% 91.83% 84.95%
167 DeepSeek V4 Pro 0813 (Reasoning, High) 98.82% 88.77% 90.21%
168 Qwen 3.7 Flash (Reasoning) 98.78% 94.02% 88.56%
169 Qwen 2.5 72B 98.28% 85.54% 73.17%
170 Mistral Small 3.2 24B 98.14% 86.84% 77.36%
171 ByteDance Seed 2.0 Lite 97.78% 89.50% 84.27%
172 Nemotron 3 Nano 97.72% 88.55% 74.50%
173 Qwen 3.5 9B 97.67% 91.81% 84.05%
174 Cydonia 24B V4.1 97.62% 85.22% 72.68%
175 Hermes 3 70B 97.34% 70.71% 69.74%
176 Qwen 3.8 27B (Reasoning, XHigh) 95.56% 90.29% 92.91%
177 WizardLM 2 8x22b 95.09% 79.28% 71.45%
178 DeepSeek V3 (2025-03-24) 94.58% 76.88% 79.93%
179 Llama 3.1 70B 87.24% 80.47% 77.41%