Output Corruption

Subcategory of Hallucination. 161 models scored.

Model Leaderboard

All models ranked by their Output Corruption subcategory score.

# Model Output Corruption Hallucination Overall
1 GPT-5.6 Sol (Reasoning) 100.00% 91.72% 95.15%
2 Claude Opus 4.6 (Reasoning) 100.00% 99.06% 95.06%
3 Gemini 3.6 Flash (Reasoning) 100.00% 97.34% 94.90%
4 Grok 4.5 (Reasoning, High) 100.00% 99.06% 94.12%
5 Gemini 3.1 Pro (Preview) 100.00% 94.53% 94.08%
6 GPT-5.4 (Reasoning) 100.00% 95.22% 93.85%
7 Muse Spark 1.1 (Reasoning, Medium) 100.00% 96.79% 93.81%
8 Z.AI GLM 5.1 100.00% 98.84% 93.74%
9 GPT-5.5 (Reasoning) 100.00% 92.12% 93.72%
10 Claude Sonnet 4.6 (Reasoning) 100.00% 96.98% 93.64%
11 Gemini 3.5 Flash (Reasoning) 100.00% 95.61% 93.35%
12 MoonshotAI: Kimi K3 (Reasoning, High) 100.00% 96.97% 92.99%
13 MoonshotAI: Kimi K2.6 100.00% 94.43% 92.57%
14 GPT-5.5 (Reasoning, Low) 100.00% 91.37% 92.51%
15 GPT-5.6 Terra (Reasoning) 100.00% 94.98% 92.49%
16 Claude Opus 4.8 (Reasoning) 100.00% 97.41% 92.33%
17 Claude Opus 4.6 100.00% 96.80% 92.31%
18 Claude Opus 4.8 (Reasoning, Low) 100.00% 97.33% 91.89%
19 GPT-5 100.00% 95.92% 91.48%
20 GPT-5 Mini 100.00% 98.28% 91.31%
21 Claude Opus 5 (Reasoning) 100.00% 96.86% 91.15%
22 Grok 4.3 (Reasoning) 100.00% 97.86% 90.99%
23 Grok 4.5 (Reasoning, Low) 100.00% 99.01% 90.94%
24 GPT-5.4 (Reasoning, Low) 100.00% 95.71% 90.91%
25 Grok 4.20 (Reasoning) 100.00% 96.30% 90.87%
26 MoonshotAI: Kimi K2.5 100.00% 94.01% 90.86%
27 Thinking Machines Inkling (Reasoning) 100.00% 96.34% 90.78%
28 GPT-5.6 Sol 100.00% 95.87% 90.76%
29 GPT-5.1 100.00% 96.22% 90.73%
30 GPT-5.6 Luna (Reasoning) 100.00% 98.65% 90.61%
31 MiniMax M3 100.00% 97.83% 90.45%
32 Claude Sonnet 5 (Reasoning) 100.00% 96.77% 90.40%
33 Qwen 3.5 122B 100.00% 93.29% 90.32%
34 Claude Sonnet 5 (Reasoning, Low) 100.00% 96.44% 90.16%
35 Qwen 3.5 27B 100.00% 93.29% 90.05%
36 Claude Opus 5 100.00% 93.91% 89.97%
37 Claude Opus 4.7 100.00% 92.95% 89.90%
38 Gemma 4 31B (Reasoning) 100.00% 96.37% 89.64%
39 Claude Opus 4.5 100.00% 91.03% 89.60%
40 ByteDance Seed 1.6 100.00% 97.57% 89.59%
41 GPT-5.2 100.00% 97.55% 89.45%
42 GPT-5.5 100.00% 90.28% 89.37%
43 Qwen 3.6 Flash 100.00% 96.13% 89.31%
44 o4 Mini High 100.00% 99.53% 88.78%
45 Gemini 2.5 Pro 100.00% 93.05% 88.44%
46 GPT-5.6 Terra 100.00% 90.63% 88.23%
47 DeepSeek V4 Flash (Reasoning) 100.00% 96.92% 88.06%
48 Claude Sonnet 4 100.00% 90.04% 87.64%
49 Claude Sonnet 4.5 100.00% 87.78% 87.54%
50 Claude Sonnet 5 100.00% 88.74% 87.34%
51 Claude Opus 4 100.00% 87.84% 87.22%
52 Qwen 3.5 35B 100.00% 89.24% 87.01%
53 Gemini 3.6 Flash (Reasoning, Minimal) 100.00% 96.53% 86.68%
54 Aion 2.0 100.00% 93.10% 86.66%
55 o4 Mini 100.00% 98.54% 86.56%
56 Xiaomi MIMO v2.5 Pro 100.00% 97.02% 86.05%
57 Gemini 3.1 Flash Lite (Reasoning) 100.00% 87.63% 85.91%
58 Gemini 3.5 Flash (Reasoning, Minimal) 100.00% 89.55% 85.88%
59 Gemma 4 31B 100.00% 95.09% 85.23%
60 Gemini 3.1 Flash Lite 100.00% 87.86% 85.09%
61 GPT-5.6 Luna 100.00% 93.37% 85.06%
62 Gemma 4 26B 100.00% 94.22% 84.89%
63 Gemini 3.5 Flash Lite (Reasoning, Minimal) 100.00% 87.57% 84.45%
64 Gemini 3.5 Flash Lite (Reasoning) 100.00% 87.49% 84.34%
65 GPT-5.4 100.00% 86.32% 84.31%
66 Mistral Large 3 100.00% 85.18% 84.29%
67 DeepSeek-V2 Chat 100.00% 82.48% 84.09%
68 Claude Haiku 4.5 100.00% 91.93% 83.36%
69 DeepSeek V3 (2024-12-26) 100.00% 85.69% 82.62%
70 DeepSeek V3.2 100.00% 86.25% 82.22%
71 Z.AI GLM 4.7 Flash 100.00% 90.00% 82.21%
72 GPT-4o, Aug. 6th (temp=0) 100.00% 83.33% 82.18%
73 DeepSeek V4 Flash 100.00% 87.73% 82.02%
74 Nemotron 3 Super 100.00% 97.34% 81.69%
75 Mistral Large 2 100.00% 85.45% 81.50%
76 GPT-4.1 Mini 100.00% 86.23% 81.40%
77 Hermes 3 405B 100.00% 87.02% 80.80%
78 GPT-5.4 Mini 100.00% 81.85% 80.45%
79 GPT-5.4 Nano (Reasoning) 100.00% 96.98% 80.02%
80 Laguna S 2.1 100.00% 93.17% 79.98%
81 Mistral Small 4 (Reasoning) 100.00% 93.18% 79.48%
82 Writer: Palmyra X5 100.00% 80.49% 78.11%
83 GPT-4o Mini (temp=1) 100.00% 85.28% 77.82%
84 GPT-5.4 Nano (Reasoning, Low) 100.00% 95.71% 77.46%
85 GPT-4o Mini (temp=0) 100.00% 82.23% 76.86%
86 Mistral Medium 3.1 100.00% 88.93% 76.08%
87 Gemma 3 12B 100.00% 77.13% 76.07%
88 Gemma 3 27B 100.00% 80.53% 75.70%
89 Mistral Small 4 100.00% 81.83% 75.23%
90 Thinking Machines Inkling 100.00% 92.70% 73.96%
91 GPT-5.4 Nano 100.00% 86.86% 72.16%
92 Ministral 3 14B 100.00% 83.19% 70.45%
93 Ministral 3 8B 100.00% 94.02% 69.98%
94 Arcee AI: Trinity Mini 100.00% 88.35% 67.68%
95 Cohere Command R+ (Aug. 2024) 100.00% 66.30% 67.04%
96 Gemma 3 4B 100.00% 75.94% 66.33%
97 Ministral 3 3B 100.00% 75.10% 65.02%
98 Ministral 8B 100.00% 91.89% 63.77%
99 Ministral 3B 100.00% 73.79% 59.25%
100 GPT-5.4 Mini (Reasoning) 100.00% 98.11% 89.82%
101 Qwen3.6 Max Preview 100.00% 95.86% 93.72%
102 Z.AI GLM 5 100.00% 98.04% 89.60%
103 Z.AI GLM 5 Turbo 99.99% 99.32% 93.29%
104 Grok 4.20 99.99% 80.48% 81.21%
105 Inception Mercury 2 99.99% 93.22% 81.99%
106 Z.AI GLM 5.2 (Reasoning, High) 99.98% 98.99% 93.41%
107 Claude Opus 4.7 (Reasoning) 99.98% 98.69% 92.53%
108 Qwen 3.5 Flash 99.98% 88.70% 85.66%
109 DeepSeek V4 Pro 99.98% 89.36% 82.05%
110 GPT-5.4 Mini (Reasoning, Low) 99.98% 98.78% 83.57%
111 Claude Opus 5 (Reasoning, Low) 99.97% 97.34% 92.06%
112 GPT-4.1 99.97% 95.60% 86.82%
113 Gemini 3 Flash (Preview, Reasoning) 99.97% 92.65% 89.93%
114 Qwen3 235B A22B Instruct 2507 99.97% 76.34% 78.07%
115 Claude Sonnet 4.6 99.97% 94.99% 90.66%
116 Mistral NeMO 99.97% 69.32% 63.80%
117 Gemini 3.1 Flash Lite (Preview) 99.97% 87.29% 85.41%
118 Gemini 2.5 Flash Lite (Reasoning) 99.96% 96.99% 83.10%
119 Grok 4.3 99.96% 87.79% 78.00%
120 GPT-5 Nano 99.96% 92.99% 80.16%
121 Z.AI GLM 4.7 99.96% 94.23% 87.67%
122 Gemini 2.5 Flash Lite 99.96% 88.08% 79.91%
123 Gemini 3 Flash (Preview) 99.95% 85.61% 85.47%
124 Qwen3.7 Max 99.95% 97.15% 94.55%
125 Gemma 4 26B (Reasoning) 99.95% 98.79% 89.02%
126 Qwen 3.6 27B 99.95% 97.42% 88.33%
127 GPT-4.1 Nano 99.95% 90.07% 69.90%
128 Muse Spark 1.1 (Reasoning, Minimal) 99.94% 95.34% 91.43%
129 Gemini 2.5 Flash (Reasoning) 99.94% 97.79% 84.14%
130 Laguna XS 2.1 99.93% 92.09% 75.42%
131 Qwen 3.5 397B A17B 99.93% 90.04% 91.09%
132 Xiaomi MIMO v2.5 99.93% 97.61% 83.95%
133 GPT-OSS 120B 99.92% 97.63% 84.81%
134 MoonshotAI: Kimi K3 (Reasoning, Low) 99.92% 97.73% 92.07%
135 ByteDance Seed 2.0 Mini 99.90% 94.07% 85.69%
136 DeepSeek V3.1 99.89% 85.55% 82.35%
137 Aion 3.0 99.88% 95.57% 88.78%
138 GPT-4o, Aug. 6th (temp=1) 99.82% 86.00% 81.28%
139 MiniMax M2.7 99.72% 94.69% 86.23%
140 Qwen 3.5 Plus (2026-02-15) 99.65% 86.62% 86.17%
141 ByteDance Seed 1.6 Flash 99.57% 90.83% 70.92%
142 MiniMax M2.5 99.50% 94.72% 86.71%
143 Qwen 3 32B 99.39% 89.06% 79.37%
144 Gemini 2.5 Flash 99.08% 85.27% 80.61%
145 Qwen 3.5 Plus (2026-04-20) 98.89% 98.38% 89.79%
146 DeepSeek V4 Pro (Reasoning) 98.89% 95.25% 89.28%
147 Qwen 3.6 35B 98.89% 94.07% 87.66%
148 Z.AI GLM 4.6 98.89% 94.42% 87.64%
149 Z.AI GLM 4.5 Air 98.87% 94.00% 80.74%
150 Aion 3.0 Mini 98.85% 94.08% 83.69%
151 Z.AI GLM 4.5 98.85% 91.83% 84.95%
152 Qwen 2.5 72B 98.28% 85.54% 73.17%
153 Mistral Small 3.2 24B 98.14% 86.84% 77.36%
154 ByteDance Seed 2.0 Lite 97.78% 89.50% 84.27%
155 Nemotron 3 Nano 97.72% 88.55% 74.50%
156 Qwen 3.5 9B 97.67% 91.81% 84.05%
157 Cydonia 24B V4.1 97.62% 85.22% 72.68%
158 Hermes 3 70B 97.34% 70.71% 69.74%
159 WizardLM 2 8x22b 95.09% 79.28% 71.45%
160 DeepSeek V3 (2025-03-24) 94.58% 76.88% 79.93%
161 Llama 3.1 70B 87.24% 80.47% 77.41%