Content Invention

Subcategory of Hallucination. 161 models scored.

Model Leaderboard

All models ranked by their Content Invention subcategory score.

# Model Content Invention Hallucination Overall
1 GPT-5.6 Sol (Reasoning) 100.00% 91.72% 95.15%
2 Claude Opus 4.6 (Reasoning) 100.00% 99.06% 95.06%
3 Gemini 3.6 Flash (Reasoning) 100.00% 97.34% 94.90%
4 Qwen3.7 Max 100.00% 97.15% 94.55%
5 Grok 4.5 (Reasoning, High) 100.00% 99.06% 94.12%
6 Gemini 3.1 Pro (Preview) 100.00% 94.53% 94.08%
7 GPT-5.4 (Reasoning) 100.00% 95.22% 93.85%
8 Z.AI GLM 5.1 100.00% 98.84% 93.74%
9 Qwen3.6 Max Preview 100.00% 95.86% 93.72%
10 GPT-5.5 (Reasoning) 100.00% 92.12% 93.72%
11 Claude Sonnet 4.6 (Reasoning) 100.00% 96.98% 93.64%
12 Z.AI GLM 5.2 (Reasoning, High) 100.00% 98.99% 93.41%
13 Gemini 3.5 Flash (Reasoning) 100.00% 95.61% 93.35%
14 Z.AI GLM 5 Turbo 100.00% 99.32% 93.29%
15 MoonshotAI: Kimi K3 (Reasoning, High) 100.00% 96.97% 92.99%
16 MoonshotAI: Kimi K2.6 100.00% 94.43% 92.57%
17 Claude Opus 4.7 (Reasoning) 100.00% 98.69% 92.53%
18 GPT-5.5 (Reasoning, Low) 100.00% 91.37% 92.51%
19 GPT-5.6 Terra (Reasoning) 100.00% 94.98% 92.49%
20 Claude Opus 4.8 (Reasoning) 100.00% 97.41% 92.33%
21 Claude Opus 4.6 100.00% 96.80% 92.31%
22 MoonshotAI: Kimi K3 (Reasoning, Low) 100.00% 97.73% 92.07%
23 Claude Opus 5 (Reasoning, Low) 100.00% 97.34% 92.06%
24 Claude Opus 4.8 (Reasoning, Low) 100.00% 97.33% 91.89%
25 GPT-5 100.00% 95.92% 91.48%
26 GPT-5 Mini 100.00% 98.28% 91.31%
27 Claude Opus 5 (Reasoning) 100.00% 96.86% 91.15%
28 Qwen 3.5 397B A17B 100.00% 90.04% 91.09%
29 Grok 4.3 (Reasoning) 100.00% 97.86% 90.99%
30 Grok 4.5 (Reasoning, Low) 100.00% 99.01% 90.94%
31 GPT-5.4 (Reasoning, Low) 100.00% 95.71% 90.91%
32 Grok 4.20 (Reasoning) 100.00% 96.30% 90.87%
33 MoonshotAI: Kimi K2.5 100.00% 94.01% 90.86%
34 Thinking Machines Inkling (Reasoning) 100.00% 96.34% 90.78%
35 GPT-5.6 Sol 100.00% 95.87% 90.76%
36 GPT-5.1 100.00% 96.22% 90.73%
37 Claude Sonnet 4.6 100.00% 94.99% 90.66%
38 GPT-5.6 Luna (Reasoning) 100.00% 98.65% 90.61%
39 MiniMax M3 100.00% 97.83% 90.45%
40 Claude Sonnet 5 (Reasoning) 100.00% 96.77% 90.40%
41 Qwen 3.5 122B 100.00% 93.29% 90.32%
42 Claude Sonnet 5 (Reasoning, Low) 100.00% 96.44% 90.16%
43 Qwen 3.5 27B 100.00% 93.29% 90.05%
44 Claude Opus 5 100.00% 93.91% 89.97%
45 Gemini 3 Flash (Preview, Reasoning) 100.00% 92.65% 89.93%
46 Claude Opus 4.7 100.00% 92.95% 89.90%
47 GPT-5.4 Mini (Reasoning) 100.00% 98.11% 89.82%
48 Qwen 3.5 Plus (2026-04-20) 100.00% 98.38% 89.79%
49 Gemma 4 31B (Reasoning) 100.00% 96.37% 89.64%
50 Claude Opus 4.5 100.00% 91.03% 89.60%
51 Z.AI GLM 5 100.00% 98.04% 89.60%
52 ByteDance Seed 1.6 100.00% 97.57% 89.59%
53 GPT-5.2 100.00% 97.55% 89.45%
54 GPT-5.5 100.00% 90.28% 89.37%
55 Qwen 3.6 Flash 100.00% 96.13% 89.31%
56 DeepSeek V4 Pro (Reasoning) 100.00% 95.25% 89.28%
57 Gemma 4 26B (Reasoning) 100.00% 98.79% 89.02%
58 Aion 3.0 100.00% 95.57% 88.78%
59 o4 Mini High 100.00% 99.53% 88.78%
60 Gemini 2.5 Pro 100.00% 93.05% 88.44%
61 Qwen 3.6 27B 100.00% 97.42% 88.33%
62 GPT-5.6 Terra 100.00% 90.63% 88.23%
63 Z.AI GLM 4.7 100.00% 94.23% 87.67%
64 Qwen 3.6 35B 100.00% 94.07% 87.66%
65 Z.AI GLM 4.6 100.00% 94.42% 87.64%
66 Claude Sonnet 4 100.00% 90.04% 87.64%
67 Claude Sonnet 4.5 100.00% 87.78% 87.54%
68 Claude Sonnet 5 100.00% 88.74% 87.34%
69 Claude Opus 4 100.00% 87.84% 87.22%
70 GPT-4.1 100.00% 95.60% 86.82%
71 MiniMax M2.5 100.00% 94.72% 86.71%
72 Gemini 3.6 Flash (Reasoning, Minimal) 100.00% 96.53% 86.68%
73 o4 Mini 100.00% 98.54% 86.56%
74 MiniMax M2.7 100.00% 94.69% 86.23%
75 Qwen 3.5 Plus (2026-02-15) 100.00% 86.62% 86.17%
76 Xiaomi MIMO v2.5 Pro 100.00% 97.02% 86.05%
77 Gemini 3.1 Flash Lite (Reasoning) 100.00% 87.63% 85.91%
78 Gemini 3.5 Flash (Reasoning, Minimal) 100.00% 89.55% 85.88%
79 ByteDance Seed 2.0 Mini 100.00% 94.07% 85.69%
80 Gemini 3 Flash (Preview) 100.00% 85.61% 85.47%
81 Gemini 3.1 Flash Lite (Preview) 100.00% 87.29% 85.41%
82 Gemma 4 31B 100.00% 95.09% 85.23%
83 Gemini 3.1 Flash Lite 100.00% 87.86% 85.09%
84 GPT-5.6 Luna 100.00% 93.37% 85.06%
85 Z.AI GLM 4.5 100.00% 91.83% 84.95%
86 Gemma 4 26B 100.00% 94.22% 84.89%
87 GPT-OSS 120B 100.00% 97.63% 84.81%
88 Gemini 3.5 Flash Lite (Reasoning, Minimal) 100.00% 87.57% 84.45%
89 Gemini 3.5 Flash Lite (Reasoning) 100.00% 87.49% 84.34%
90 GPT-5.4 100.00% 86.32% 84.31%
91 Mistral Large 3 100.00% 85.18% 84.29%
92 ByteDance Seed 2.0 Lite 100.00% 89.50% 84.27%
93 Gemini 2.5 Flash (Reasoning) 100.00% 97.79% 84.14%
94 Xiaomi MIMO v2.5 100.00% 97.61% 83.95%
95 GPT-5.4 Mini (Reasoning, Low) 100.00% 98.78% 83.57%
96 Claude Haiku 4.5 100.00% 91.93% 83.36%
97 DeepSeek V3 (2024-12-26) 100.00% 85.69% 82.62%
98 DeepSeek V3.1 100.00% 85.55% 82.35%
99 DeepSeek V3.2 100.00% 86.25% 82.22%
100 GPT-4o, Aug. 6th (temp=0) 100.00% 83.33% 82.18%
101 DeepSeek V4 Pro 100.00% 89.36% 82.05%
102 DeepSeek V4 Flash 100.00% 87.73% 82.02%
103 Nemotron 3 Super 100.00% 97.34% 81.69%
104 Mistral Large 2 100.00% 85.45% 81.50%
105 GPT-4.1 Mini 100.00% 86.23% 81.40%
106 GPT-4o, Aug. 6th (temp=1) 100.00% 86.00% 81.28%
107 Grok 4.20 100.00% 80.48% 81.21%
108 Hermes 3 405B 100.00% 87.02% 80.80%
109 Z.AI GLM 4.5 Air 100.00% 94.00% 80.74%
110 Gemini 2.5 Flash 100.00% 85.27% 80.61%
111 GPT-5.4 Mini 100.00% 81.85% 80.45%
112 GPT-5.4 Nano (Reasoning) 100.00% 96.98% 80.02%
113 Laguna S 2.1 100.00% 93.17% 79.98%
114 Gemini 2.5 Flash Lite 100.00% 88.08% 79.91%
115 Qwen 3 32B 100.00% 89.06% 79.37%
116 Grok 4.3 100.00% 87.79% 78.00%
117 GPT-4o Mini (temp=1) 100.00% 85.28% 77.82%
118 GPT-5.4 Nano (Reasoning, Low) 100.00% 95.71% 77.46%
119 Mistral Small 3.2 24B 100.00% 86.84% 77.36%
120 GPT-4o Mini (temp=0) 100.00% 82.23% 76.86%
121 Mistral Medium 3.1 100.00% 88.93% 76.08%
122 Gemma 3 12B 100.00% 77.13% 76.07%
123 Gemma 3 27B 100.00% 80.53% 75.70%
124 Mistral Small 4 100.00% 81.83% 75.23%
125 Thinking Machines Inkling 100.00% 92.70% 73.96%
126 Qwen 2.5 72B 100.00% 85.54% 73.17%
127 GPT-5.4 Nano 100.00% 86.86% 72.16%
128 Ministral 3 14B 100.00% 83.19% 70.45%
129 Ministral 3 8B 100.00% 94.02% 69.98%
130 GPT-4.1 Nano 100.00% 90.07% 69.90%
131 Arcee AI: Trinity Mini 100.00% 88.35% 67.68%
132 Gemma 3 4B 100.00% 75.94% 66.33%
133 Ministral 8B 100.00% 91.89% 63.77%
134 DeepSeek V4 Flash (Reasoning) 96.43% 96.92% 88.06%
135 Qwen 3.5 9B 96.43% 91.81% 84.05%
136 Mistral Small 4 (Reasoning) 96.43% 93.18% 79.48%
137 Aion 3.0 Mini 95.24% 94.08% 83.69%
138 Gemini 2.5 Flash Lite (Reasoning) 95.24% 96.99% 83.10%
139 Qwen 3.5 Flash 92.90% 88.70% 85.66%
140 Aion 2.0 92.89% 93.10% 86.66%
141 Muse Spark 1.1 (Reasoning, Medium) 92.86% 96.79% 93.81%
142 Qwen 3.5 35B 92.86% 89.24% 87.01%
143 Z.AI GLM 4.7 Flash 92.86% 90.00% 82.21%
144 Writer: Palmyra X5 92.86% 80.49% 78.11%
145 Llama 3.1 70B 92.86% 80.47% 77.41%
146 Laguna XS 2.1 92.86% 92.09% 75.42%
147 Cydonia 24B V4.1 91.07% 85.22% 72.68%
148 DeepSeek-V2 Chat 90.48% 82.48% 84.09%
149 ByteDance Seed 1.6 Flash 89.88% 90.83% 70.92%
150 Ministral 3 3B 89.29% 75.10% 65.02%
151 GPT-5 Nano 88.10% 92.99% 80.16%
152 DeepSeek V3 (2025-03-24) 88.10% 76.88% 79.93%
153 Muse Spark 1.1 (Reasoning, Minimal) 87.50% 95.34% 91.43%
154 WizardLM 2 8x22b 85.73% 79.28% 71.45%
155 Qwen3 235B A22B Instruct 2507 85.71% 76.34% 78.07%
156 Ministral 3B 85.71% 73.79% 59.25%
157 Nemotron 3 Nano 82.14% 88.55% 74.50%
158 Inception Mercury 2 81.55% 93.22% 81.99%
159 Mistral NeMO 76.19% 69.32% 63.80%
160 Hermes 3 70B 60.79% 70.71% 69.74%
161 Cohere Command R+ (Aug. 2024) 37.90% 66.30% 67.04%