Clichés

Subcategory of Creative Writing. 161 models scored.

Model Leaderboard

All models ranked by their Clichés subcategory score.

# Model Clichés Creative Writing Overall
1 o4 Mini High 90.38% 82.72% 88.78%
2 Qwen3.6 Max Preview 89.87% 88.42% 93.72%
3 GPT-5 89.59% 86.87% 91.48%
4 Gemini 3.1 Pro (Preview) 88.95% 85.44% 94.08%
5 Grok 4.20 (Reasoning) 87.99% 86.25% 90.87%
6 Claude Opus 5 (Reasoning, Low) 87.91% 88.87% 92.06%
7 Grok 4.3 (Reasoning) 87.57% 85.11% 90.99%
8 Qwen3.7 Max 87.36% 85.39% 94.55%
9 Claude Opus 5 (Reasoning) 87.25% 88.64% 91.15%
10 Gemini 2.5 Pro 87.21% 81.03% 88.44%
11 Claude Opus 5 87.08% 88.13% 89.97%
12 o4 Mini 86.60% 82.04% 86.56%
13 GPT-5.4 (Reasoning) 86.52% 91.17% 93.85%
14 Grok 4.20 86.50% 83.44% 81.21%
15 GPT-5.1 86.39% 87.20% 90.73%
16 Qwen 3.6 35B 86.36% 85.97% 87.66%
17 Grok 4.5 (Reasoning, Low) 86.31% 87.45% 90.94%
18 Grok 4.5 (Reasoning, High) 85.97% 87.43% 94.12%
19 MoonshotAI: Kimi K3 (Reasoning, Low) 85.82% 86.51% 92.07%
20 Grok 4.3 85.60% 84.51% 78.00%
21 Qwen 3.6 Flash 85.50% 86.02% 89.31%
22 Muse Spark 1.1 (Reasoning, Medium) 84.93% 88.57% 93.81%
23 GPT-5.6 Sol 84.87% 91.04% 90.76%
24 GPT-5.6 Terra (Reasoning) 84.66% 90.72% 92.49%
25 GPT-5.4 (Reasoning, Low) 84.51% 90.51% 90.91%
26 Qwen 3.5 Plus (2026-04-20) 84.50% 85.18% 89.79%
27 GPT-5.4 84.30% 90.94% 84.31%
28 DeepSeek V3.1 83.91% 77.45% 82.35%
29 Z.AI GLM 4.6 83.84% 78.86% 87.64%
30 Gemma 3 27B 83.82% 78.79% 75.70%
31 GPT-4.1 83.80% 81.24% 86.82%
32 Claude Opus 4.7 (Reasoning) 83.59% 84.73% 92.53%
33 Claude Opus 4.8 (Reasoning) 83.58% 85.25% 92.33%
34 GPT-5.6 Terra 83.46% 90.92% 88.23%
35 GPT-5.4 Mini (Reasoning) 83.22% 88.66% 89.82%
36 GPT-5.6 Sol (Reasoning) 83.12% 91.03% 95.15%
37 Qwen 3.5 397B A17B 83.12% 86.93% 91.09%
38 Claude Opus 4.8 (Reasoning, Low) 83.05% 85.86% 91.89%
39 MoonshotAI: Kimi K3 (Reasoning, High) 82.98% 87.43% 92.99%
40 Gemma 3 12B 82.85% 75.38% 76.07%
41 GPT-5.6 Luna (Reasoning) 82.62% 90.10% 90.61%
42 Hermes 3 405B 82.60% 80.92% 80.80%
43 Gemini 3.5 Flash Lite (Reasoning) 82.32% 82.80% 84.34%
44 Claude Opus 4.7 82.11% 84.74% 89.90%
45 Qwen 3.5 Flash 82.05% 83.81% 85.66%
46 Qwen3 235B A22B Instruct 2507 82.05% 84.81% 78.07%
47 Muse Spark 1.1 (Reasoning, Minimal) 81.92% 87.30% 91.43%
48 ByteDance Seed 2.0 Mini 81.90% 80.11% 85.69%
49 Gemini 3.6 Flash (Reasoning) 81.86% 81.02% 94.90%
50 Gemini 3.5 Flash (Reasoning) 81.76% 79.87% 93.35%
51 Gemini 3.5 Flash Lite (Reasoning, Minimal) 81.74% 82.74% 84.45%
52 Qwen 3 32B 81.72% 81.30% 79.37%
53 Z.AI GLM 4.7 81.62% 78.89% 87.67%
54 Aion 2.0 81.53% 80.24% 86.66%
55 GPT-5.5 81.40% 90.39% 89.37%
56 Mistral Large 2 81.36% 81.86% 81.50%
57 GPT-5.5 (Reasoning) 81.35% 90.26% 93.72%
58 DeepSeek V3.2 81.32% 79.95% 82.22%
59 Gemini 3 Flash (Preview, Reasoning) 81.18% 75.87% 89.93%
60 GPT-5.6 Luna 81.14% 89.69% 85.06%
61 Qwen 3.5 35B 81.11% 83.51% 87.01%
62 Z.AI GLM 4.7 Flash 81.09% 77.36% 82.21%
63 Aion 3.0 Mini 80.84% 84.60% 83.69%
64 Mistral Large 3 80.74% 81.21% 84.29%
65 GPT-4.1 Nano 80.71% 71.81% 69.90%
66 Qwen 3.6 27B 80.66% 82.81% 88.33%
67 DeepSeek V3 (2025-03-24) 80.49% 82.34% 79.93%
68 Gemini 3.6 Flash (Reasoning, Minimal) 80.44% 79.25% 86.68%
69 GPT-4.1 Mini 80.38% 74.52% 81.40%
70 Gemini 3.5 Flash (Reasoning, Minimal) 80.34% 78.55% 85.88%
71 Gemma 4 26B 80.33% 75.17% 84.89%
72 Gemini 3 Flash (Preview) 80.32% 75.04% 85.47%
73 Qwen 3.5 122B 80.31% 83.02% 90.32%
74 GPT-4o, Aug. 6th (temp=1) 80.25% 75.50% 81.28%
75 Gemma 3 4B 80.17% 72.10% 66.33%
76 DeepSeek V4 Flash (Reasoning) 80.09% 83.03% 88.06%
77 Gemini 3.1 Flash Lite 79.97% 76.01% 85.09%
78 Mistral Medium 3.1 79.96% 81.70% 76.08%
79 GPT-5.4 Mini 79.92% 88.10% 80.45%
80 Qwen 3.5 9B 79.82% 84.35% 84.05%
81 DeepSeek V3 (2024-12-26) 79.81% 77.88% 82.62%
82 Arcee AI: Trinity Mini 79.76% 74.01% 67.68%
83 Gemma 4 26B (Reasoning) 79.74% 76.38% 89.02%
84 Gemini 3.1 Flash Lite (Preview) 79.66% 75.78% 85.41%
85 Gemma 4 31B (Reasoning) 79.53% 78.13% 89.64%
86 DeepSeek V4 Flash 79.51% 83.42% 82.02%
87 Gemini 3.1 Flash Lite (Reasoning) 79.50% 76.31% 85.91%
88 WizardLM 2 8x22b 79.40% 79.06% 71.45%
89 DeepSeek-V2 Chat 79.10% 77.20% 84.09%
90 GPT-5.5 (Reasoning, Low) 78.89% 90.24% 92.51%
91 Z.AI GLM 5 78.86% 83.63% 89.60%
92 GPT-5.4 Mini (Reasoning, Low) 78.74% 87.72% 83.57%
93 Ministral 3 14B 78.70% 79.11% 70.45%
94 MiniMax M3 78.49% 84.57% 90.45%
95 GPT-5 Mini 78.48% 80.48% 91.31%
96 Qwen 3.5 27B 78.44% 82.54% 90.05%
97 Hermes 3 70B 78.42% 77.41% 69.74%
98 Writer: Palmyra X5 78.38% 83.95% 78.11%
99 Z.AI GLM 5 Turbo 78.37% 84.66% 93.29%
100 Claude Opus 4 78.30% 83.79% 87.22%
101 GPT-4o Mini (temp=1) 78.20% 74.37% 77.82%
102 DeepSeek V4 Pro (Reasoning) 78.10% 82.99% 89.28%
103 Gemini 2.5 Flash 78.05% 77.57% 80.61%
104 MoonshotAI: Kimi K2.6 77.97% 85.47% 92.57%
105 Claude Sonnet 5 77.86% 82.58% 87.34%
106 Cohere Command R+ (Aug. 2024) 77.80% 77.70% 67.04%
107 ByteDance Seed 1.6 77.64% 78.43% 89.59%
108 Xiaomi MIMO v2.5 77.49% 79.16% 83.95%
109 Z.AI GLM 5.1 77.47% 84.05% 93.74%
110 Gemini 2.5 Flash (Reasoning) 77.43% 76.30% 84.14%
111 DeepSeek V4 Pro 77.40% 83.70% 82.05%
112 Gemma 4 31B 76.74% 75.59% 85.23%
113 Aion 3.0 76.47% 84.64% 88.78%
114 Claude Sonnet 4.6 76.43% 83.31% 90.66%
115 Claude Sonnet 4.5 76.41% 84.19% 87.54%
116 Gemini 2.5 Flash Lite 76.25% 75.05% 79.91%
117 Xiaomi MIMO v2.5 Pro 76.24% 81.08% 86.05%
118 Ministral 3 8B 76.24% 77.26% 69.98%
119 Mistral Small 4 76.23% 81.12% 75.23%
120 ByteDance Seed 2.0 Lite 76.22% 82.35% 84.27%
121 Mistral Small 4 (Reasoning) 75.97% 81.67% 79.48%
122 Mistral NeMO 75.80% 76.72% 63.80%
123 Claude Opus 4.6 (Reasoning) 75.75% 84.55% 95.06%
124 ByteDance Seed 1.6 Flash 75.52% 81.51% 70.92%
125 MiniMax M2.5 75.41% 81.21% 86.71%
126 Claude Sonnet 4.6 (Reasoning) 75.13% 83.09% 93.64%
127 Claude Sonnet 5 (Reasoning) 74.78% 81.31% 90.40%
128 MiniMax M2.7 74.72% 81.70% 86.23%
129 Z.AI GLM 5.2 (Reasoning, High) 74.28% 83.92% 93.41%
130 Claude Opus 4.5 73.89% 81.71% 89.60%
131 Ministral 8B 73.81% 76.87% 63.77%
132 Claude Sonnet 4 73.80% 79.21% 87.64%
133 Claude Sonnet 5 (Reasoning, Low) 73.75% 81.43% 90.16%
134 Laguna XS 2.1 73.66% 77.28% 75.42%
135 Qwen 2.5 72B 72.84% 75.16% 73.17%
136 GPT-5.4 Nano (Reasoning) 72.62% 80.97% 80.02%
137 Claude Opus 4.6 72.59% 83.59% 92.31%
138 Z.AI GLM 4.5 72.34% 76.56% 84.95%
139 Claude Haiku 4.5 71.93% 78.96% 83.36%
140 Qwen 3.5 Plus (2026-02-15) 71.92% 77.07% 86.17%
141 Cydonia 24B V4.1 71.78% 74.19% 72.68%
142 Llama 3.1 70B 70.83% 72.78% 77.41%
143 Ministral 3B 70.80% 75.49% 59.25%
144 Ministral 3 3B 70.63% 75.45% 65.02%
145 GPT-4o Mini (temp=0) 70.56% 73.10% 76.86%
146 GPT-OSS 120B 70.48% 67.85% 84.81%
147 GPT-5.4 Nano (Reasoning, Low) 70.47% 80.93% 77.46%
148 GPT-5.4 Nano 69.68% 80.50% 72.16%
149 GPT-4o, Aug. 6th (temp=0) 69.33% 73.65% 82.18%
150 Mistral Small 3.2 24B 68.55% 71.87% 77.36%
151 Z.AI GLM 4.5 Air 68.55% 74.61% 80.74%
152 Inception Mercury 2 67.53% 68.31% 81.99%
153 MoonshotAI: Kimi K2.5 67.36% 81.35% 90.86%
154 Laguna S 2.1 66.91% 74.16% 79.98%
155 Gemini 2.5 Flash Lite (Reasoning) 66.75% 71.64% 83.10%
156 GPT-5.2 66.36% 80.36% 89.45%
157 Nemotron 3 Super 64.41% 69.75% 81.69%
158 Nemotron 3 Nano 64.30% 65.87% 74.50%
159 Thinking Machines Inkling (Reasoning) 62.40% 80.19% 90.78%
160 Thinking Machines Inkling 61.24% 80.27% 73.96%
161 GPT-5 Nano 50.07% 67.04% 80.16%