Dialogue

Subcategory of Creative Writing. 161 models scored.

Model Leaderboard

All models ranked by their Dialogue subcategory score.

# Model Dialogue Creative Writing Overall
1 GPT-5.6 Sol 97.84% 91.04% 90.76%
2 GPT-5.6 Sol (Reasoning) 97.62% 91.03% 95.15%
3 GPT-5.6 Terra 96.90% 90.92% 88.23%
4 GPT-5.5 (Reasoning, Low) 96.25% 90.24% 92.51%
5 Claude Opus 5 (Reasoning) 95.93% 88.64% 91.15%
6 GPT-5.6 Luna 95.55% 89.69% 85.06%
7 GPT-5.5 95.32% 90.39% 89.37%
8 Claude Sonnet 4.6 95.20% 83.31% 90.66%
9 Claude Opus 5 95.16% 88.13% 89.97%
10 Claude Opus 5 (Reasoning, Low) 95.12% 88.87% 92.06%
11 Claude Sonnet 4.6 (Reasoning) 94.92% 83.09% 93.64%
12 GPT-5.5 (Reasoning) 94.90% 90.26% 93.72%
13 GPT-5.6 Luna (Reasoning) 94.84% 90.10% 90.61%
14 GPT-5.4 94.79% 90.94% 84.31%
15 GPT-5.6 Terra (Reasoning) 94.42% 90.72% 92.49%
16 Aion 3.0 93.98% 84.64% 88.78%
17 MiniMax M3 93.86% 84.57% 90.45%
18 GPT-5.4 (Reasoning) 93.69% 91.17% 93.85%
19 Z.AI GLM 5.2 (Reasoning, High) 93.65% 83.92% 93.41%
20 Claude Opus 4.6 (Reasoning) 93.56% 84.55% 95.06%
21 Z.AI GLM 5 Turbo 93.23% 84.66% 93.29%
22 Muse Spark 1.1 (Reasoning, Medium) 92.70% 88.57% 93.81%
23 Aion 3.0 Mini 92.64% 84.60% 83.69%
24 MoonshotAI: Kimi K2.6 92.60% 85.47% 92.57%
25 Qwen 3.5 397B A17B 92.54% 86.93% 91.09%
26 Z.AI GLM 5.1 92.52% 84.05% 93.74%
27 Claude Opus 4.6 92.37% 83.59% 92.31%
28 MoonshotAI: Kimi K3 (Reasoning, High) 92.23% 87.43% 92.99%
29 GPT-5.4 (Reasoning, Low) 92.18% 90.51% 90.91%
30 Grok 4.5 (Reasoning, High) 92.01% 87.43% 94.12%
31 Qwen 3.5 9B 91.95% 84.35% 84.05%
32 Qwen3.6 Max Preview 91.85% 88.42% 93.72%
33 Grok 4.5 (Reasoning, Low) 91.72% 87.45% 90.94%
34 DeepSeek V4 Pro 91.48% 83.70% 82.05%
35 GPT-5 91.30% 86.87% 91.48%
36 Claude Sonnet 5 91.19% 82.58% 87.34%
37 MoonshotAI: Kimi K3 (Reasoning, Low) 90.50% 86.51% 92.07%
38 Grok 4.3 (Reasoning) 90.45% 85.11% 90.99%
39 GPT-5.4 Mini 90.45% 88.10% 80.45%
40 GPT-5.4 Mini (Reasoning) 90.04% 88.66% 89.82%
41 GPT-5.4 Mini (Reasoning, Low) 89.66% 87.72% 83.57%
42 Claude Sonnet 4.5 89.63% 84.19% 87.54%
43 Qwen 3.5 35B 89.61% 83.51% 87.01%
44 Claude Opus 4 89.08% 83.79% 87.22%
45 Qwen 3.6 35B 89.07% 85.97% 87.66%
46 Qwen3.7 Max 88.93% 85.39% 94.55%
47 MiniMax M2.5 88.93% 81.21% 86.71%
48 MiniMax M2.7 88.91% 81.70% 86.23%
49 Claude Opus 4.5 88.91% 81.71% 89.60%
50 Muse Spark 1.1 (Reasoning, Minimal) 88.84% 87.30% 91.43%
51 Qwen 3.5 27B 88.67% 82.54% 90.05%
52 Claude Opus 4.7 88.63% 84.74% 89.90%
53 DeepSeek V4 Flash 88.48% 83.42% 82.02%
54 Z.AI GLM 5 88.46% 83.63% 89.60%
55 Claude Opus 4.7 (Reasoning) 88.14% 84.73% 92.53%
56 DeepSeek V4 Flash (Reasoning) 88.10% 83.03% 88.06%
57 Claude Opus 4.8 (Reasoning, Low) 87.92% 85.86% 91.89%
58 GPT-5.1 87.44% 87.20% 90.73%
59 Qwen3 235B A22B Instruct 2507 87.23% 84.81% 78.07%
60 Gemini 3.1 Pro (Preview) 87.20% 85.44% 94.08%
61 Claude Sonnet 5 (Reasoning) 87.18% 81.31% 90.40%
62 Grok 4.3 87.13% 84.51% 78.00%
63 Qwen 3.5 Flash 87.13% 83.81% 85.66%
64 Claude Sonnet 5 (Reasoning, Low) 87.10% 81.43% 90.16%
65 Qwen 3.5 122B 86.76% 83.02% 90.32%
66 Qwen 3.6 Flash 86.74% 86.02% 89.31%
67 Thinking Machines Inkling (Reasoning) 86.71% 80.19% 90.78%
68 Claude Opus 4.8 (Reasoning) 86.50% 85.25% 92.33%
69 MoonshotAI: Kimi K2.5 86.21% 81.35% 90.86%
70 ByteDance Seed 2.0 Lite 85.96% 82.35% 84.27%
71 GPT-5 Mini 85.94% 80.48% 91.31%
72 Thinking Machines Inkling 85.63% 80.27% 73.96%
73 ByteDance Seed 1.6 85.62% 78.43% 89.59%
74 Mistral Small 4 (Reasoning) 85.39% 81.67% 79.48%
75 Qwen 3.5 Plus (2026-04-20) 85.08% 85.18% 89.79%
76 GPT-5.4 Nano (Reasoning) 85.05% 80.97% 80.02%
77 Writer: Palmyra X5 84.42% 83.95% 78.11%
78 DeepSeek V4 Pro (Reasoning) 84.25% 82.99% 89.28%
79 DeepSeek V3 (2025-03-24) 83.31% 82.34% 79.93%
80 Grok 4.20 (Reasoning) 83.26% 86.25% 90.87%
81 GPT-5.4 Nano 83.18% 80.50% 72.16%
82 GPT-5.4 Nano (Reasoning, Low) 83.10% 80.93% 77.46%
83 Mistral Large 2 83.10% 81.86% 81.50%
84 Claude Sonnet 4 82.84% 79.21% 87.64%
85 Mistral Small 4 82.49% 81.12% 75.23%
86 Claude Haiku 4.5 82.25% 78.96% 83.36%
87 Mistral Medium 3.1 81.51% 81.70% 76.08%
88 Gemma 4 26B (Reasoning) 81.41% 76.38% 89.02%
89 ByteDance Seed 2.0 Mini 81.36% 80.11% 85.69%
90 Gemini 3.1 Flash Lite (Reasoning) 81.09% 76.31% 85.91%
91 Gemini 3.5 Flash Lite (Reasoning) 80.87% 82.80% 84.34%
92 GPT-5.2 80.71% 80.36% 89.45%
93 Mistral Large 3 80.22% 81.21% 84.29%
94 Gemma 4 31B (Reasoning) 80.03% 78.13% 89.64%
95 ByteDance Seed 1.6 Flash 79.96% 81.51% 70.92%
96 Xiaomi MIMO v2.5 Pro 79.81% 81.08% 86.05%
97 Gemini 3.1 Flash Lite 78.90% 76.01% 85.09%
98 o4 Mini 78.87% 82.04% 86.56%
99 Qwen 3 32B 78.83% 81.30% 79.37%
100 Gemini 3.5 Flash Lite (Reasoning, Minimal) 78.76% 82.74% 84.45%
101 o4 Mini High 78.26% 82.72% 88.78%
102 Qwen 3.6 27B 78.25% 82.81% 88.33%
103 WizardLM 2 8x22b 77.45% 79.06% 71.45%
104 Gemini 2.5 Pro 77.40% 81.03% 88.44%
105 Xiaomi MIMO v2.5 77.40% 79.16% 83.95%
106 Grok 4.20 77.13% 83.44% 81.21%
107 GPT-4.1 76.96% 81.24% 86.82%
108 Aion 2.0 76.51% 80.24% 86.66%
109 Ministral 8B 76.29% 76.87% 63.77%
110 Gemini 3.1 Flash Lite (Preview) 75.91% 75.78% 85.41%
111 Ministral 3B 75.29% 75.49% 59.25%
112 Ministral 3 14B 74.59% 79.11% 70.45%
113 Ministral 3 3B 74.49% 75.45% 65.02%
114 Z.AI GLM 4.6 74.32% 78.86% 87.64%
115 Gemma 4 26B 73.77% 75.17% 84.89%
116 DeepSeek V3.2 73.33% 79.95% 82.22%
117 Z.AI GLM 4.5 73.22% 76.56% 84.95%
118 Laguna XS 2.1 72.93% 77.28% 75.42%
119 Ministral 3 8B 72.81% 77.26% 69.98%
120 Gemini 3.6 Flash (Reasoning) 71.94% 81.02% 94.90%
121 Z.AI GLM 4.7 71.01% 78.89% 87.67%
122 Llama 3.1 70B 70.76% 72.78% 77.41%
123 Gemini 2.5 Flash 70.64% 77.57% 80.61%
124 Gemma 4 31B 70.38% 75.59% 85.23%
125 DeepSeek V3 (2024-12-26) 69.79% 77.88% 82.62%
126 Z.AI GLM 4.7 Flash 69.49% 77.36% 82.21%
127 Gemini 3 Flash (Preview, Reasoning) 69.48% 75.87% 89.93%
128 Mistral Small 3.2 24B 68.93% 71.87% 77.36%
129 Hermes 3 405B 68.75% 80.92% 80.80%
130 DeepSeek V3.1 68.61% 77.45% 82.35%
131 Laguna S 2.1 68.01% 74.16% 79.98%
132 Gemini 3.5 Flash (Reasoning) 67.65% 79.87% 93.35%
133 Nemotron 3 Super 67.38% 69.75% 81.69%
134 Mistral NeMO 67.00% 76.72% 63.80%
135 DeepSeek-V2 Chat 66.95% 77.20% 84.09%
136 Gemini 2.5 Flash Lite (Reasoning) 65.73% 71.64% 83.10%
137 Z.AI GLM 4.5 Air 65.43% 74.61% 80.74%
138 Gemini 2.5 Flash (Reasoning) 65.33% 76.30% 84.14%
139 Gemini 3 Flash (Preview) 64.78% 75.04% 85.47%
140 Gemini 3.6 Flash (Reasoning, Minimal) 64.68% 79.25% 86.68%
141 Gemma 3 27B 64.44% 78.79% 75.70%
142 Qwen 2.5 72B 64.34% 75.16% 73.17%
143 Cohere Command R+ (Aug. 2024) 64.24% 77.70% 67.04%
144 Gemini 3.5 Flash (Reasoning, Minimal) 63.97% 78.55% 85.88%
145 Arcee AI: Trinity Mini 63.42% 74.01% 67.68%
146 GPT-4o, Aug. 6th (temp=0) 63.20% 73.65% 82.18%
147 Cydonia 24B V4.1 62.72% 74.19% 72.68%
148 Gemini 2.5 Flash Lite 62.67% 75.05% 79.91%
149 GPT-5 Nano 62.32% 67.04% 80.16%
150 Qwen 3.5 Plus (2026-02-15) 61.06% 77.07% 86.17%
151 Nemotron 3 Nano 60.70% 65.87% 74.50%
152 Inception Mercury 2 59.94% 68.31% 81.99%
153 GPT-4o, Aug. 6th (temp=1) 59.42% 75.50% 81.28%
154 Hermes 3 70B 59.25% 77.41% 69.74%
155 GPT-4.1 Mini 57.72% 74.52% 81.40%
156 GPT-4o Mini (temp=0) 56.91% 73.10% 76.86%
157 GPT-OSS 120B 55.74% 67.85% 84.81%
158 GPT-4.1 Nano 55.61% 71.81% 69.90%
159 Gemma 3 12B 54.87% 75.38% 76.07%
160 GPT-4o Mini (temp=1) 53.50% 74.37% 77.82%
161 Gemma 3 4B 52.95% 72.10% 66.33%