Dialogue tags
Various tasks related to dialogue tags in text.
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Muse Spark 1.1 (Reasoning, Medium) | 93% | $0.017 | 23.6s | |
| Muse Spark 1.1 (Reasoning, Minimal) | 77% | $0.0095 | 14.4s | |
| GPT-5 Mini | 83% | $0.0096 | 52.2s | |
| GPT-5.6 Sol (Reasoning) | 93% | $0.067 | 29.1s | |
| Z.AI GLM 5 Turbo | 87% | $0.030 | 1.3m | |
| Gemini 3.6 Flash (Reasoning) | 82% | $0.052 | 28.4s | |
| Z.AI GLM 5.2 (Reasoning, High) | 80% | $0.027 | 1.5m | |
| Inception Mercury 2 | 71% | $0.0037 | 6.1s | |
| GPT-5 | 84% | $0.049 | 1.4m | |
| Qwen 3.5 27B | 66% | $0.023 | 1.8m | |
| Claude Opus 4.6 | 73% | $0.013 | 14.7s | |
| GPT-5.4 (Reasoning) | 62% | $0.027 | 36.1s | |
| GPT-5.5 (Reasoning) | 62% | $0.043 | 26.8s | |
| GPT-5.6 Terra (Reasoning) | 64% | $0.023 | 15.0s | |
| Gemini 3 Flash (Preview, Reasoning) | 61% | $0.017 | 30.3s | |
| Nemotron 3 Super | 74% | $0.0000 | 2.5m | |
| Qwen 3.6 35B | 63% | $0.012 | 1.2m | |
| Claude Opus 4.6 (Reasoning) | 80% | $0.070 | 37.7s | |
| Qwen3.7 Max | 92% | $0.068 | 2.3m | |
| Gemini 3.5 Flash (Reasoning) | 92% | $0.119 | 49.9s | |
Cost vs Performance
Compares total cost for this test against the test score. Quadrant lines are drawn at the median values. Only models with available cost data are shown.
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Gemini 3.1 Pro (Preview) | 99% | 90% | 90% | |
| Muse Spark 1.1 (Reasoning, Medium) | 93% | 66% | 66% | |
| Qwen3.7 Max | 92% | 65% | 65% | |
| Gemini 3.5 Flash (Reasoning) | 92% | 57% | 57% | |
| GPT-5.6 Sol (Reasoning) | 93% | 55% | 55% | |
| GPT-5 Mini | 83% | 48% | 48% | |
| Z.AI GLM 5 Turbo | 87% | 48% | 48% | |
| o4 Mini High | 79% | 47% | 45% | |
| MiniMax M2.7 | 81% | 45% | 45% | |
| Claude Opus 4.6 (Reasoning) | 80% | 45% | 44% | |
| GPT-5 | 84% | 43% | 43% | |
| Z.AI GLM 5.1 | 83% | 43% | 43% | |
| MoonshotAI: Kimi K2.6 | 80% | 41% | 41% | |
| Z.AI GLM 5.2 (Reasoning, High) | 80% | 41% | 41% | |
| Gemini 3.6 Flash (Reasoning) | 82% | 39% | 39% | |
| Claude Sonnet 4.6 (Reasoning) | 75% | 40% | 38% | |
| Claude Opus 4.6 | 73% | 42% | 35% | |
| Claude Sonnet 4.6 | 67% | 50% | 35% | |
| Nemotron 3 Super | 74% | 36% | 34% | |
| MiniMax M2.5 | 74% | 43% | 33% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Muse Spark 1.1 (Reasoning, Medium) | 93% | $0.017 | 23.6s | 66% | |
| GPT-5 Mini | 83% | $0.0096 | 52.2s | 48% | |
| Inception Mercury 2 | 71% | $0.0037 | 6.1s | 31% | |
| Z.AI GLM 5 Turbo | 87% | $0.030 | 1.3m | 48% | |
| GPT-5.6 Sol (Reasoning) | 93% | $0.067 | 29.1s | 55% | |
| Claude Opus 4.6 | 73% | $0.013 | 14.7s | 35% | |
| Claude Sonnet 4.6 | 67% | $0.0074 | 12.1s | 35% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 77% | $0.0095 | 14.4s | 25% | |
| Z.AI GLM 5.2 (Reasoning, High) | 80% | $0.027 | 1.5m | 41% | |
| Claude Opus 4.8 (Reasoning, Low) | 68% | $0.020 | 14.7s | 29% | |
| Claude Opus 4.8 (Reasoning) | 69% | $0.020 | 15.2s | 27% | |
| Gemini 3.6 Flash (Reasoning) | 82% | $0.052 | 28.4s | 39% | |
| Qwen3.7 Max | 92% | $0.068 | 2.3m | 65% | |
| GPT-5 | 84% | $0.049 | 1.4m | 43% | |
| Gemini 3.1 Flash Lite (Reasoning) | 52% | $0.0006 | 4.1s | 23% | |
| Gemini 3.1 Pro (Preview) | 99% | $0.135 | 1.9m | 90% | |
| Gemini 3.1 Flash Lite (Preview) | 51% | $0.0006 | 2.7s | 23% | |
| Nemotron 3 Super | 74% | $0.0000 | 2.5m | 34% | |
| Claude Opus 4.5 | 64% | $0.013 | 13.5s | 19% | |
| GPT-4o Mini (temp=0) | 55% | $0.0003 | 7.8s | 19% | |
| Ungrouped | dialogue-200 | dialogue-500 | ||||||
|---|---|---|---|---|---|---|---|---|
| Model | Total â–¼ | Write unattributed dialogue | Write 200 words with 10% dialogue | Write 200 words with 50% dialogue | Write 200 words with 90% dialogue | Write 500 words with 30% dialogue | Write 500 words with 50% dialogue | Write 500 words with 70% dialogue |
| Gemini 3.1 Pro (Preview) | 99% | 100% | 100% | 100% | 99% | 96% | 100% | 100% |
| Muse Spark 1.1 (Reasoning, Medium) | 93% | 100% | 100% | 100% | 97% | 94% | 86% | 76% |
| GPT-5.6 Sol (Reasoning) | 93% | 100% | 99% | 100% | 100% | 91% | 100% | 58% |
| Qwen3.7 Max | 92% | 100% | 97% | 100% | 92% | 100% | 80% | 79% |
| Gemini 3.5 Flash (Reasoning) | 92% | 100% | 100% | 100% | 87% | 100% | 98% | 57% |
| Z.AI GLM 5 Turbo | 87% | 100% | 100% | 98% | 69% | 97% | 95% | 50% |
| GPT-5 | 84% | 100% | 100% | 95% | 63% | 84% | 95% | 54% |
| Z.AI GLM 5.1 | 83% | 100% | 100% | 98% | 79% | 86% | 81% | 39% |
| GPT-5 Mini | 83% | 90% | 100% | 90% | 62% | 87% | 79% | 70% |
| Gemini 3.6 Flash (Reasoning) | 82% | 100% | 100% | 100% | 90% | 82% | 82% | 21% |
| MiniMax M2.7 | 81% | 86% | 97% | 96% | 89% | 71% | 72% | 54% |
| Claude Opus 4.6 (Reasoning) | 80% | 100% | 100% | 90% | 94% | 68% | 53% | 57% |
| Z.AI GLM 5.2 (Reasoning, High) | 80% | 100% | 100% | 100% | 83% | 70% | 74% | 33% |
| MoonshotAI: Kimi K2.6 | 80% | 100% | 100% | 86% | 98% | 61% | 81% | 31% |
| o4 Mini High | 79% | 96% | 100% | 85% | 74% | 80% | 57% | 62% |
dialogue-200
Write 200 words with 10% dialogue
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Inception Mercury 2 | 90% | $0.0025 | 4.0s | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0041 | 24.5s | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | $0.0090 | 12.8s | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 89% | $0.0021 | 2.9s | |
| Claude Opus 4.5 | 96% | $0.0077 | 9.3s | |
| GPT-5.5 | 96% | $0.0087 | 8.9s | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | $0.011 | 15.4s | |
| Claude Haiku 4.5 | 76% | $0.0016 | 4.4s | |
| GPT-OSS 120B | 89% | $0.0015 | 1.5m | |
| Claude Opus 4.6 | 82% | $0.0079 | 9.7s | |
| GPT-5 Mini | 100% | $0.0088 | 45.8s | |
| GPT-5.4 Nano (Reasoning, Low) | 81% | $0.0025 | 15.4s | |
| GPT-5.6 Sol | 94% | $0.0089 | 8.0s | |
| Claude Opus 5 (Reasoning) | 89% | $0.015 | 13.7s | |
| Claude Sonnet 4 | 83% | $0.0046 | 7.5s | |
| Qwen 3.6 35B | 89% | $0.0075 | 53.0s | |
| GPT-5.2 | 100% | $0.026 | 29.9s | |
| MoonshotAI: Kimi K3 (Reasoning, Low) | 88% | $0.011 | 25.4s | |
| Claude Opus 5 (Reasoning, Low) | 92% | $0.019 | 13.7s | |
| Claude Opus 4.8 (Reasoning, Low) | 94% | $0.014 | 10.9s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | 100% | 100% | |
| GPT-5 | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 100% | 100% | |
| GPT-5 Mini | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| GPT-5.1 | 100% | 100% | 100% | |
| GPT-5.4 Nano (Reasoning) | 100% | 99% | 99% | |
| Qwen 3.5 397B A17B | 100% | 99% | 99% | |
| MoonshotAI: Kimi K2.6 | 100% | 99% | 99% | |
| GPT-5.2 | 100% | 99% | 99% | |
| Gemini 3 Flash (Preview, Reasoning) | 100% | 99% | 99% | |
| o4 Mini High | 100% | 98% | 98% | |
| Z.AI GLM 5.1 | 100% | 97% | 97% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | $0.0090 | 12.8s | 100% | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0041 | 24.5s | 99% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | $0.011 | 15.4s | 100% | |
| GPT-5 Mini | 100% | $0.0088 | 45.8s | 100% | |
| GPT-5.5 | 96% | $0.0087 | 8.9s | 90% | |
| Claude Opus 4.5 | 96% | $0.0077 | 9.3s | 88% | |
| GPT-5.2 | 100% | $0.026 | 29.9s | 99% | |
| Gemini 3 Flash (Preview, Reasoning) | 100% | $0.025 | 40.7s | 99% | |
| GPT-5.6 Sol | 94% | $0.0089 | 8.0s | 87% | |
| GPT-5.4 (Reasoning) | 100% | $0.034 | 38.8s | 100% | |
| Z.AI GLM 5 Turbo | 100% | $0.026 | 1.1m | 100% | |
| GPT-5.1 | 100% | $0.032 | 49.0s | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | $0.024 | 1.2m | 100% | |
| Claude Opus 4.8 (Reasoning, Low) | 94% | $0.014 | 10.9s | 85% | |
| GPT-5.6 Sol (Reasoning) | 99% | $0.045 | 18.9s | 95% | |
| Claude Opus 4.8 (Reasoning) | 92% | $0.014 | 11.5s | 83% | |
| Claude Opus 4.7 | 88% | $0.011 | 7.5s | 82% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 89% | $0.0021 | 2.9s | 74% | |
| Gemini 3.6 Flash (Reasoning) | 100% | $0.060 | 30.6s | 100% | |
| GPT-5.6 Terra (Reasoning) | 96% | $0.028 | 16.1s | 81% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 73.8% | Dialogue to Total Word Ratio | ||
| 84.0% | Matches word count |
Write 200 words with 50% dialogue
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Inception Mercury 2 | 97% | $0.0031 | 5.3s | |
| GPT-5.5 | 91% | $0.0094 | 8.9s | |
| Muse Spark 1.1 (Reasoning, Minimal) | 99% | $0.013 | 17.9s | |
| GPT-5.4 Nano (Reasoning) | 95% | $0.0072 | 34.0s | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | $0.016 | 21.6s | |
| GPT-5.4 Nano (Reasoning, Low) | 80% | $0.0027 | 15.2s | |
| GPT-5.6 Luna (Reasoning) | 100% | $0.020 | 19.2s | |
| GPT-5 Mini | 90% | $0.0084 | 50.9s | |
| Claude Opus 4.6 (Reasoning) | 90% | $0.034 | 20.9s | |
| GPT-5.6 Terra (Reasoning) | 99% | $0.030 | 16.7s | |
| GPT-OSS 120B | 97% | $0.0012 | 2.6m | |
| GPT-5.4 (Reasoning, Low) | 83% | $0.018 | 19.5s | |
| Gemini 3 Flash (Preview, Reasoning) | 87% | $0.024 | 39.7s | |
| Claude Opus 4.6 | 79% | $0.0081 | 9.6s | |
| Qwen 3.6 35B | 100% | $0.015 | 1.3m | |
| GPT-5.4 (Reasoning) | 100% | $0.042 | 47.1s | |
| GPT-5.1 | 95% | $0.038 | 1.1m | |
| GPT-5.5 (Reasoning, Low) | 98% | $0.041 | 23.6s | |
| GPT-5.6 Sol (Reasoning) | 100% | $0.050 | 22.0s | |
| Nemotron 3 Super | 90% | $0.0000 | 2.7m | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Qwen3.7 Max | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| GPT-5.6 Sol (Reasoning) | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| GPT-5.6 Luna (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 99% | 99% | |
| GPT-5.5 (Reasoning) | 100% | 99% | 99% | |
| Qwen 3.6 35B | 100% | 99% | 99% | |
| GPT-5.5 (Reasoning, Low) | 98% | 96% | 95% | |
| Claude Sonnet 4.6 (Reasoning) | 99% | 96% | 95% | |
| GPT-5.6 Terra (Reasoning) | 99% | 94% | 94% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 99% | 92% | 92% | |
| Qwen 3.5 397B A17B | 99% | 92% | 92% | |
| Qwen 3.5 27B | 98% | 92% | 92% | |
| Qwen 3.5 35B | 97% | 91% | 91% | |
| Z.AI GLM 5 Turbo | 98% | 90% | 90% | |
| Z.AI GLM 5.1 | 98% | 90% | 90% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Muse Spark 1.1 (Reasoning, Medium) | 100% | $0.016 | 21.6s | 100% | |
| GPT-5.6 Luna (Reasoning) | 100% | $0.020 | 19.2s | 100% | |
| Inception Mercury 2 | 97% | $0.0031 | 5.3s | 86% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 99% | $0.013 | 17.9s | 92% | |
| GPT-5.6 Terra (Reasoning) | 99% | $0.030 | 16.7s | 94% | |
| Qwen 3.6 35B | 100% | $0.015 | 1.3m | 99% | |
| GPT-5.6 Sol (Reasoning) | 100% | $0.050 | 22.0s | 100% | |
| GPT-5.5 (Reasoning, Low) | 98% | $0.041 | 23.6s | 95% | |
| GPT-5.4 (Reasoning) | 100% | $0.042 | 47.1s | 100% | |
| GPT-5.5 | 91% | $0.0094 | 8.9s | 74% | |
| Gemini 3.6 Flash (Reasoning) | 100% | $0.061 | 31.4s | 100% | |
| GPT-5.4 Nano (Reasoning) | 95% | $0.0072 | 34.0s | 70% | |
| Z.AI GLM 5 Turbo | 98% | $0.028 | 1.3m | 90% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | $0.037 | 1.8m | 99% | |
| GPT-4o, Aug. 6th (temp=0) | 83% | $0.0031 | 4.0s | 62% | |
| Qwen 3.5 35B | 97% | $0.032 | 1.7m | 91% | |
| Qwen 3.5 27B | 98% | $0.028 | 2.0m | 92% | |
| GPT-OSS 120B | 97% | $0.0012 | 2.6m | 83% | |
| GPT-5.5 (Reasoning) | 100% | $0.083 | 39.8s | 99% | |
| GPT-5 Mini | 90% | $0.0084 | 50.9s | 60% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 41.0% | Dialogue to Total Word Ratio | ||
| 75.0% | Matches word count |