Dialogue tags
Various tasks related to dialogue tags in text.
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Muse Spark 1.1 (Reasoning, Medium) | 93% | $0.017 | 23.6s | |
| Muse Spark 1.1 (Reasoning, Minimal) | 77% | $0.0095 | 14.4s | |
| GPT-5 Mini | 83% | $0.0096 | 52.2s | |
| GPT-5.6 Sol (Reasoning) | 93% | $0.067 | 29.1s | |
| Z.AI GLM 5 Turbo | 87% | $0.030 | 1.3m | |
| Gemini 3.6 Flash (Reasoning) | 82% | $0.052 | 28.4s | |
| Z.AI GLM 5.2 (Reasoning, High) | 80% | $0.027 | 1.5m | |
| Inception Mercury 2 | 71% | $0.0037 | 6.1s | |
| GPT-5 | 84% | $0.049 | 1.4m | |
| Qwen 3.5 27B | 66% | $0.023 | 1.8m | |
| Claude Opus 4.6 | 73% | $0.013 | 14.7s | |
| GPT-5.4 (Reasoning) | 62% | $0.027 | 36.1s | |
| GPT-5.5 (Reasoning) | 62% | $0.043 | 26.8s | |
| GPT-5.6 Terra (Reasoning) | 64% | $0.023 | 15.0s | |
| Gemini 3 Flash (Preview, Reasoning) | 61% | $0.017 | 30.3s | |
| Nemotron 3 Super | 74% | $0.0000 | 2.5m | |
| Qwen 3.6 35B | 63% | $0.012 | 1.2m | |
| Claude Opus 4.6 (Reasoning) | 80% | $0.070 | 37.7s | |
| Qwen3.7 Max | 92% | $0.068 | 2.3m | |
| Gemini 3.5 Flash (Reasoning) | 92% | $0.119 | 49.9s | |
Cost vs Performance
Compares total cost for this test against the test score. Quadrant lines are drawn at the median values. Only models with available cost data are shown.
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Gemini 3.1 Pro (Preview) | 99% | 90% | 90% | |
| Muse Spark 1.1 (Reasoning, Medium) | 93% | 66% | 66% | |
| Qwen3.7 Max | 92% | 65% | 65% | |
| Gemini 3.5 Flash (Reasoning) | 92% | 57% | 57% | |
| GPT-5.6 Sol (Reasoning) | 93% | 55% | 55% | |
| GPT-5 Mini | 83% | 48% | 48% | |
| Z.AI GLM 5 Turbo | 87% | 48% | 48% | |
| o4 Mini High | 79% | 47% | 45% | |
| MiniMax M2.7 | 81% | 45% | 45% | |
| Claude Opus 4.6 (Reasoning) | 80% | 45% | 44% | |
| GPT-5 | 84% | 43% | 43% | |
| Z.AI GLM 5.1 | 83% | 43% | 43% | |
| MoonshotAI: Kimi K2.6 | 80% | 41% | 41% | |
| Z.AI GLM 5.2 (Reasoning, High) | 80% | 41% | 41% | |
| Gemini 3.6 Flash (Reasoning) | 82% | 39% | 39% | |
| Claude Sonnet 4.6 (Reasoning) | 75% | 40% | 38% | |
| Claude Opus 4.6 | 73% | 42% | 35% | |
| Claude Sonnet 4.6 | 67% | 50% | 35% | |
| Nemotron 3 Super | 74% | 36% | 34% | |
| MiniMax M2.5 | 74% | 43% | 33% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Muse Spark 1.1 (Reasoning, Medium) | 93% | $0.017 | 23.6s | 66% | |
| GPT-5 Mini | 83% | $0.0096 | 52.2s | 48% | |
| Inception Mercury 2 | 71% | $0.0037 | 6.1s | 31% | |
| Z.AI GLM 5 Turbo | 87% | $0.030 | 1.3m | 48% | |
| GPT-5.6 Sol (Reasoning) | 93% | $0.067 | 29.1s | 55% | |
| Claude Opus 4.6 | 73% | $0.013 | 14.7s | 35% | |
| Claude Sonnet 4.6 | 67% | $0.0074 | 12.1s | 35% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 77% | $0.0095 | 14.4s | 25% | |
| Z.AI GLM 5.2 (Reasoning, High) | 80% | $0.027 | 1.5m | 41% | |
| Claude Opus 4.8 (Reasoning, Low) | 68% | $0.020 | 14.7s | 29% | |
| Claude Opus 4.8 (Reasoning) | 69% | $0.020 | 15.2s | 27% | |
| Gemini 3.6 Flash (Reasoning) | 82% | $0.052 | 28.4s | 39% | |
| Qwen3.7 Max | 92% | $0.068 | 2.3m | 65% | |
| GPT-5 | 84% | $0.049 | 1.4m | 43% | |
| Gemini 3.1 Flash Lite (Reasoning) | 52% | $0.0006 | 4.1s | 23% | |
| Gemini 3.1 Pro (Preview) | 99% | $0.135 | 1.9m | 90% | |
| Gemini 3.1 Flash Lite (Preview) | 51% | $0.0006 | 2.7s | 23% | |
| Nemotron 3 Super | 74% | $0.0000 | 2.5m | 34% | |
| Claude Opus 4.5 | 64% | $0.013 | 13.5s | 19% | |
| GPT-4o Mini (temp=0) | 55% | $0.0003 | 7.8s | 19% | |
| Ungrouped | dialogue-200 | dialogue-500 | ||||||
|---|---|---|---|---|---|---|---|---|
| Model | Total â–¼ | Write unattributed dialogue | Write 200 words with 10% dialogue | Write 200 words with 50% dialogue | Write 200 words with 90% dialogue | Write 500 words with 30% dialogue | Write 500 words with 50% dialogue | Write 500 words with 70% dialogue |
| Gemini 3.1 Pro (Preview) | 99% | 100% | 100% | 100% | 99% | 96% | 100% | 100% |
| Muse Spark 1.1 (Reasoning, Medium) | 93% | 100% | 100% | 100% | 97% | 94% | 86% | 76% |
| GPT-5.6 Sol (Reasoning) | 93% | 100% | 99% | 100% | 100% | 91% | 100% | 58% |
| Qwen3.7 Max | 92% | 100% | 97% | 100% | 92% | 100% | 80% | 79% |
| Gemini 3.5 Flash (Reasoning) | 92% | 100% | 100% | 100% | 87% | 100% | 98% | 57% |
| Z.AI GLM 5 Turbo | 87% | 100% | 100% | 98% | 69% | 97% | 95% | 50% |
| GPT-5 | 84% | 100% | 100% | 95% | 63% | 84% | 95% | 54% |
| Z.AI GLM 5.1 | 83% | 100% | 100% | 98% | 79% | 86% | 81% | 39% |
| GPT-5 Mini | 83% | 90% | 100% | 90% | 62% | 87% | 79% | 70% |
| Gemini 3.6 Flash (Reasoning) | 82% | 100% | 100% | 100% | 90% | 82% | 82% | 21% |
| MiniMax M2.7 | 81% | 86% | 97% | 96% | 89% | 71% | 72% | 54% |
| Claude Opus 4.6 (Reasoning) | 80% | 100% | 100% | 90% | 94% | 68% | 53% | 57% |
| Z.AI GLM 5.2 (Reasoning, High) | 80% | 100% | 100% | 100% | 83% | 70% | 74% | 33% |
| MoonshotAI: Kimi K2.6 | 80% | 100% | 100% | 86% | 98% | 61% | 81% | 31% |
| o4 Mini High | 79% | 96% | 100% | 85% | 74% | 80% | 57% | 62% |
dialogue-200
Write 200 words with 10% dialogue
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Inception Mercury 2 | 90% | $0.0025 | 4.0s | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0041 | 24.5s | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | $0.0090 | 12.8s | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 89% | $0.0021 | 2.9s | |
| Claude Opus 4.5 | 96% | $0.0077 | 9.3s | |
| GPT-5.5 | 96% | $0.0087 | 8.9s | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | $0.011 | 15.4s | |
| Claude Haiku 4.5 | 76% | $0.0016 | 4.4s | |
| GPT-OSS 120B | 89% | $0.0015 | 1.5m | |
| Claude Opus 4.6 | 82% | $0.0079 | 9.7s | |
| GPT-5 Mini | 100% | $0.0088 | 45.8s | |
| GPT-5.4 Nano (Reasoning, Low) | 81% | $0.0025 | 15.4s | |
| GPT-5.6 Sol | 94% | $0.0089 | 8.0s | |
| Claude Opus 5 (Reasoning) | 89% | $0.015 | 13.7s | |
| Claude Sonnet 4 | 83% | $0.0046 | 7.5s | |
| Qwen 3.6 35B | 89% | $0.0075 | 53.0s | |
| GPT-5.2 | 100% | $0.026 | 29.9s | |
| MoonshotAI: Kimi K3 (Reasoning, Low) | 88% | $0.011 | 25.4s | |
| Claude Opus 5 (Reasoning, Low) | 92% | $0.019 | 13.7s | |
| Claude Opus 4.8 (Reasoning, Low) | 94% | $0.014 | 10.9s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | 100% | 100% | |
| GPT-5 | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 100% | 100% | |
| GPT-5 Mini | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| GPT-5.1 | 100% | 100% | 100% | |
| GPT-5.4 Nano (Reasoning) | 100% | 99% | 99% | |
| Qwen 3.5 397B A17B | 100% | 99% | 99% | |
| MoonshotAI: Kimi K2.6 | 100% | 99% | 99% | |
| GPT-5.2 | 100% | 99% | 99% | |
| Gemini 3 Flash (Preview, Reasoning) | 100% | 99% | 99% | |
| o4 Mini High | 100% | 98% | 98% | |
| Z.AI GLM 5.1 | 100% | 97% | 97% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | $0.0090 | 12.8s | 100% | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0041 | 24.5s | 99% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | $0.011 | 15.4s | 100% | |
| GPT-5 Mini | 100% | $0.0088 | 45.8s | 100% | |
| GPT-5.5 | 96% | $0.0087 | 8.9s | 90% | |
| Claude Opus 4.5 | 96% | $0.0077 | 9.3s | 88% | |
| GPT-5.2 | 100% | $0.026 | 29.9s | 99% | |
| Gemini 3 Flash (Preview, Reasoning) | 100% | $0.025 | 40.7s | 99% | |
| GPT-5.6 Sol | 94% | $0.0089 | 8.0s | 87% | |
| GPT-5.4 (Reasoning) | 100% | $0.034 | 38.8s | 100% | |
| Z.AI GLM 5 Turbo | 100% | $0.026 | 1.1m | 100% | |
| GPT-5.1 | 100% | $0.032 | 49.0s | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | $0.024 | 1.2m | 100% | |
| Claude Opus 4.8 (Reasoning, Low) | 94% | $0.014 | 10.9s | 85% | |
| GPT-5.6 Sol (Reasoning) | 99% | $0.045 | 18.9s | 95% | |
| Claude Opus 4.8 (Reasoning) | 92% | $0.014 | 11.5s | 83% | |
| Claude Opus 4.7 | 88% | $0.011 | 7.5s | 82% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 89% | $0.0021 | 2.9s | 74% | |
| Gemini 3.6 Flash (Reasoning) | 100% | $0.060 | 30.6s | 100% | |
| GPT-5.6 Terra (Reasoning) | 96% | $0.028 | 16.1s | 81% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 73.8% | Dialogue to Total Word Ratio | ||
| 84.0% | Matches word count |
Write 200 words with 50% dialogue
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Inception Mercury 2 | 97% | $0.0031 | 5.3s | |
| GPT-5.5 | 91% | $0.0094 | 8.9s | |
| Muse Spark 1.1 (Reasoning, Minimal) | 99% | $0.013 | 17.9s | |
| GPT-5.4 Nano (Reasoning) | 95% | $0.0072 | 34.0s | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | $0.016 | 21.6s | |
| GPT-5.4 Nano (Reasoning, Low) | 80% | $0.0027 | 15.2s | |
| GPT-5.6 Luna (Reasoning) | 100% | $0.020 | 19.2s | |
| GPT-5 Mini | 90% | $0.0084 | 50.9s | |
| Claude Opus 4.6 (Reasoning) | 90% | $0.034 | 20.9s | |
| GPT-5.6 Terra (Reasoning) | 99% | $0.030 | 16.7s | |
| GPT-OSS 120B | 97% | $0.0012 | 2.6m | |
| GPT-5.4 (Reasoning, Low) | 83% | $0.018 | 19.5s | |
| Gemini 3 Flash (Preview, Reasoning) | 87% | $0.024 | 39.7s | |
| Claude Opus 4.6 | 79% | $0.0081 | 9.6s | |
| Qwen 3.6 35B | 100% | $0.015 | 1.3m | |
| GPT-5.4 (Reasoning) | 100% | $0.042 | 47.1s | |
| GPT-5.1 | 95% | $0.038 | 1.1m | |
| GPT-5.5 (Reasoning, Low) | 98% | $0.041 | 23.6s | |
| GPT-5.6 Sol (Reasoning) | 100% | $0.050 | 22.0s | |
| Nemotron 3 Super | 90% | $0.0000 | 2.7m | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Qwen3.7 Max | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| GPT-5.6 Sol (Reasoning) | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| GPT-5.6 Luna (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 99% | 99% | |
| GPT-5.5 (Reasoning) | 100% | 99% | 99% | |
| Qwen 3.6 35B | 100% | 99% | 99% | |
| GPT-5.5 (Reasoning, Low) | 98% | 96% | 95% | |
| Claude Sonnet 4.6 (Reasoning) | 99% | 96% | 95% | |
| GPT-5.6 Terra (Reasoning) | 99% | 94% | 94% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 99% | 92% | 92% | |
| Qwen 3.5 397B A17B | 99% | 92% | 92% | |
| Qwen 3.5 27B | 98% | 92% | 92% | |
| Qwen 3.5 35B | 97% | 91% | 91% | |
| Z.AI GLM 5 Turbo | 98% | 90% | 90% | |
| Z.AI GLM 5.1 | 98% | 90% | 90% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Muse Spark 1.1 (Reasoning, Medium) | 100% | $0.016 | 21.6s | 100% | |
| GPT-5.6 Luna (Reasoning) | 100% | $0.020 | 19.2s | 100% | |
| Inception Mercury 2 | 97% | $0.0031 | 5.3s | 86% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 99% | $0.013 | 17.9s | 92% | |
| GPT-5.6 Terra (Reasoning) | 99% | $0.030 | 16.7s | 94% | |
| Qwen 3.6 35B | 100% | $0.015 | 1.3m | 99% | |
| GPT-5.6 Sol (Reasoning) | 100% | $0.050 | 22.0s | 100% | |
| GPT-5.5 (Reasoning, Low) | 98% | $0.041 | 23.6s | 95% | |
| GPT-5.4 (Reasoning) | 100% | $0.042 | 47.1s | 100% | |
| GPT-5.5 | 91% | $0.0094 | 8.9s | 74% | |
| Gemini 3.6 Flash (Reasoning) | 100% | $0.061 | 31.4s | 100% | |
| GPT-5.4 Nano (Reasoning) | 95% | $0.0072 | 34.0s | 70% | |
| Z.AI GLM 5 Turbo | 98% | $0.028 | 1.3m | 90% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | $0.037 | 1.8m | 99% | |
| GPT-4o, Aug. 6th (temp=0) | 83% | $0.0031 | 4.0s | 62% | |
| Qwen 3.5 35B | 97% | $0.032 | 1.7m | 91% | |
| Qwen 3.5 27B | 98% | $0.028 | 2.0m | 92% | |
| GPT-OSS 120B | 97% | $0.0012 | 2.6m | 83% | |
| GPT-5.5 (Reasoning) | 100% | $0.083 | 39.8s | 99% | |
| GPT-5 Mini | 90% | $0.0084 | 50.9s | 60% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 41.0% | Dialogue to Total Word Ratio | ||
| 75.0% | Matches word count |
Write 200 words with 90% dialogue
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-4o Mini (temp=0) | 97% | $0.0002 | 4.6s | |
| Claude Opus 4.6 | 94% | $0.0084 | 10.9s | |
| Claude Opus 4.6 (Reasoning) | 94% | $0.011 | 11.8s | |
| Inception Mercury 2 | 83% | $0.0027 | 4.1s | |
| Muse Spark 1.1 (Reasoning, Medium) | 97% | $0.013 | 18.1s | |
| Claude Opus 4.8 (Reasoning) | 91% | $0.013 | 10.4s | |
| Muse Spark 1.1 (Reasoning, Minimal) | 87% | $0.0062 | 9.7s | |
| DeepSeek V3.2 | 73% | $0.0002 | 23.1s | |
| GPT-OSS 120B | 81% | $0.0013 | 56.3s | |
| Claude Opus 4.5 | 78% | $0.0085 | 9.8s | |
| GPT-5.6 Luna (Reasoning) | 84% | $0.015 | 15.0s | |
| Claude Opus 4.7 (Reasoning) | 86% | $0.013 | 7.2s | |
| GPT-5.6 Sol | 75% | $0.011 | 8.7s | |
| Qwen 3.5 Flash | 82% | $0.0057 | 1.4m | |
| Nemotron 3 Super | 82% | $0.0000 | 1.2m | |
| MoonshotAI: Kimi K3 (Reasoning, Low) | 75% | $0.0053 | 14.8s | |
| Grok 4.5 (Reasoning, Low) | 77% | $0.0045 | 14.8s | |
| MoonshotAI: Kimi K3 (Reasoning, High) | 79% | $0.011 | 25.2s | |
| Claude Opus 5 (Reasoning) | 84% | $0.014 | 10.6s | |
| Qwen 3.6 35B | 81% | $0.011 | 51.9s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| GPT-5.6 Sol (Reasoning) | 100% | 100% | 100% | |
| MoonshotAI: Kimi K2.6 | 98% | 95% | 94% | |
| Gemini 3.1 Pro (Preview) | 99% | 94% | 94% | |
| GPT-4o Mini (temp=0) | 97% | 91% | 90% | |
| Muse Spark 1.1 (Reasoning, Medium) | 97% | 89% | 88% | |
| Grok 4.3 (Reasoning) | 97% | 89% | 88% | |
| Claude Opus 4.6 (Reasoning) | 94% | 85% | 83% | |
| Claude Opus 4.6 | 94% | 84% | 82% | |
| Qwen3.7 Max | 92% | 85% | 80% | |
| Claude Opus 4.8 (Reasoning) | 91% | 82% | 79% | |
| GPT-5.5 (Reasoning) | 93% | 80% | 79% | |
| Gemini 3.6 Flash (Reasoning) | 90% | 81% | 76% | |
| Claude Opus 4.8 (Reasoning, Low) | 84% | 88% | 74% | |
| Qwen 3.5 27B | 93% | 71% | 70% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 87% | 77% | 70% | |
| Claude Opus 4.7 (Reasoning) | 86% | 74% | 68% | |
| Grok 4.5 (Reasoning, High) | 91% | 70% | 68% | |
| Claude Opus 5 | 85% | 79% | 68% | |
| GPT-4o, Aug. 6th (temp=0) | 68% | 99% | 67% | |
| GPT-5.2 | 88% | 69% | 67% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-4o Mini (temp=0) | 97% | $0.0002 | 4.6s | 90% | |
| Muse Spark 1.1 (Reasoning, Medium) | 97% | $0.013 | 18.1s | 88% | |
| Claude Opus 4.6 | 94% | $0.0084 | 10.9s | 82% | |
| Claude Opus 4.6 (Reasoning) | 94% | $0.011 | 11.8s | 83% | |
| GPT-5.6 Sol (Reasoning) | 100% | $0.045 | 18.9s | 100% | |
| Claude Opus 4.8 (Reasoning) | 91% | $0.013 | 10.4s | 79% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 87% | $0.0062 | 9.7s | 70% | |
| Claude Opus 4.8 (Reasoning, Low) | 84% | $0.013 | 10.1s | 74% | |
| Claude Opus 4.7 (Reasoning) | 86% | $0.013 | 7.2s | 68% | |
| Claude Opus 5 | 85% | $0.013 | 10.8s | 68% | |
| Inception Mercury 2 | 83% | $0.0027 | 4.1s | 56% | |
| Claude Opus 5 (Reasoning) | 84% | $0.014 | 10.6s | 65% | |
| Gemini 3.6 Flash (Reasoning) | 90% | $0.032 | 17.8s | 76% | |
| GPT-4o, Aug. 6th (temp=0) | 68% | $0.0032 | 4.0s | 67% | |
| Claude Sonnet 4.6 | 77% | $0.0050 | 8.7s | 60% | |
| Z.AI GLM 5.2 (Reasoning, High) | 83% | $0.0076 | 31.1s | 62% | |
| Claude Opus 5 (Reasoning, Low) | 84% | $0.013 | 10.5s | 59% | |
| GPT-5.6 Luna (Reasoning) | 84% | $0.015 | 15.0s | 59% | |
| Claude Opus 4.5 | 78% | $0.0085 | 9.8s | 57% | |
| Claude Sonnet 5 | 79% | $0.0048 | 10.5s | 51% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 67.1% | Dialogue to Total Word Ratio | ||
| 63.0% | Matches word count |
dialogue-500
Write 500 words with 30% dialogue
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Muse Spark 1.1 (Reasoning, Medium) | 94% | $0.023 | 32.4s | |
| GPT-5 Mini | 87% | $0.013 | 1.1m | |
| Z.AI GLM 5 Turbo | 97% | $0.053 | 2.2m | |
| GPT-5.6 Sol (Reasoning) | 91% | $0.105 | 43.6s | |
| GPT-5 | 84% | $0.074 | 2.0m | |
| Gemini 3.6 Flash (Reasoning) | 82% | $0.072 | 40.0s | |
| MiniMax M2.5 | 74% | $0.024 | 3.9m | |
| Qwen3.7 Max | 100% | $0.095 | 3.6m | |
| o4 Mini High | 80% | $0.066 | 2.5m | |
| Gemini 3.1 Pro (Preview) | 96% | $0.176 | 2.3m | |
| Z.AI GLM 5.2 (Reasoning, High) | 70% | $0.036 | 1.9m | |
| Inception Mercury 2 | 58% | $0.0064 | 10.9s | |
| Gemini 3.5 Flash (Reasoning) | 100% | $0.221 | 1.5m | |
| Nemotron 3 Super | 71% | $0.0000 | 4.5m | |
| Grok 4.3 (Reasoning) | 71% | $0.047 | 3.7m | |
| Gemini 3 Flash (Preview) | 34% | $0.0021 | 6.8s | |
| Claude Sonnet 4.6 | 51% | $0.011 | 17.5s | |
| o4 Mini | 73% | $0.043 | 1.7m | |
| Claude Opus 4.5 | 52% | $0.018 | 19.6s | |
| Claude Opus 4.6 | 43% | $0.019 | 21.0s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Qwen3.7 Max | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | 98% | 98% | |
| Z.AI GLM 5 Turbo | 97% | 83% | 83% | |
| Muse Spark 1.1 (Reasoning, Medium) | 94% | 78% | 78% | |
| Gemini 3.1 Pro (Preview) | 96% | 76% | 76% | |
| GPT-5 Mini | 87% | 59% | 57% | |
| Z.AI GLM 5.1 | 86% | 57% | 56% | |
| Claude Sonnet 4.6 (Reasoning) | 82% | 58% | 55% | |
| Gemini 3.6 Flash (Reasoning) | 82% | 52% | 50% | |
| GPT-5.6 Sol (Reasoning) | 91% | 48% | 48% | |
| o4 Mini High | 80% | 47% | 45% | |
| MiniMax M2.7 | 71% | 63% | 43% | |
| Claude Sonnet 4.6 | 51% | 81% | 41% | |
| o4 Mini | 73% | 55% | 39% | |
| Claude Opus 4.8 (Reasoning, Low) | 50% | 71% | 37% | |
| GPT-5 | 84% | 36% | 36% | |
| Claude Opus 4.5 | 52% | 69% | 35% | |
| Grok 4.3 (Reasoning) | 71% | 48% | 34% | |
| MiniMax M2.5 | 74% | 34% | 33% | |
| Nemotron 3 Super | 71% | 36% | 32% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Muse Spark 1.1 (Reasoning, Medium) | 94% | $0.023 | 32.4s | 78% | |
| Z.AI GLM 5 Turbo | 97% | $0.053 | 2.2m | 83% | |
| GPT-5 Mini | 87% | $0.013 | 1.1m | 57% | |
| Qwen3.7 Max | 100% | $0.095 | 3.6m | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | $0.221 | 1.5m | 98% | |
| Gemini 3.6 Flash (Reasoning) | 82% | $0.072 | 40.0s | 50% | |
| GPT-5.6 Sol (Reasoning) | 91% | $0.105 | 43.6s | 48% | |
| Claude Sonnet 4.6 | 51% | $0.011 | 17.5s | 41% | |
| Gemini 3.1 Pro (Preview) | 96% | $0.176 | 2.3m | 76% | |
| Inception Mercury 2 | 58% | $0.0064 | 10.9s | 26% | |
| o4 Mini | 73% | $0.043 | 1.7m | 39% | |
| Claude Opus 4.5 | 52% | $0.018 | 19.6s | 35% | |
| o4 Mini High | 80% | $0.066 | 2.5m | 45% | |
| Claude Opus 4.8 (Reasoning, Low) | 50% | $0.028 | 21.0s | 37% | |
| GPT-5 | 84% | $0.074 | 2.0m | 36% | |
| Claude Opus 4.8 (Reasoning) | 50% | $0.028 | 21.1s | 29% | |
| Z.AI GLM 5.2 (Reasoning, High) | 70% | $0.036 | 1.9m | 28% | |
| Claude Opus 5 (Reasoning, Low) | 49% | $0.030 | 22.5s | 25% | |
| Claude Sonnet 5 (Reasoning, Low) | 37% | $0.011 | 18.0s | 30% | |
| Gemini 3 Flash (Preview) | 34% | $0.0021 | 6.8s | 27% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 12.2% | Dialogue to Total Word Ratio | ||
| 21.8% | Matches word count |
Write 500 words with 50% dialogue
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Muse Spark 1.1 (Reasoning, Minimal) | 88% | $0.016 | 22.0s | |
| Muse Spark 1.1 (Reasoning, Medium) | 86% | $0.024 | 32.6s | |
| GPT-5 Mini | 79% | $0.012 | 1.2m | |
| GPT-5 | 95% | $0.059 | 1.5m | |
| Z.AI GLM 5 Turbo | 95% | $0.055 | 2.2m | |
| Claude Opus 4.6 | 71% | $0.019 | 20.3s | |
| Gemini 3.6 Flash (Reasoning) | 82% | $0.089 | 46.6s | |
| Z.AI GLM 5.2 (Reasoning, High) | 74% | $0.051 | 2.8m | |
| Inception Mercury 2 | 56% | $0.0058 | 9.1s | |
| GPT-5.6 Sol (Reasoning) | 100% | $0.131 | 50.8s | |
| Qwen3.7 Max | 80% | $0.086 | 2.9m | |
| o4 Mini | 67% | $0.030 | 1.3m | |
| Claude Sonnet 4.6 | 49% | $0.011 | 17.6s | |
| Claude Opus 4.6 (Reasoning) | 53% | $0.026 | 24.3s | |
| Gemini 3.1 Flash Lite (Reasoning) | 32% | $0.0010 | 4.1s | |
| Claude Sonnet 5 (Reasoning) | 40% | $0.011 | 17.6s | |
| GPT-4o Mini (temp=0) | 29% | $0.0005 | 13.5s | |
| Nemotron 3 Super | 57% | $0.0000 | 3.2m | |
| Claude Opus 4.5 | 37% | $0.019 | 18.9s | |
| Claude Opus 4.8 (Reasoning, Low) | 48% | $0.029 | 20.7s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| GPT-5.6 Sol (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning) | 98% | 92% | 92% | |
| Z.AI GLM 5 Turbo | 95% | 79% | 79% | |
| GPT-5 | 95% | 70% | 70% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 88% | 61% | 60% | |
| Muse Spark 1.1 (Reasoning, Medium) | 86% | 60% | 60% | |
| MoonshotAI: Kimi K2.6 | 81% | 56% | 51% | |
| Gemini 3.6 Flash (Reasoning) | 82% | 55% | 51% | |
| GPT-5 Mini | 79% | 58% | 48% | |
| Claude Opus 4.8 (Reasoning, Low) | 48% | 93% | 46% | |
| Claude Opus 4.8 (Reasoning) | 47% | 90% | 45% | |
| Claude Opus 4.6 | 71% | 59% | 43% | |
| Qwen3.7 Max | 80% | 41% | 41% | |
| Z.AI GLM 5.2 (Reasoning, High) | 74% | 43% | 39% | |
| Z.AI GLM 5.1 | 81% | 36% | 34% | |
| Claude Sonnet 4.6 | 49% | 67% | 32% | |
| MiniMax M2.7 | 72% | 37% | 31% | |
| o4 Mini | 67% | 53% | 30% | |
| Claude Sonnet 4.6 (Reasoning) | 50% | 58% | 28% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Muse Spark 1.1 (Reasoning, Minimal) | 88% | $0.016 | 22.0s | 60% | |
| Muse Spark 1.1 (Reasoning, Medium) | 86% | $0.024 | 32.6s | 60% | |
| Z.AI GLM 5 Turbo | 95% | $0.055 | 2.2m | 79% | |
| GPT-5.6 Sol (Reasoning) | 100% | $0.131 | 50.8s | 100% | |
| GPT-5 | 95% | $0.059 | 1.5m | 70% | |
| GPT-5 Mini | 79% | $0.012 | 1.2m | 48% | |
| Claude Opus 4.6 | 71% | $0.019 | 20.3s | 43% | |
| Gemini 3.5 Flash (Reasoning) | 98% | $0.187 | 1.3m | 92% | |
| Gemini 3.6 Flash (Reasoning) | 82% | $0.089 | 46.6s | 51% | |
| Gemini 3.1 Pro (Preview) | 100% | $0.189 | 2.6m | 100% | |
| Claude Opus 4.8 (Reasoning, Low) | 48% | $0.029 | 20.7s | 46% | |
| Claude Opus 4.8 (Reasoning) | 47% | $0.029 | 21.4s | 45% | |
| Claude Sonnet 4.6 | 49% | $0.011 | 17.6s | 32% | |
| Inception Mercury 2 | 56% | $0.0058 | 9.1s | 20% | |
| o4 Mini | 67% | $0.030 | 1.3m | 30% | |
| Z.AI GLM 5.2 (Reasoning, High) | 74% | $0.051 | 2.8m | 39% | |
| Claude Opus 4.6 (Reasoning) | 53% | $0.026 | 24.3s | 25% | |
| Claude Sonnet 5 (Reasoning) | 40% | $0.011 | 17.6s | 27% | |
| Gemini 3.1 Flash Lite (Reasoning) | 32% | $0.0010 | 4.1s | 26% | |
| Gemini 3.1 Flash Lite (Preview) | 32% | $0.0009 | 3.8s | 23% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 17.3% | Dialogue to Total Word Ratio | ||
| 19.2% | Matches word count |
Write 500 words with 70% dialogue
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Muse Spark 1.1 (Reasoning, Medium) | 76% | $0.024 | 33.8s | |
| Claude Sonnet 5 | 67% | $0.011 | 17.9s | |
| Nemotron 3 Super | 74% | $0.0000 | 3.3m | |
| GPT-5 Mini | 70% | $0.014 | 1.2m | |
| Inception Mercury 2 | 34% | $0.0047 | 7.3s | |
| Claude Opus 4.6 (Reasoning) | 57% | $0.021 | 22.2s | |
| Mistral Medium 3.1 | 44% | $0.0017 | 18.0s | |
| GPT-4o, Aug. 6th (temp=1) | 45% | $0.0074 | 8.9s | |
| Gemini 2.5 Flash Lite (Reasoning) | 28% | $0.0022 | 26.4s | |
| Gemini 3.1 Flash Lite (Reasoning) | 38% | $0.0010 | 4.0s | |
| Claude Sonnet 5 (Reasoning) | 45% | $0.011 | 17.8s | |
| GPT-4o Mini (temp=0) | 32% | $0.0005 | 11.7s | |
| Claude Opus 4.8 (Reasoning) | 54% | $0.029 | 21.2s | |
| GPT-4o, Aug. 6th (temp=0) | 54% | $0.0070 | 8.2s | |
| Claude Opus 4.8 (Reasoning, Low) | 52% | $0.029 | 20.7s | |
| Qwen3.7 Max | 79% | $0.085 | 2.9m | |
| Gemini 3.1 Flash Lite | 32% | $0.0010 | 7.0s | |
| Claude Opus 4.6 | 41% | $0.019 | 21.7s | |
| DeepSeek-V2 Chat | 40% | $0.0002 | 41.2s | |
| GPT-5 | 54% | $0.051 | 1.5m | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Claude Opus 4.8 (Reasoning) | 54% | 86% | 43% | |
| Qwen3.7 Max | 79% | 49% | 42% | |
| Nemotron 3 Super | 74% | 44% | 38% | |
| Claude Opus 4.8 (Reasoning, Low) | 52% | 72% | 36% | |
| Claude Sonnet 5 | 67% | 49% | 35% | |
| Muse Spark 1.1 (Reasoning, Medium) | 76% | 38% | 34% | |
| Claude Opus 4.6 | 41% | 67% | 31% | |
| Gemini 3.1 Flash Lite (Reasoning) | 38% | 71% | 30% | |
| Inception Mercury 2 | 34% | 60% | 29% | |
| Claude Opus 4.6 (Reasoning) | 57% | 54% | 29% | |
| o4 Mini High | 62% | 43% | 28% | |
| Claude Opus 5 (Reasoning, Low) | 39% | 61% | 27% | |
| GPT-4o Mini (temp=0) | 32% | 62% | 26% | |
| Claude Sonnet 5 (Reasoning) | 45% | 55% | 25% | |
| GPT-5 Mini | 70% | 34% | 25% | |
| MiniMax M2.5 | 55% | 50% | 25% | |
| Gemini 2.5 Flash Lite (Reasoning) | 28% | 55% | 24% | |
| Claude Sonnet 4.6 | 37% | 62% | 23% | |
| MiniMax M2.7 | 54% | 42% | 21% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Claude Sonnet 5 | 67% | $0.011 | 17.9s | 35% | |
| Muse Spark 1.1 (Reasoning, Medium) | 76% | $0.024 | 33.8s | 34% | |
| Claude Opus 4.8 (Reasoning) | 54% | $0.029 | 21.2s | 43% | |
| GPT-5 Mini | 70% | $0.014 | 1.2m | 25% | |
| Claude Opus 4.6 (Reasoning) | 57% | $0.021 | 22.2s | 29% | |
| Claude Opus 4.8 (Reasoning, Low) | 52% | $0.029 | 20.7s | 36% | |
| Gemini 3.1 Flash Lite (Reasoning) | 38% | $0.0010 | 4.0s | 30% | |
| GPT-4o, Aug. 6th (temp=0) | 54% | $0.0070 | 8.2s | 17% | |
| Nemotron 3 Super | 74% | $0.0000 | 3.3m | 38% | |
| Claude Sonnet 5 (Reasoning) | 45% | $0.011 | 17.8s | 25% | |
| Inception Mercury 2 | 34% | $0.0047 | 7.3s | 29% | |
| Claude Opus 4.6 | 41% | $0.019 | 21.7s | 31% | |
| Mistral Medium 3.1 | 44% | $0.0017 | 18.0s | 17% | |
| GPT-4o Mini (temp=0) | 32% | $0.0005 | 11.7s | 26% | |
| GPT-4o, Aug. 6th (temp=1) | 45% | $0.0074 | 8.9s | 13% | |
| Claude Sonnet 4.6 | 37% | $0.011 | 17.3s | 23% | |
| Gemini 3.1 Pro (Preview) | 100% | $0.229 | 3.3m | 100% | |
| Claude Opus 5 (Reasoning, Low) | 39% | $0.030 | 22.0s | 27% | |
| DeepSeek-V2 Chat | 40% | $0.0002 | 41.2s | 18% | |
| Gemini 3.1 Flash Lite | 32% | $0.0010 | 7.0s | 17% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 16.8% | Dialogue to Total Word Ratio | ||
| 14.2% | Matches word count |
Ungrouped
Write unattributed dialogue
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Gemini 2.5 Flash Lite | 96% | $0.0001 | 1.4s | |
| Ministral 3 14B | 100% | $0.0001 | 8.2s | |
| Mistral Small 3.2 24B | 100% | $0.0001 | 4.1s | |
| Mistral Small 4 | 100% | $0.0002 | 2.9s | |
| GPT-4o Mini (temp=0) | 100% | $0.0002 | 3.4s | |
| Gemini 3.1 Flash Lite (Preview) | 100% | $0.0004 | 2.0s | |
| Gemini 3.1 Flash Lite (Reasoning) | 100% | $0.0004 | 3.6s | |
| Qwen3 235B A22B Instruct 2507 | 100% | $0.0001 | 8.3s | |
| Gemini 3.1 Flash Lite | 100% | $0.0004 | 2.0s | |
| Llama 3.1 70B | 96% | $0.0003 | 3.2s | |
| DeepSeek V4 Flash | 100% | $0.0001 | 6.8s | |
| Gemma 3 12B | 100% | $0.0000 | 7.4s | |
| GPT-4.1 Mini | 87% | $0.0004 | 3.3s | |
| Gemini 3.5 Flash Lite (Reasoning) | 100% | $0.0006 | 1.6s | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 100% | $0.0006 | 1.7s | |
| DeepSeek V4 Flash (Reasoning) | 100% | $0.0001 | 6.3s | |
| Cydonia 24B V4.1 | 86% | $0.0002 | 6.2s | |
| GPT-4o Mini (temp=1) | 100% | $0.0002 | 15.5s | |
| Z.AI GLM 4.5 | 96% | $0.0005 | 5.8s | |
| Gemini 3 Flash (Preview) | 100% | $0.0009 | 3.2s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| GPT-5.6 Sol (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Qwen3.7 Max | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.1 | 100% | 100% | 100% | |
| Qwen3.6 Max Preview | 100% | 100% | 100% | |
| GPT-5.5 (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| MoonshotAI: Kimi K3 (Reasoning, High) | 100% | 100% | 100% | |
| MoonshotAI: Kimi K2.6 | 100% | 100% | 100% | |
| Claude Opus 4.7 (Reasoning) | 100% | 100% | 100% | |
| GPT-5.5 (Reasoning, Low) | 100% | 100% | 100% | |
| Claude Opus 4.8 (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.6 | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Mistral Small 4 | 100% | $0.0002 | 2.9s | 100% | |
| Gemini 3.1 Flash Lite (Preview) | 100% | $0.0004 | 2.0s | 100% | |
| GPT-4o Mini (temp=0) | 100% | $0.0002 | 3.4s | 100% | |
| Gemini 3.1 Flash Lite | 100% | $0.0004 | 2.0s | 100% | |
| Mistral Small 3.2 24B | 100% | $0.0001 | 4.1s | 100% | |
| Gemini 3.5 Flash Lite (Reasoning) | 100% | $0.0006 | 1.6s | 100% | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 100% | $0.0006 | 1.7s | 100% | |
| Gemini 3.1 Flash Lite (Reasoning) | 100% | $0.0004 | 3.6s | 100% | |
| DeepSeek V4 Flash (Reasoning) | 100% | $0.0001 | 6.3s | 100% | |
| DeepSeek V4 Flash | 100% | $0.0001 | 6.8s | 100% | |
| Gemma 3 12B | 100% | $0.0000 | 7.4s | 100% | |
| Gemini 3 Flash (Preview) | 100% | $0.0009 | 3.2s | 100% | |
| Ministral 3 14B | 100% | $0.0001 | 8.2s | 100% | |
| Grok 4.20 | 100% | $0.0007 | 4.9s | 100% | |
| Qwen3 235B A22B Instruct 2507 | 100% | $0.0001 | 8.3s | 100% | |
| Mistral Medium 3.1 | 100% | $0.0006 | 6.1s | 100% | |
| Mistral Large 3 | 100% | $0.0005 | 7.2s | 100% | |
| DeepSeek V3 (2024-12-26) | 100% | $0.0004 | 10.1s | 100% | |
| Gemma 3 27B | 100% | $0.0001 | 12.5s | 100% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | $0.0022 | 2.7s | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 100.0% | Count dialogue tags |