Dialogue tags
Various tasks related to dialogue tags in text.
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Muse Spark 1.1 (Reasoning, Medium) | 93% | $0.017 | 23.6s | |
| Muse Spark 1.1 (Reasoning, Minimal) | 77% | $0.0095 | 14.4s | |
| Muse Spark 1.2 (Reasoning, Medium) | 99% | $0.022 | 24.9s | |
| DeepSeek V4.1 Flash (Reasoning, High) | 88% | $0.0050 | 48.2s | |
| Gemini 3.8 Flash (Reasoning, Medium) | 92% | $0.028 | 22.3s | |
| GPT-6 Luna (Reasoning, High) | 77% | $0.0021 | 42.7s | |
| GPT-5 Mini | 83% | $0.0096 | 52.2s | |
| Gemini 3.7 Flash (Reasoning, Medium) | 75% | $0.018 | 19.5s | |
| Muse Spark 1.3 (Reasoning, Medium) | 98% | $0.026 | 1.3m | |
| GPT-5.6 Sol (Reasoning, Medium) | 93% | $0.067 | 29.1s | |
| GPT-6 Luna (Reasoning, Medium) | 68% | $0.0010 | 22.6s | |
| Qwen 3.8 Flash (Reasoning) | 98% | $0.0061 | 2.5m | |
| Claude Opus 5.5 (Reasoning) | 83% | $0.041 | 23.9s | |
| Z.AI GLM 5 Turbo | 87% | $0.030 | 1.3m | |
| Gemini 3.6 Flash (Reasoning) | 82% | $0.052 | 28.4s | |
| GPT-6 Sol (Reasoning, Medium) | 70% | $0.011 | 21.8s | |
| Z.AI GLM 5.2 (Reasoning, High) | 80% | $0.027 | 1.5m | |
| Qwen 3.8 27B (Reasoning, XHigh) | 93% | $0.029 | 3.1m | |
| Inception Mercury 2 | 71% | $0.0037 | 6.1s | |
| GPT-5 | 84% | $0.049 | 1.4m | |
Cost vs Performance
Compares total cost for this test against the test score. Quadrant lines are drawn at the median values. Only models with available cost data are shown.
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Muse Spark 1.2 (Reasoning, Medium) | 99% | 91% | 91% | |
| Gemini 3.1 Pro (Preview) | 99% | 90% | 90% | |
| Hy4 Preview (Reasoning, High) | 98% | 85% | 85% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 98% | 84% | 84% | |
| Qwen 3.8 Flash (Reasoning) | 98% | 83% | 83% | |
| Muse Spark 1.3 (Reasoning, Medium) | 98% | 78% | 78% | |
| Muse Spark 1.1 (Reasoning, Medium) | 93% | 66% | 66% | |
| Qwen 3.7 Max | 92% | 65% | 65% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 92% | 60% | 60% | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 85% | 58% | 57% | |
| Gemini 3.5 Flash (Reasoning) | 92% | 57% | 57% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 88% | 56% | 56% | |
| GPT-5.6 Sol (Reasoning, Medium) | 93% | 55% | 55% | |
| Qwen 3.8 27B (Reasoning, XHigh) | 93% | 54% | 54% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 87% | 54% | 53% | |
| Claude Opus 5.5 (Reasoning) | 83% | 50% | 49% | |
| GPT-5 Mini | 83% | 48% | 48% | |
| Z.AI GLM 5 Turbo | 87% | 48% | 48% | |
| o4 Mini High | 79% | 47% | 45% | |
| MiniMax M2.7 | 81% | 45% | 45% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Muse Spark 1.2 (Reasoning, Medium) | 99% | $0.022 | 24.9s | 91% | |
| Muse Spark 1.1 (Reasoning, Medium) | 93% | $0.017 | 23.6s | 66% | |
| Muse Spark 1.3 (Reasoning, Medium) | 98% | $0.026 | 1.3m | 78% | |
| Qwen 3.8 Flash (Reasoning) | 98% | $0.0061 | 2.5m | 83% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 88% | $0.0050 | 48.2s | 56% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 92% | $0.028 | 22.3s | 60% | |
| GPT-5 Mini | 83% | $0.0096 | 52.2s | 48% | |
| Claude Opus 5.5 (Reasoning) | 83% | $0.041 | 23.9s | 49% | |
| Hy4 Preview (Reasoning, High) | 98% | $0.043 | 3.9m | 85% | |
| Inception Mercury 2 | 71% | $0.0037 | 6.1s | 31% | |
| GPT-6 Luna (Reasoning, High) | 77% | $0.0021 | 42.7s | 32% | |
| Z.AI GLM 5 Turbo | 87% | $0.030 | 1.3m | 48% | |
| GPT-5.6 Sol (Reasoning, Medium) | 93% | $0.067 | 29.1s | 55% | |
| Claude Opus 4.6 | 73% | $0.013 | 14.7s | 35% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 98% | $0.057 | 3.4m | 84% | |
| Claude Sonnet 4.6 | 67% | $0.0074 | 12.1s | 35% | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 85% | $0.0023 | 3.3m | 57% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 77% | $0.0095 | 14.4s | 25% | |
| GPT-6 Sol (Reasoning, Medium) | 70% | $0.011 | 21.8s | 29% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 75% | $0.018 | 19.5s | 27% | |
| Ungrouped | dialogue-200 | dialogue-500 | ||||||
|---|---|---|---|---|---|---|---|---|
| Model | Total â–¼ | Write unattributed dialogue | Write 200 words with 10% dialogue | Write 200 words with 50% dialogue | Write 200 words with 90% dialogue | Write 500 words with 30% dialogue | Write 500 words with 50% dialogue | Write 500 words with 70% dialogue |
| Gemini 3.1 Pro (Preview) | 99% | 100% | 100% | 100% | 99% | 96% | 100% | 100% |
| Muse Spark 1.2 (Reasoning, Medium) | 99% | 100% | 100% | 100% | 98% | 99% | 100% | 95% |
| Qwen 3.8 Max (Reasoning, XHigh) | 98% | 100% | 100% | 95% | 94% | 100% | 100% | 100% |
| Muse Spark 1.3 (Reasoning, Medium) | 98% | 100% | 100% | 100% | 100% | 100% | 100% | 87% |
| Hy4 Preview (Reasoning, High) | 98% | 100% | 100% | 100% | 100% | 99% | 97% | 90% |
| Qwen 3.8 Flash (Reasoning) | 98% | 100% | 94% | 100% | 93% | 100% | 100% | 98% |
| Muse Spark 1.1 (Reasoning, Medium) | 93% | 100% | 100% | 100% | 97% | 94% | 86% | 76% |
| Qwen 3.8 27B (Reasoning, XHigh) | 93% | 90% | 100% | 100% | 93% | 81% | 91% | 96% |
| GPT-5.6 Sol (Reasoning, Medium) | 93% | 100% | 99% | 100% | 100% | 91% | 100% | 58% |
| Qwen 3.7 Max | 92% | 100% | 97% | 100% | 92% | 100% | 80% | 79% |
| Gemini 3.8 Flash (Reasoning, Medium) | 92% | 100% | 100% | 100% | 95% | 93% | 100% | 53% |
| Gemini 3.5 Flash (Reasoning) | 92% | 100% | 100% | 100% | 87% | 100% | 98% | 57% |
| DeepSeek V4.1 Flash (Reasoning, High) | 88% | 100% | 96% | 100% | 72% | 90% | 88% | 67% |
| Z.AI GLM 5 Turbo | 87% | 100% | 100% | 98% | 69% | 97% | 95% | 50% |
| Z.AI GLM 5.3 (Reasoning, Max) | 87% | 100% | 99% | 99% | 92% | 84% | 71% | 62% |
dialogue-200
Write 200 words with 10% dialogue
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Inception Mercury 2 | 90% | $0.0025 | 4.0s | |
| DeepSeek V4.1 Flash (Reasoning, High) | 96% | $0.0025 | 17.1s | |
| GPT-6 Luna (Reasoning, Medium) | 100% | $0.0013 | 29.1s | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0041 | 24.5s | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | $0.0090 | 12.8s | |
| GPT-6 Luna (Reasoning, High) | 100% | $0.0021 | 41.9s | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 89% | $0.0021 | 2.9s | |
| Claude Opus 4.5 | 96% | $0.0077 | 9.3s | |
| GPT-5.5 | 96% | $0.0087 | 8.9s | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | $0.011 | 15.4s | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | $0.013 | 13.9s | |
| Claude Haiku 4.5 | 76% | $0.0016 | 4.4s | |
| GPT-OSS 120B | 89% | $0.0015 | 1.5m | |
| Claude Opus 4.6 | 82% | $0.0079 | 9.7s | |
| GPT-6 Sol (Reasoning, Medium) | 100% | $0.014 | 24.3s | |
| GPT-5 Mini | 100% | $0.0088 | 45.8s | |
| GPT-5.4 Nano (Reasoning, Low) | 81% | $0.0025 | 15.4s | |
| GPT-6 Sol | 86% | $0.0028 | 7.2s | |
| GPT-5.6 Sol | 94% | $0.0089 | 8.0s | |
| Claude Opus 5 (Reasoning) | 89% | $0.015 | 13.7s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| DeepSeek V4 Pro 0813 (Reasoning, High) | 100% | 100% | 100% | |
| GPT-5 | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | 100% | 100% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | 100% | 100% | |
| Qwen 3.8 27B (Reasoning, XHigh) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 100% | 100% | |
| Grok 4.7 (Reasoning, High) | 100% | 100% | 100% | |
| GPT-6 Luna (Reasoning, Medium) | 100% | 100% | 100% | |
| GPT-5 Mini | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-6 Luna (Reasoning, Medium) | 100% | $0.0013 | 29.1s | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | $0.0090 | 12.8s | 100% | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0041 | 24.5s | 99% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | $0.011 | 15.4s | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | $0.013 | 13.9s | 100% | |
| GPT-6 Luna (Reasoning, High) | 100% | $0.0021 | 41.9s | 100% | |
| GPT-6 Sol (Reasoning, Medium) | 100% | $0.014 | 24.3s | 99% | |
| GPT-5 Mini | 100% | $0.0088 | 45.8s | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | $0.020 | 24.6s | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | $0.025 | 18.8s | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | $0.015 | 47.7s | 100% | |
| GPT-5.5 | 96% | $0.0087 | 8.9s | 90% | |
| Claude Opus 4.5 | 96% | $0.0077 | 9.3s | 88% | |
| GPT-5.2 | 100% | $0.026 | 29.9s | 99% | |
| Gemini 3 Flash (Preview, Reasoning) | 100% | $0.025 | 40.7s | 99% | |
| GPT-5.6 Sol | 94% | $0.0089 | 8.0s | 87% | |
| GPT-5.4 (Reasoning) | 100% | $0.034 | 38.8s | 100% | |
| Z.AI GLM 5 Turbo | 100% | $0.026 | 1.1m | 100% | |
| GPT-5.1 | 100% | $0.032 | 49.0s | 100% | |
| DeepSeek V4 Pro 0813 (Reasoning, High) | 100% | $0.023 | 1.2m | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 83.9% | Dialogue to Total Word Ratio | ||
| 85.7% | Matches word count |
Write 200 words with 50% dialogue
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Inception Mercury 2 | 97% | $0.0031 | 5.3s | |
| GPT-6 Luna (Reasoning, Medium) | 96% | $0.0015 | 29.9s | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0040 | 38.9s | |
| GPT-6 Luna (Reasoning, High) | 100% | $0.0024 | 40.8s | |
| GPT-5.5 | 91% | $0.0094 | 8.9s | |
| Muse Spark 1.1 (Reasoning, Minimal) | 99% | $0.013 | 17.9s | |
| GPT-5.4 Nano (Reasoning) | 95% | $0.0072 | 34.0s | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | $0.016 | 21.6s | |
| Muse Glimmer 30B (Reasoning, Medium) | 88% | $0.0026 | 37.9s | |
| GPT-5.4 Nano (Reasoning, Low) | 80% | $0.0027 | 15.2s | |
| GPT-6 Sol (Reasoning, Medium) | 100% | $0.017 | 22.8s | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | $0.019 | 20.2s | |
| GPT-5.6 Luna (Reasoning, Medium) | 100% | $0.020 | 19.2s | |
| GPT-5 Mini | 90% | $0.0084 | 50.9s | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | $0.025 | 20.4s | |
| Claude Opus 4.6 (Reasoning) | 90% | $0.034 | 20.9s | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | $0.023 | 26.1s | |
| GPT-5.6 Terra (Reasoning, Medium) | 99% | $0.030 | 16.7s | |
| GPT-OSS 120B | 97% | $0.0012 | 2.6m | |
| GPT-5.4 (Reasoning, Low) | 83% | $0.018 | 19.5s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| Qwen 3.8 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | 100% | 100% | |
| Qwen 3.8 27B (Reasoning, XHigh) | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| GPT-6 Sol (Reasoning, Medium) | 100% | 100% | 100% | |
| GPT-6 Luna (Reasoning, High) | 100% | 100% | 100% | |
| GPT-5.6 Sol (Reasoning, Medium) | 100% | 100% | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | |
| Hy4 Preview (Reasoning, High) | 100% | 100% | 100% | |
| DeepSeek V4 Pro 0813 (Reasoning, High) | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| GPT-5.6 Luna (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 99% | 99% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-6 Luna (Reasoning, High) | 100% | $0.0024 | 40.8s | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0040 | 38.9s | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | $0.016 | 21.6s | 100% | |
| GPT-6 Sol (Reasoning, Medium) | 100% | $0.017 | 22.8s | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | $0.019 | 20.2s | 100% | |
| GPT-5.6 Luna (Reasoning, Medium) | 100% | $0.020 | 19.2s | 100% | |
| Inception Mercury 2 | 97% | $0.0031 | 5.3s | 86% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | $0.025 | 20.4s | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 99% | $0.013 | 17.9s | 92% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | $0.023 | 26.1s | 100% | |
| GPT-5.6 Terra (Reasoning, Medium) | 99% | $0.030 | 16.7s | 94% | |
| Qwen 3.6 35B | 100% | $0.015 | 1.3m | 99% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | $0.022 | 1.1m | 100% | |
| Qwen 3.8 Flash (Reasoning) | 100% | $0.0047 | 1.9m | 100% | |
| Claude Opus 5.5 (Reasoning) | 99% | $0.038 | 21.7s | 97% | |
| GPT-6 Luna (Reasoning, Medium) | 96% | $0.0015 | 29.9s | 78% | |
| GPT-5.6 Sol (Reasoning, Medium) | 100% | $0.050 | 22.0s | 100% | |
| GPT-5.5 (Reasoning, Low) | 98% | $0.041 | 23.6s | 95% | |
| GPT-5.4 (Reasoning) | 100% | $0.042 | 47.1s | 100% | |
| GPT-5.5 | 91% | $0.0094 | 8.9s | 74% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 51.9% | Dialogue to Total Word Ratio | ||
| 82.3% | Matches word count |
Write 200 words with 90% dialogue
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-4o Mini (temp=0) | 97% | $0.0002 | 4.6s | |
| Claude Opus 4.6 | 94% | $0.0084 | 10.9s | |
| Claude Opus 4.6 (Reasoning) | 94% | $0.011 | 11.8s | |
| Inception Mercury 2 | 83% | $0.0027 | 4.1s | |
| Muse Spark 1.1 (Reasoning, Medium) | 97% | $0.013 | 18.1s | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 90% | $0.0007 | 1.2m | |
| Claude Opus 4.8 (Reasoning) | 91% | $0.013 | 10.4s | |
| Aion 3.5 (Reasoning, High) | 78% | $0.0037 | 15.1s | |
| Muse Spark 1.2 (Reasoning, Medium) | 98% | $0.018 | 20.0s | |
| Muse Spark 1.1 (Reasoning, Minimal) | 87% | $0.0062 | 9.7s | |
| Qwen 3.7 Flash (Reasoning) | 86% | $0.0008 | 35.3s | |
| DeepSeek V3.2 | 73% | $0.0002 | 23.1s | |
| GPT-OSS 120B | 81% | $0.0013 | 56.3s | |
| Gemini 3.8 Flash (Reasoning, Medium) | 95% | $0.019 | 14.5s | |
| GPT-6 Luna (Reasoning, Medium) | 82% | $0.0011 | 26.3s | |
| Claude Opus 4.5 | 78% | $0.0085 | 9.8s | |
| DeepSeek V4 Flash 0731 (Reasoning, High) | 79% | $0.0002 | 17.9s | |
| GPT-5.6 Luna (Reasoning, Medium) | 84% | $0.015 | 15.0s | |
| Claude Opus 4.7 (Reasoning) | 86% | $0.013 | 7.2s | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | $0.020 | 55.9s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| Hy4 Preview (Reasoning, High) | 100% | 100% | 100% | |
| GPT-5.6 Sol (Reasoning, Medium) | 100% | 100% | 100% | |
| Kimi K2.6 | 98% | 95% | 94% | |
| Gemini 3.1 Pro (Preview) | 99% | 94% | 94% | |
| GPT-4o Mini (temp=0) | 97% | 91% | 90% | |
| Muse Spark 1.2 (Reasoning, Medium) | 98% | 90% | 90% | |
| Claude Opus 5.5 (Reasoning) | 96% | 92% | 89% | |
| Muse Spark 1.1 (Reasoning, Medium) | 97% | 89% | 88% | |
| Grok 4.3 (Reasoning) | 97% | 89% | 88% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 95% | 86% | 86% | |
| Aion 3.5 Mini (Reasoning, High) | 94% | 85% | 84% | |
| Claude Opus 4.6 (Reasoning) | 94% | 85% | 83% | |
| Claude Opus 4.6 | 94% | 84% | 82% | |
| Qwen 3.7 Max | 92% | 85% | 80% | |
| Claude Opus 4.8 (Reasoning) | 91% | 82% | 79% | |
| GPT-5.5 (Reasoning, Medium) | 93% | 80% | 79% | |
| Gemini 3.6 Flash (Reasoning) | 90% | 81% | 76% | |
| Qwen 3.8 Flash (Reasoning) | 93% | 75% | 75% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 94% | 75% | 75% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-4o Mini (temp=0) | 97% | $0.0002 | 4.6s | 90% | |
| Muse Spark 1.1 (Reasoning, Medium) | 97% | $0.013 | 18.1s | 88% | |
| Muse Spark 1.2 (Reasoning, Medium) | 98% | $0.018 | 20.0s | 90% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | $0.020 | 55.9s | 100% | |
| Claude Opus 4.6 | 94% | $0.0084 | 10.9s | 82% | |
| Claude Opus 4.6 (Reasoning) | 94% | $0.011 | 11.8s | 83% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 95% | $0.019 | 14.5s | 86% | |
| GPT-5.6 Sol (Reasoning, Medium) | 100% | $0.045 | 18.9s | 100% | |
| Claude Opus 4.8 (Reasoning) | 91% | $0.013 | 10.4s | 79% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 87% | $0.0062 | 9.7s | 70% | |
| Claude Opus 5.5 (Reasoning) | 96% | $0.036 | 19.9s | 89% | |
| Aion 3.5 Mini (Reasoning, High) | 94% | $0.0061 | 1.4m | 84% | |
| Claude Opus 4.8 (Reasoning, Low) | 84% | $0.013 | 10.1s | 74% | |
| Claude Opus 4.7 (Reasoning) | 86% | $0.013 | 7.2s | 68% | |
| Claude Opus 5 | 85% | $0.013 | 10.8s | 68% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 84% | $0.011 | 9.4s | 66% | |
| Inception Mercury 2 | 83% | $0.0027 | 4.1s | 56% | |
| Claude Opus 5 (Reasoning) | 84% | $0.014 | 10.6s | 65% | |
| Qwen 3.7 Flash (Reasoning) | 86% | $0.0008 | 35.3s | 60% | |
| Gemini 3.6 Flash (Reasoning) | 90% | $0.032 | 17.8s | 76% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 69.9% | Dialogue to Total Word Ratio | ||
| 67.9% | Matches word count |
dialogue-500
Write 500 words with 30% dialogue
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Muse Spark 1.1 (Reasoning, Medium) | 94% | $0.023 | 32.4s | |
| Muse Spark 1.2 (Reasoning, Medium) | 99% | $0.033 | 35.9s | |
| GPT-5 Mini | 87% | $0.013 | 1.1m | |
| Gemini 3.8 Flash (Reasoning, Medium) | 93% | $0.039 | 31.1s | |
| DeepSeek V4.1 Flash (Reasoning, High) | 90% | $0.0083 | 1.2m | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | $0.039 | 2.0m | |
| Gemini 3.7 Flash (Reasoning, Medium) | 69% | $0.028 | 32.4s | |
| Qwen 3.8 27B (Reasoning, XHigh) | 81% | $0.029 | 2.4m | |
| Z.AI GLM 5 Turbo | 97% | $0.053 | 2.2m | |
| GPT-5.6 Sol (Reasoning, Medium) | 91% | $0.105 | 43.6s | |
| GPT-5 | 84% | $0.074 | 2.0m | |
| Gemini 3.6 Flash (Reasoning) | 82% | $0.072 | 40.0s | |
| Qwen 3.8 Flash (Reasoning) | 100% | $0.0092 | 4.1m | |
| Claude Opus 5.5 (Reasoning) | 80% | $0.069 | 38.2s | |
| DeepSeek V4 Pro 0813 (Reasoning, High) | 78% | $0.041 | 2.5m | |
| MiniMax M2.5 | 74% | $0.024 | 3.9m | |
| Qwen 3.7 Max | 100% | $0.095 | 3.6m | |
| Hy4 Preview (Reasoning, High) | 99% | $0.060 | 5.2m | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 83% | $0.0038 | 5.2m | |
| o4 Mini High | 80% | $0.066 | 2.5m | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.8 Flash (Reasoning) | 100% | 99% | 99% | |
| Gemini 3.5 Flash (Reasoning) | 100% | 98% | 98% | |
| Hy4 Preview (Reasoning, High) | 99% | 98% | 98% | |
| Muse Spark 1.2 (Reasoning, Medium) | 99% | 94% | 94% | |
| Z.AI GLM 5 Turbo | 97% | 83% | 83% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 93% | 81% | 79% | |
| Muse Spark 1.1 (Reasoning, Medium) | 94% | 78% | 78% | |
| Gemini 3.1 Pro (Preview) | 96% | 76% | 76% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 90% | 72% | 70% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 84% | 64% | 62% | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 83% | 63% | 60% | |
| GPT-5 Mini | 87% | 59% | 57% | |
| Z.AI GLM 5.1 | 86% | 57% | 56% | |
| Claude Sonnet 4.6 (Reasoning) | 82% | 58% | 55% | |
| Gemini 3.6 Flash (Reasoning) | 82% | 52% | 50% | |
| Claude Opus 5.5 (Reasoning) | 80% | 55% | 48% | |
| GPT-5.6 Sol (Reasoning, Medium) | 91% | 48% | 48% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Muse Spark 1.2 (Reasoning, Medium) | 99% | $0.033 | 35.9s | 94% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | $0.039 | 2.0m | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 94% | $0.023 | 32.4s | 78% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 93% | $0.039 | 31.1s | 79% | |
| Qwen 3.8 Flash (Reasoning) | 100% | $0.0092 | 4.1m | 99% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 90% | $0.0083 | 1.2m | 70% | |
| Z.AI GLM 5 Turbo | 97% | $0.053 | 2.2m | 83% | |
| GPT-5 Mini | 87% | $0.013 | 1.1m | 57% | |
| Qwen 3.7 Max | 100% | $0.095 | 3.6m | 100% | |
| Hy4 Preview (Reasoning, High) | 99% | $0.060 | 5.2m | 98% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | $0.089 | 5.1m | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | $0.221 | 1.5m | 98% | |
| Gemini 3.6 Flash (Reasoning) | 82% | $0.072 | 40.0s | 50% | |
| Claude Opus 5.5 (Reasoning) | 80% | $0.069 | 38.2s | 48% | |
| GPT-5.6 Sol (Reasoning, Medium) | 91% | $0.105 | 43.6s | 48% | |
| Claude Sonnet 4.6 | 51% | $0.011 | 17.5s | 41% | |
| Gemini 3.1 Pro (Preview) | 96% | $0.176 | 2.3m | 76% | |
| GPT-6 Sol (Reasoning, Medium) | 57% | $0.0084 | 27.9s | 36% | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 83% | $0.0038 | 5.2m | 60% | |
| Inception Mercury 2 | 58% | $0.0064 | 10.9s | 26% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 15.2% | Dialogue to Total Word Ratio | ||
| 25.2% | Matches word count |
Write 500 words with 50% dialogue
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Muse Spark 1.1 (Reasoning, Minimal) | 88% | $0.016 | 22.0s | |
| DeepSeek V4.1 Flash (Reasoning, High) | 88% | $0.0082 | 1.0m | |
| GPT-6 Luna (Reasoning, High) | 72% | $0.0041 | 1.2m | |
| Muse Spark 1.1 (Reasoning, Medium) | 86% | $0.024 | 32.6s | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | $0.028 | 33.6s | |
| Qwen 3.8 Flash (Reasoning) | 100% | $0.0080 | 2.9m | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | $0.050 | 38.6s | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | $0.036 | 1.7m | |
| GPT-5 Mini | 79% | $0.012 | 1.2m | |
| GPT-5 | 95% | $0.059 | 1.5m | |
| Z.AI GLM 5 Turbo | 95% | $0.055 | 2.2m | |
| Qwen 3.8 27B (Reasoning, XHigh) | 91% | $0.039 | 4.5m | |
| Claude Opus 4.6 | 71% | $0.019 | 20.3s | |
| Hy4 Preview (Reasoning, High) | 97% | $0.052 | 4.6m | |
| Gemini 3.6 Flash (Reasoning) | 82% | $0.089 | 46.6s | |
| Z.AI GLM 5.2 (Reasoning, High) | 74% | $0.051 | 2.8m | |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | $0.083 | 5.0m | |
| Inception Mercury 2 | 56% | $0.0058 | 9.1s | |
| GPT-5.6 Sol (Reasoning, Medium) | 100% | $0.131 | 50.8s | |
| Qwen 3.7 Max | 80% | $0.086 | 2.9m | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| GPT-5.6 Sol (Reasoning, Medium) | 100% | 100% | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.8 Flash (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 99% | 99% | |
| Gemini 3.5 Flash (Reasoning) | 98% | 92% | 92% | |
| Hy4 Preview (Reasoning, High) | 97% | 86% | 86% | |
| Z.AI GLM 5 Turbo | 95% | 79% | 79% | |
| GPT-5 | 95% | 70% | 70% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 88% | 61% | 60% | |
| Muse Spark 1.1 (Reasoning, Medium) | 86% | 60% | 60% | |
| Kimi K2.6 | 81% | 56% | 51% | |
| Gemini 3.6 Flash (Reasoning) | 82% | 55% | 51% | |
| GPT-5 Mini | 79% | 58% | 48% | |
| Qwen 3.8 27B (Reasoning, XHigh) | 91% | 46% | 46% | |
| Claude Opus 4.8 (Reasoning, Low) | 48% | 93% | 46% | |
| Claude Opus 4.8 (Reasoning) | 47% | 90% | 45% | |
| Claude Opus 4.6 | 71% | 59% | 43% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Muse Spark 1.2 (Reasoning, Medium) | 100% | $0.028 | 33.6s | 99% | |
| Qwen 3.8 Flash (Reasoning) | 100% | $0.0080 | 2.9m | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | $0.050 | 38.6s | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | $0.036 | 1.7m | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 88% | $0.016 | 22.0s | 60% | |
| Muse Spark 1.1 (Reasoning, Medium) | 86% | $0.024 | 32.6s | 60% | |
| Z.AI GLM 5 Turbo | 95% | $0.055 | 2.2m | 79% | |
| GPT-5.6 Sol (Reasoning, Medium) | 100% | $0.131 | 50.8s | 100% | |
| GPT-5 | 95% | $0.059 | 1.5m | 70% | |
| Hy4 Preview (Reasoning, High) | 97% | $0.052 | 4.6m | 86% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 88% | $0.0082 | 1.0m | 41% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | $0.083 | 5.0m | 100% | |
| GPT-5 Mini | 79% | $0.012 | 1.2m | 48% | |
| Claude Opus 4.6 | 71% | $0.019 | 20.3s | 43% | |
| Gemini 3.5 Flash (Reasoning) | 98% | $0.187 | 1.3m | 92% | |
| Qwen 3.8 27B (Reasoning, XHigh) | 91% | $0.039 | 4.5m | 46% | |
| Gemini 3.6 Flash (Reasoning) | 82% | $0.089 | 46.6s | 51% | |
| Gemini 3.1 Pro (Preview) | 100% | $0.189 | 2.6m | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 69% | $0.030 | 25.6s | 28% | |
| GPT-6 Luna (Reasoning, High) | 72% | $0.0041 | 1.2m | 17% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 20.0% | Dialogue to Total Word Ratio | ||
| 24.4% | Matches word count |
Write 500 words with 70% dialogue
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Muse Spark 1.2 (Reasoning, Medium) | 95% | $0.032 | 36.6s | |
| Muse Spark 1.1 (Reasoning, Medium) | 76% | $0.024 | 33.8s | |
| Qwen 3.8 Flash (Reasoning) | 98% | $0.010 | 3.4m | |
| Muse Spark 1.3 (Reasoning, Medium) | 87% | $0.036 | 1.6m | |
| Claude Sonnet 5 | 67% | $0.011 | 17.9s | |
| Nemotron 3 Super | 74% | $0.0000 | 3.3m | |
| GPT-5 Mini | 70% | $0.014 | 1.2m | |
| Qwen 3.8 27B (Reasoning, XHigh) | 96% | $0.043 | 4.7m | |
| DeepSeek V4.1 Flash (Reasoning, High) | 67% | $0.0068 | 1.5m | |
| Hy4 Preview (Reasoning, High) | 90% | $0.053 | 4.7m | |
| Gemini 3.8 Flash (Reasoning, Medium) | 53% | $0.032 | 25.1s | |
| Inception Mercury 2 | 34% | $0.0047 | 7.3s | |
| Claude Opus 4.6 (Reasoning) | 57% | $0.021 | 22.2s | |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | $0.086 | 5.0m | |
| Mistral Medium 3.1 | 44% | $0.0017 | 18.0s | |
| GPT-4o, Aug. 6th (temp=1) | 45% | $0.0074 | 8.9s | |
| Gemini 2.5 Flash Lite (Reasoning) | 28% | $0.0022 | 26.4s | |
| Gemini 3.1 Flash Lite (Reasoning) | 38% | $0.0010 | 4.0s | |
| Claude Sonnet 5 (Reasoning) | 45% | $0.011 | 17.8s | |
| GPT-4o Mini (temp=0) | 32% | $0.0005 | 11.7s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Qwen 3.8 Flash (Reasoning) | 98% | 90% | 90% | |
| Muse Spark 1.2 (Reasoning, Medium) | 95% | 82% | 81% | |
| Qwen 3.8 27B (Reasoning, XHigh) | 96% | 80% | 80% | |
| Hy4 Preview (Reasoning, High) | 90% | 69% | 67% | |
| Muse Spark 1.3 (Reasoning, Medium) | 87% | 46% | 46% | |
| Claude Opus 4.8 (Reasoning) | 54% | 86% | 43% | |
| Qwen 3.7 Max | 79% | 49% | 42% | |
| Nemotron 3 Super | 74% | 44% | 38% | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 64% | 64% | 37% | |
| Claude Opus 4.8 (Reasoning, Low) | 52% | 72% | 36% | |
| Claude Sonnet 5 | 67% | 49% | 35% | |
| Muse Spark 1.1 (Reasoning, Medium) | 76% | 38% | 34% | |
| Claude Opus 4.6 | 41% | 67% | 31% | |
| Gemini 3.1 Flash Lite (Reasoning) | 38% | 71% | 30% | |
| Inception Mercury 2 | 34% | 60% | 29% | |
| Claude Opus 4.6 (Reasoning) | 57% | 54% | 29% | |
| o4 Mini High | 62% | 43% | 28% | |
| Claude Opus 5 (Reasoning, Low) | 39% | 61% | 27% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Muse Spark 1.2 (Reasoning, Medium) | 95% | $0.032 | 36.6s | 81% | |
| Qwen 3.8 Flash (Reasoning) | 98% | $0.010 | 3.4m | 90% | |
| Claude Sonnet 5 | 67% | $0.011 | 17.9s | 35% | |
| Muse Spark 1.3 (Reasoning, Medium) | 87% | $0.036 | 1.6m | 46% | |
| Muse Spark 1.1 (Reasoning, Medium) | 76% | $0.024 | 33.8s | 34% | |
| Qwen 3.8 27B (Reasoning, XHigh) | 96% | $0.043 | 4.7m | 80% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | $0.086 | 5.0m | 100% | |
| Claude Opus 4.8 (Reasoning) | 54% | $0.029 | 21.2s | 43% | |
| GPT-5 Mini | 70% | $0.014 | 1.2m | 25% | |
| Claude Opus 4.6 (Reasoning) | 57% | $0.021 | 22.2s | 29% | |
| Claude Opus 4.8 (Reasoning, Low) | 52% | $0.029 | 20.7s | 36% | |
| Gemini 3.1 Flash Lite (Reasoning) | 38% | $0.0010 | 4.0s | 30% | |
| GPT-4o, Aug. 6th (temp=0) | 54% | $0.0070 | 8.2s | 17% | |
| Hy4 Preview (Reasoning, High) | 90% | $0.053 | 4.7m | 67% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 67% | $0.0068 | 1.5m | 23% | |
| Nemotron 3 Super | 74% | $0.0000 | 3.3m | 38% | |
| Claude Sonnet 5 (Reasoning) | 45% | $0.011 | 17.8s | 25% | |
| Inception Mercury 2 | 34% | $0.0047 | 7.3s | 29% | |
| Claude Opus 4.6 | 41% | $0.019 | 21.7s | 31% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 53% | $0.032 | 25.1s | 23% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 17.2% | Dialogue to Total Word Ratio | ||
| 18.5% | Matches word count |
Ungrouped
Write unattributed dialogue
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Gemini 2.5 Flash Lite | 96% | $0.0001 | 1.4s | |
| Ministral 3 14B | 100% | $0.0001 | 8.2s | |
| Mistral Small 3.2 24B | 100% | $0.0001 | 4.1s | |
| Mistral Small 4 | 100% | $0.0002 | 2.9s | |
| GPT-4o Mini (temp=0) | 100% | $0.0002 | 3.4s | |
| Gemini 3.1 Flash Lite (Preview) | 100% | $0.0004 | 2.0s | |
| Gemini 3.1 Flash Lite (Reasoning) | 100% | $0.0004 | 3.6s | |
| Qwen 3 235B A22B Instruct 2507 | 100% | $0.0001 | 8.3s | |
| Gemini 3.1 Flash Lite | 100% | $0.0004 | 2.0s | |
| Llama 3.1 70B | 96% | $0.0003 | 3.2s | |
| DeepSeek V4 Flash | 100% | $0.0001 | 6.8s | |
| Gemma 3 12B | 100% | $0.0000 | 7.4s | |
| GPT-4.1 Mini | 87% | $0.0004 | 3.3s | |
| Gemini 3.5 Flash Lite (Reasoning) | 100% | $0.0006 | 1.6s | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 100% | $0.0006 | 1.7s | |
| DeepSeek V4 Flash (Reasoning) | 100% | $0.0001 | 6.3s | |
| Cydonia 24B V4.1 | 86% | $0.0002 | 6.2s | |
| GPT-4o Mini (temp=1) | 100% | $0.0002 | 15.5s | |
| Z.AI GLM 4.5 | 96% | $0.0005 | 5.8s | |
| Gemini 3 Flash (Preview) | 100% | $0.0009 | 3.2s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 5.5 (Reasoning) | 100% | 100% | 100% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | 100% | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 100% | 100% | 100% | |
| GPT-5.6 Sol (Reasoning, Medium) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Hy4 Preview (Reasoning, High) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | |
| Qwen 3.8 Flash (Reasoning) | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.1 | 100% | 100% | 100% | |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Mistral Small 4 | 100% | $0.0002 | 2.9s | 100% | |
| Gemini 3.1 Flash Lite (Preview) | 100% | $0.0004 | 2.0s | 100% | |
| GPT-4o Mini (temp=0) | 100% | $0.0002 | 3.4s | 100% | |
| Gemini 3.1 Flash Lite | 100% | $0.0004 | 2.0s | 100% | |
| Mistral Small 3.2 24B | 100% | $0.0001 | 4.1s | 100% | |
| Gemini 3.5 Flash Lite (Reasoning) | 100% | $0.0006 | 1.6s | 100% | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 100% | $0.0006 | 1.7s | 100% | |
| Gemini 3.1 Flash Lite (Reasoning) | 100% | $0.0004 | 3.6s | 100% | |
| DeepSeek V4 Flash (Reasoning) | 100% | $0.0001 | 6.3s | 100% | |
| DeepSeek V4 Flash | 100% | $0.0001 | 6.8s | 100% | |
| Gemma 3 12B | 100% | $0.0000 | 7.4s | 100% | |
| Gemini 3 Flash (Preview) | 100% | $0.0009 | 3.2s | 100% | |
| Ministral 3 14B | 100% | $0.0001 | 8.2s | 100% | |
| Grok 4.20 | 100% | $0.0007 | 4.9s | 100% | |
| Qwen 3 235B A22B Instruct 2507 | 100% | $0.0001 | 8.3s | 100% | |
| Mistral Medium 3.1 | 100% | $0.0006 | 6.1s | 100% | |
| Mistral Large 3 | 100% | $0.0005 | 7.2s | 100% | |
| DeepSeek V3 (2024-12-26) | 100% | $0.0004 | 10.1s | 100% | |
| Gemma 3 27B | 100% | $0.0001 | 12.5s | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 100% | $0.0001 | 13.6s | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 100.0% | Count dialogue tags |