Language Writing
Can the model generate text in different languages?
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-4.1 Nano | 93% | $0.0001 | 4.0s | |
| Inception Mercury 2 | 100% | $0.0006 | 1.4s | |
| GPT-4.1 Mini | 99% | $0.0004 | 3.4s | |
| GPT-4o Mini (temp=0) | 100% | $0.0003 | 4.8s | |
| Mistral NeMO | 67% | $0.0001 | 4.3s | |
| GPT-4o Mini (temp=1) | 100% | $0.0003 | 5.6s | |
| Laguna S 2.1 | 96% | $0.0001 | 13.7s | |
| Grok 4.3 | 94% | $0.0009 | 3.8s | |
| Arcee AI: Trinity Mini | 81% | $0.0002 | 15.9s | |
| Gemini 3.1 Flash Lite (Preview) | 95% | $0.0011 | 3.7s | |
| Gemini 3.1 Flash Lite (Reasoning) | 98% | $0.0011 | 5.3s | |
| Gemini 3.1 Flash Lite | 97% | $0.0011 | 6.2s | |
| Laguna XS 2.1 | 94% | $0.0002 | 13.4s | |
| Nemotron 3 Nano | 95% | $0.0002 | 10.8s | |
| GPT-5.4 Mini | 97% | $0.0020 | 2.5s | |
| DeepSeek V4 Flash (Reasoning) | 90% | $0.0002 | 20.8s | |
| DeepSeek V4 Flash | 87% | $0.0002 | 12.4s | |
| Nemotron 3 Super | 98% | $0.0000 | 21.7s | |
| Mistral Small 3.2 24B | 71% | $0.0003 | 11.0s | |
| DeepSeek-V2 Chat | 100% | $0.0001 | 16.1s | |
Cost vs Performance
Compares total cost for this test against the test score. Quadrant lines are drawn at the median values. Only models with available cost data are shown.
22 low-scoring outliers hidden: DeepSeek V3 (2024-12-26) (75.8%), DeepSeek V4 Pro (75.6%), Gemma 3 4B (74.6%), Cohere Command R+ (Aug. 2024) (73.2%), DeepSeek V3 (2025-03-24) (72.8%), Mistral Small 4 (Reasoning) (71.1%), Mistral Small 3.2 24B (70.5%), Mistral Large 2 (70.4%), MiniMax M2.7 (69.6%), Qwen 2.5 72B (67.9%), Mistral NeMO (66.6%), WizardLM 2 8x22b (61.1%), Ministral 3B (59.5%), Ministral 8B (52.8%), Cydonia 24B V4.1 (50.0%), Mistral Medium 3.1 (49.0%), Mistral Small 4 (48.9%), Ministral 3 8B (47.9%), Qwen 3 235B A22B Instruct 2507 (46.7%), Writer: Palmyra X5 (43.2%), Ministral 3 3B (36.2%), Ministral 3 14B (10.0%).
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | |
| Kimi K3 (Reasoning, High) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | 100% | 100% | |
| Grok 4.3 (Reasoning) | 100% | 100% | 100% | |
| Claude Sonnet 4.6 | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | 100% | 100% | |
| o4 Mini | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 100% | 100% | 100% | |
| Gemini 3 Flash (Preview) | 100% | 100% | 100% | |
| Gemma 4 31B | 100% | 100% | 100% | |
| DeepSeek-V2 Chat | 100% | 100% | 100% | |
| GPT-4o, Aug. 6th (temp=0) | 100% | 100% | 100% | |
| GPT-4o Mini (temp=1) | 100% | 100% | 100% | |
| GPT-4o Mini (temp=0) | 100% | 100% | 100% | |
| GPT-5.6 Sol (Reasoning) | 100% | 99% | 99% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-4o Mini (temp=0) | 100% | $0.0003 | 4.8s | 100% | |
| GPT-4o Mini (temp=1) | 100% | $0.0003 | 5.6s | 100% | |
| Gemini 3 Flash (Preview) | 100% | $0.0020 | 5.6s | 100% | |
| DeepSeek-V2 Chat | 100% | $0.0001 | 16.1s | 100% | |
| Inception Mercury 2 | 100% | $0.0006 | 1.4s | 96% | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0022 | 3.5s | 99% | |
| Muse Glimmer 30B (Reasoning, Medium) | 100% | $0.0015 | 15.7s | 98% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | $0.0050 | 5.1s | 100% | |
| Gemma 4 31B | 100% | $0.0003 | 32.1s | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | $0.0047 | 8.0s | 100% | |
| GPT-4o, Aug. 6th (temp=0) | 100% | $0.0052 | 6.1s | 100% | |
| Z.AI GLM 4.5 | 100% | $0.0013 | 14.5s | 97% | |
| GPT-4.1 Mini | 99% | $0.0004 | 3.4s | 93% | |
| Z.AI GLM 5 Turbo | 100% | $0.0037 | 14.7s | 98% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | $0.0062 | 9.6s | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 99% | $0.0002 | 22.2s | 95% | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 100% | $0.0073 | 5.3s | 100% | |
| Hermes 3 405B | 99% | $0.0000 | 21.0s | 94% | |
| GPT-OSS 120B | 99% | $0.0003 | 28.0s | 96% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0037 | 32.9s | 100% | |
| Model | Total â–¼ | Character dialogue (Spanish) in a story | Character dialogue (French) in a story | Character dialogue (German) in a story | Character dialogue (Italian) in a story | Character dialogue (Hindi) in a story |
|---|---|---|---|---|---|---|
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | 100% | 100% | 100% |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | 100% | 100% | 100% |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | 100% | 100% | 100% |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | 100% | 100% | 100% |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | 100% | 100% | 100% |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | 100% | 100% | 100% |
| Kimi K3 (Reasoning, High) | 100% | 100% | 100% | 100% | 100% | 100% |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | 100% | 100% | 100% | 100% | 100% |
| Grok 4.3 (Reasoning) | 100% | 100% | 100% | 100% | 100% | 100% |
| Claude Sonnet 4.6 | 100% | 100% | 100% | 100% | 100% | 100% |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | 100% | 100% | 100% | 100% | 100% |
| o4 Mini | 100% | 100% | 100% | 100% | 100% | 100% |
| Gemini 3.5 Flash (Reasoning, Minimal) | 100% | 100% | 100% | 100% | 100% | 100% |
| Gemini 3 Flash (Preview) | 100% | 100% | 100% | 100% | 100% | 100% |
| Gemma 4 31B | 100% | 100% | 100% | 100% | 100% | 100% |
Character dialogue (Spanish) in a story
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Ministral 3 3B | 60% | $0.0001 | 2.3s | |
| GPT-4.1 Nano | 100% | $0.0001 | 3.7s | |
| Inception Mercury 2 | 100% | $0.0005 | 1.4s | |
| GPT-4o Mini (temp=0) | 100% | $0.0002 | 3.6s | |
| GPT-4o Mini (temp=1) | 100% | $0.0003 | 4.5s | |
| GPT-4.1 Mini | 100% | $0.0004 | 3.4s | |
| Arcee AI: Trinity Mini | 85% | $0.0002 | 5.0s | |
| Grok 4.3 | 100% | $0.0008 | 2.8s | |
| Nemotron 3 Super | 100% | $0.0000 | 12.5s | |
| Laguna XS 2.1 | 100% | $0.0002 | 11.3s | |
| Gemini 3.1 Flash Lite (Preview) | 100% | $0.0011 | 3.5s | |
| Mistral Small 3.2 24B | 100% | $0.0003 | 15.1s | |
| Gemini 3.1 Flash Lite | 100% | $0.0010 | 3.6s | |
| DeepSeek V4 Flash (Reasoning) | 100% | $0.0002 | 13.1s | |
| Gemini 3.1 Flash Lite (Reasoning) | 100% | $0.0011 | 3.6s | |
| Gemma 4 26B | 100% | $0.0003 | 28.0s | |
| DeepSeek V4 Flash | 80% | $0.0002 | 11.0s | |
| Z.AI GLM 5 Turbo | 100% | $0.0027 | 10.2s | |
| WizardLM 2 8x22b | 73% | $0.0006 | 10.7s | |
| DeepSeek-V2 Chat | 100% | $0.0001 | 13.9s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 100% | 100% | 100% | |
| GPT-5.6 Sol (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Hy4 Preview (Reasoning, High) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 100% | 100% | 100% | |
| Qwen 3.8 Flash (Reasoning) | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | |
| GPT-5.5 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| Kimi K3 (Reasoning, High) | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Inception Mercury 2 | 100% | $0.0005 | 1.4s | 100% | |
| GPT-4.1 Nano | 100% | $0.0001 | 3.7s | 100% | |
| GPT-4o Mini (temp=0) | 100% | $0.0002 | 3.6s | 100% | |
| GPT-4.1 Mini | 100% | $0.0004 | 3.4s | 100% | |
| GPT-4o Mini (temp=1) | 100% | $0.0003 | 4.5s | 100% | |
| Grok 4.3 | 100% | $0.0008 | 2.8s | 100% | |
| Gemini 3.1 Flash Lite (Preview) | 100% | $0.0011 | 3.5s | 100% | |
| Gemini 3.1 Flash Lite | 100% | $0.0010 | 3.6s | 100% | |
| Gemini 3.1 Flash Lite (Reasoning) | 100% | $0.0011 | 3.6s | 100% | |
| Laguna XS 2.1 | 100% | $0.0002 | 11.3s | 100% | |
| Nemotron 3 Super | 100% | $0.0000 | 12.5s | 100% | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0020 | 3.5s | 100% | |
| DeepSeek V4 Flash (Reasoning) | 100% | $0.0002 | 13.1s | 100% | |
| DeepSeek-V2 Chat | 100% | $0.0001 | 13.9s | 100% | |
| Gemini 3.5 Flash Lite (Reasoning) | 100% | $0.0023 | 4.1s | 100% | |
| Gemini 3 Flash (Preview) | 100% | $0.0019 | 5.9s | 100% | |
| Mistral Small 3.2 24B | 100% | $0.0003 | 15.1s | 100% | |
| GPT-OSS 120B | 100% | $0.0002 | 17.8s | 100% | |
| Grok 4.20 | 100% | $0.0019 | 9.8s | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 100% | $0.0002 | 18.7s | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 100.0% | Parse dialogue |
Character dialogue (French) in a story
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-4o Mini (temp=0) | 100% | $0.0002 | 4.3s | |
| Inception Mercury 2 | 100% | $0.0006 | 1.4s | |
| Mistral NeMO | 60% | $0.0001 | 4.9s | |
| GPT-4.1 Nano | 93% | $0.0001 | 4.9s | |
| Arcee AI: Trinity Mini | 100% | $0.0002 | 6.1s | |
| GPT-4.1 Mini | 96% | $0.0005 | 3.4s | |
| Laguna S 2.1 | 100% | $0.0001 | 5.9s | |
| GPT-4o Mini (temp=1) | 100% | $0.0003 | 8.0s | |
| Grok 4.3 | 100% | $0.0008 | 3.5s | |
| Gemini 3.1 Flash Lite (Reasoning) | 100% | $0.0011 | 3.5s | |
| Gemini 3.1 Flash Lite (Preview) | 100% | $0.0011 | 3.7s | |
| Laguna XS 2.1 | 99% | $0.0002 | 11.0s | |
| DeepSeek V4 Flash | 100% | $0.0002 | 13.2s | |
| DeepSeek V4 Flash (Reasoning) | 80% | $0.0002 | 10.6s | |
| DeepSeek V3 (2025-03-24) | 100% | $0.0005 | 13.9s | |
| Gemini 3.1 Flash Lite | 100% | $0.0011 | 5.2s | |
| Nemotron 3 Nano | 97% | $0.0002 | 9.9s | |
| DeepSeek-V2 Chat | 100% | $0.0001 | 13.4s | |
| Gemma 3 4B | 96% | $0.0001 | 13.9s | |
| GPT-5.4 Mini | 96% | $0.0018 | 2.3s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Hy4 Preview (Reasoning, High) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| Kimi K3 (Reasoning, High) | 100% | 100% | 100% | |
| Qwen 3.8 27B (Reasoning, XHigh) | 100% | 100% | 100% | |
| Grok 4.6 (Reasoning, High) | 100% | 100% | 100% | |
| Kimi K2.6 | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Inception Mercury 2 | 100% | $0.0006 | 1.4s | 100% | |
| GPT-4o Mini (temp=0) | 100% | $0.0002 | 4.3s | 100% | |
| Laguna S 2.1 | 100% | $0.0001 | 5.9s | 100% | |
| Arcee AI: Trinity Mini | 100% | $0.0002 | 6.1s | 100% | |
| Grok 4.3 | 100% | $0.0008 | 3.5s | 100% | |
| Gemini 3.1 Flash Lite (Reasoning) | 100% | $0.0011 | 3.5s | 100% | |
| Gemini 3.1 Flash Lite (Preview) | 100% | $0.0011 | 3.7s | 100% | |
| GPT-4o Mini (temp=1) | 100% | $0.0003 | 8.0s | 100% | |
| Gemini 3.1 Flash Lite | 100% | $0.0011 | 5.2s | 100% | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0015 | 6.1s | 100% | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 100% | $0.0019 | 3.9s | 100% | |
| DeepSeek-V2 Chat | 100% | $0.0001 | 13.4s | 100% | |
| DeepSeek V4 Flash | 100% | $0.0002 | 13.2s | 100% | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0023 | 3.4s | 100% | |
| Gemini 3 Flash (Preview) | 100% | $0.0020 | 5.5s | 100% | |
| GPT-5.4 Nano | 100% | $0.0018 | 6.8s | 100% | |
| DeepSeek V3 (2025-03-24) | 100% | $0.0005 | 13.9s | 100% | |
| Hermes 3 70B | 100% | $0.0003 | 15.8s | 100% | |
| Z.AI GLM 4.5 Air | 100% | $0.0007 | 13.6s | 100% | |
| GPT-5.4 Nano (Reasoning, Low) | 100% | $0.0015 | 6.2s | 99% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 100.0% | Parse dialogue |
Character dialogue (German) in a story
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-4.1 Nano | 92% | $0.0001 | 2.8s | |
| Laguna S 2.1 | 100% | $0.0001 | 5.7s | |
| GPT-4.1 Mini | 100% | $0.0004 | 2.6s | |
| GPT-4o Mini (temp=0) | 100% | $0.0002 | 4.3s | |
| Inception Mercury 2 | 100% | $0.0006 | 1.5s | |
| Nemotron 3 Super | 98% | $0.0000 | 9.2s | |
| GPT-4o Mini (temp=1) | 100% | $0.0003 | 5.4s | |
| Gemini 2.5 Flash Lite | 98% | $0.0005 | 4.6s | |
| Arcee AI: Trinity Mini | 100% | $0.0004 | 15.0s | |
| Laguna XS 2.1 | 80% | $0.0002 | 8.1s | |
| Gemini 3.1 Flash Lite (Preview) | 100% | $0.0011 | 3.7s | |
| Grok 4.3 | 98% | $0.0010 | 4.3s | |
| Gemini 3.1 Flash Lite | 100% | $0.0011 | 3.7s | |
| Gemini 3.1 Flash Lite (Reasoning) | 100% | $0.0011 | 6.3s | |
| Mistral Small 3.2 24B | 80% | $0.0003 | 9.3s | |
| Nemotron 3 Nano | 100% | $0.0002 | 10.5s | |
| DeepSeek-V2 Chat | 100% | $0.0001 | 13.8s | |
| DeepSeek V4 Flash (Reasoning) | 100% | $0.0002 | 54.4s | |
| Gemma 3 4B | 96% | $0.0001 | 12.8s | |
| Hermes 3 70B | 72% | $0.0002 | 13.5s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | 100% | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| GPT-5.6 Sol (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Hy4 Preview (Reasoning, High) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.1 | 100% | 100% | 100% | |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| Kimi K3 (Reasoning, High) | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-4.1 Mini | 100% | $0.0004 | 2.6s | 100% | |
| Inception Mercury 2 | 100% | $0.0006 | 1.5s | 100% | |
| GPT-4o Mini (temp=0) | 100% | $0.0002 | 4.3s | 100% | |
| Laguna S 2.1 | 100% | $0.0001 | 5.7s | 100% | |
| GPT-4o Mini (temp=1) | 100% | $0.0003 | 5.4s | 100% | |
| Gemini 3.1 Flash Lite (Preview) | 100% | $0.0011 | 3.7s | 100% | |
| Gemini 3.1 Flash Lite | 100% | $0.0011 | 3.7s | 100% | |
| Nemotron 3 Nano | 100% | $0.0002 | 10.5s | 100% | |
| Gemini 3.1 Flash Lite (Reasoning) | 100% | $0.0011 | 6.3s | 100% | |
| DeepSeek-V2 Chat | 100% | $0.0001 | 13.8s | 100% | |
| Gemini 3 Flash (Preview) | 100% | $0.0016 | 4.6s | 100% | |
| GPT-5.4 Mini | 100% | $0.0020 | 2.4s | 100% | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 100% | $0.0019 | 3.8s | 100% | |
| Arcee AI: Trinity Mini | 100% | $0.0004 | 15.0s | 100% | |
| Gemini 2.5 Flash | 100% | $0.0023 | 5.4s | 100% | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0019 | 7.5s | 100% | |
| Z.AI GLM 4.5 | 100% | $0.0012 | 12.7s | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 100% | $0.0002 | 19.4s | 100% | |
| Gemma 4 31B | 100% | $0.0003 | 19.3s | 100% | |
| Grok 4.20 | 100% | $0.0023 | 11.5s | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 99.8% | Parse dialogue |
Character dialogue (Italian) in a story
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-4.1 Mini | 100% | $0.0004 | 2.6s | |
| Inception Mercury 2 | 98% | $0.0006 | 1.4s | |
| Mistral NeMO | 80% | $0.0001 | 4.5s | |
| GPT-4o Mini (temp=0) | 100% | $0.0002 | 4.6s | |
| GPT-4o Mini (temp=1) | 100% | $0.0003 | 4.4s | |
| GPT-4.1 Nano | 90% | $0.0001 | 4.6s | |
| Mistral Small 3.2 24B | 100% | $0.0003 | 9.5s | |
| Ministral 3 8B | 77% | $0.0002 | 6.8s | |
| Gemini 3.1 Flash Lite (Reasoning) | 100% | $0.0011 | 6.0s | |
| Grok 4.3 | 100% | $0.0010 | 4.5s | |
| Arcee AI: Trinity Mini | 60% | $0.0002 | 7.8s | |
| Gemini 3.1 Flash Lite (Preview) | 100% | $0.0012 | 4.0s | |
| Gemini 3.1 Flash Lite | 100% | $0.0011 | 15.1s | |
| DeepSeek-V2 Chat | 100% | $0.0001 | 12.7s | |
| DeepSeek V4 Flash | 98% | $0.0002 | 11.0s | |
| Nemotron 3 Nano | 87% | $0.0002 | 9.4s | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0022 | 3.2s | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0015 | 5.8s | |
| Laguna S 2.1 | 80% | $0.0001 | 11.0s | |
| DeepSeek V4 Flash (Reasoning) | 98% | $0.0003 | 12.1s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | 100% | 100% | |
| Kimi K3 (Reasoning, High) | 100% | 100% | 100% | |
| Grok 4.6 (Reasoning, High) | 100% | 100% | 100% | |
| Kimi K2.6 | 100% | 100% | 100% | |
| Claude Opus 4.7 (Reasoning) | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-4.1 Mini | 100% | $0.0004 | 2.6s | 100% | |
| GPT-4o Mini (temp=1) | 100% | $0.0003 | 4.4s | 100% | |
| GPT-4o Mini (temp=0) | 100% | $0.0002 | 4.6s | 100% | |
| Grok 4.3 | 100% | $0.0010 | 4.5s | 100% | |
| Mistral Small 3.2 24B | 100% | $0.0003 | 9.5s | 100% | |
| Gemini 3.1 Flash Lite (Preview) | 100% | $0.0012 | 4.0s | 100% | |
| Gemini 3.1 Flash Lite (Reasoning) | 100% | $0.0011 | 6.0s | 100% | |
| DeepSeek-V2 Chat | 100% | $0.0001 | 12.7s | 100% | |
| GPT-5.4 Mini | 100% | $0.0022 | 2.5s | 100% | |
| GPT-5.4 Nano (Reasoning, Low) | 100% | $0.0017 | 6.7s | 100% | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0022 | 3.2s | 100% | |
| Hermes 3 405B | 100% | $0.0000 | 18.6s | 100% | |
| Gemini 3 Flash (Preview) | 100% | $0.0021 | 6.1s | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 100% | $0.0001 | 19.8s | 100% | |
| Gemini 3.5 Flash Lite (Reasoning) | 100% | $0.0025 | 4.8s | 100% | |
| DeepSeek V3.1 | 100% | $0.0008 | 17.3s | 100% | |
| Gemini 3.1 Flash Lite | 100% | $0.0011 | 15.1s | 100% | |
| Gemini 2.5 Flash | 100% | $0.0026 | 6.1s | 100% | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0015 | 5.8s | 98% | |
| Laguna XS 2.1 | 100% | $0.0003 | 24.2s | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 99.5% | Parse dialogue |
Character dialogue (Hindi) in a story
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-4.1 Nano | 90% | $0.0001 | 4.0s | |
| Inception Mercury 2 | 100% | $0.0006 | 1.3s | |
| Mistral NeMO | 80% | $0.0001 | 3.7s | |
| GPT-4.1 Mini | 100% | $0.0005 | 5.0s | |
| GPT-4o Mini (temp=0) | 100% | $0.0003 | 7.3s | |
| Laguna XS 2.1 | 91% | $0.0003 | 12.5s | |
| GPT-4o Mini (temp=1) | 100% | $0.0003 | 5.9s | |
| Gemini 3.1 Flash Lite | 84% | $0.0010 | 3.7s | |
| Gemini 3.1 Flash Lite (Reasoning) | 92% | $0.0010 | 6.9s | |
| Nemotron 3 Nano | 100% | $0.0002 | 8.8s | |
| GPT-5.4 Mini | 100% | $0.0024 | 2.8s | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0021 | 3.2s | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 93% | $0.0018 | 3.9s | |
| GPT-5.4 Nano (Reasoning) | 91% | $0.0015 | 5.7s | |
| Nemotron 3 Super | 96% | $0.0000 | 31.4s | |
| Gemini 3 Flash (Preview) | 100% | $0.0021 | 5.8s | |
| Gemma 4 31B | 100% | $0.0002 | 15.8s | |
| Laguna S 2.1 | 100% | $0.0002 | 19.5s | |
| DeepSeek V3.1 | 100% | $0.0011 | 16.3s | |
| Muse Glimmer 30B (Reasoning, Medium) | 100% | $0.0018 | 11.8s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| GPT-5.6 Sol (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | |
| GPT-5.5 (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| Kimi K3 (Reasoning, High) | 100% | 100% | 100% | |
| GPT-5.6 Terra (Reasoning) | 100% | 100% | 100% | |
| Kimi K3 (Reasoning, Low) | 100% | 100% | 100% | |
| Claude Opus 5 (Reasoning, Low) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | 100% | 100% | |
| Grok 4.3 (Reasoning) | 100% | 100% | 100% | |
| Claude Sonnet 4.6 | 100% | 100% | 100% | |
| Claude Opus 5 | 100% | 100% | 100% | |
| Claude Opus 4.7 | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Inception Mercury 2 | 100% | $0.0006 | 1.3s | 100% | |
| GPT-4.1 Mini | 100% | $0.0005 | 5.0s | 100% | |
| GPT-4o Mini (temp=1) | 100% | $0.0003 | 5.9s | 100% | |
| GPT-4o Mini (temp=0) | 100% | $0.0003 | 7.3s | 100% | |
| Nemotron 3 Nano | 100% | $0.0002 | 8.8s | 100% | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0021 | 3.2s | 100% | |
| GPT-5.4 Mini | 100% | $0.0024 | 2.8s | 100% | |
| Gemini 3 Flash (Preview) | 100% | $0.0021 | 5.8s | 100% | |
| Gemma 4 31B | 100% | $0.0002 | 15.8s | 100% | |
| Laguna S 2.1 | 100% | $0.0002 | 19.5s | 100% | |
| Muse Glimmer 30B (Reasoning, Medium) | 100% | $0.0018 | 11.8s | 100% | |
| DeepSeek V3.1 | 100% | $0.0011 | 16.3s | 100% | |
| GPT-OSS 120B | 100% | $0.0003 | 21.3s | 100% | |
| Z.AI GLM 4.5 | 100% | $0.0018 | 16.6s | 100% | |
| DeepSeek-V2 Chat | 100% | $0.0002 | 26.9s | 100% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | $0.0049 | 4.9s | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | $0.0048 | 8.0s | 100% | |
| GPT-5.6 Luna | 100% | $0.0054 | 4.9s | 100% | |
| Z.AI GLM 5 Turbo | 100% | $0.0041 | 11.7s | 100% | |
| GPT-4o, Aug. 6th (temp=0) | 100% | $0.0055 | 6.4s | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 82.9% | Parse dialogue |