Novel outline
Handle questions about the outline of a novel in various formats
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Inception Mercury 2 | 86% | $0.0003 | 567ms | |
| Laguna XS 2.1 | 79% | $0.0001 | 2.3s | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0002 | 1.8s | |
| Gemini 2.5 Flash Lite | 57% | $0.0002 | 575ms | |
| GPT-6 Luna (Reasoning, High) | 88% | $0.0001 | 3.0s | |
| GPT-6 Luna (Reasoning, Medium) | 87% | $0.0001 | 2.9s | |
| Ministral 3 3B | 57% | $0.0002 | 1.3s | |
| Gemini 2.5 Flash Lite (Reasoning) | 98% | $0.0004 | 2.5s | |
| Ministral 3 8B | 67% | $0.0002 | 1.8s | |
| Mistral NeMO | 68% | $0.0002 | 2.6s | |
| DeepSeek V4 Flash | 63% | $0.0001 | 3.1s | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 87% | $0.0001 | 5.3s | |
| Mistral Small 4 | 56% | $0.0002 | 1.7s | |
| Laguna S 2.1 | 83% | $0.0001 | 14.2s | |
| Ministral 3 14B | 69% | $0.0003 | 3.3s | |
| GPT-5.4 Nano (Reasoning, Low) | 88% | $0.0005 | 3.0s | |
| GPT-4.1 Mini | 66% | $0.0003 | 2.5s | |
| Arcee AI: Trinity Mini | 59% | $0.0002 | 3.9s | |
| Gemini 3.1 Flash Lite (Preview) | 83% | $0.0007 | 1.2s | |
| Gemini 3.1 Flash Lite | 86% | $0.0007 | 1.5s | |
Cost vs Performance
Compares total cost for this test against the test score. Quadrant lines are drawn at the median values. Only models with available cost data are shown.
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 5.5 (Reasoning) | 100% | 100% | 100% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | 100% | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Hy4 Preview (Reasoning, High) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | |
| GPT-5.5 (Reasoning, Medium) | 100% | 100% | 100% | |
| Kimi K2.6 | 100% | 100% | 100% | |
| Claude Opus 4.7 (Reasoning) | 100% | 100% | 100% | |
| GPT-5.5 (Reasoning, Low) | 100% | 100% | 100% | |
| Claude Opus 4.8 (Reasoning) | 100% | 100% | 100% | |
| Aion 3.5 (Reasoning, High) | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0002 | 1.8s | 100% | |
| GPT-5.4 (Reasoning, Low) | 100% | $0.0030 | 3.1s | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | $0.0032 | 3.1s | 100% | |
| Gemini 3 Flash (Preview, Reasoning) | 100% | $0.0027 | 4.0s | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | $0.0036 | 2.8s | 100% | |
| DeepSeek V4 Pro 0813 (Reasoning, High) | 100% | $0.0024 | 5.0s | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | $0.0036 | 4.7s | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | $0.0040 | 4.2s | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | $0.0046 | 4.2s | 100% | |
| Muse Glimmer 30B (Reasoning, Medium) | 100% | $0.0010 | 10.5s | 100% | |
| Qwen 3.6 35B | 100% | $0.0019 | 10.0s | 100% | |
| GPT-5.4 (Reasoning) | 100% | $0.0034 | 8.1s | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | $0.0078 | 3.3s | 100% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | $0.0050 | 7.7s | 100% | |
| Qwen 3.7 Flash (Reasoning) | 99% | $0.0002 | 7.8s | 87% | |
| Qwen 3.5 Flash | 100% | $0.0009 | 15.4s | 100% | |
| Aion 3.5 (Reasoning, High) | 100% | $0.0039 | 11.6s | 100% | |
| GPT-5.5 (Reasoning, Low) | 100% | $0.010 | 3.1s | 100% | |
| Aion 2.0 | 100% | $0.0021 | 15.6s | 100% | |
| Kimi K2.5 | 100% | $0.0022 | 15.5s | 100% | |
| outline-count | pov-count | ||||||
|---|---|---|---|---|---|---|---|
| Model | Total â–¼ | Count chapters | Count acts | Count scenes | Count point of views for Jack Harper | Count point of views for Olivia | Count point of views for Jack and Olivia |
| Claude Opus 5.5 (Reasoning) | 100% | 100% | 100% | 100% | 100% | 100% | 100% |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | 100% | 100% | 100% | 100% | 100% | 100% |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | 100% | 100% | 100% | 100% |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | 100% | 100% | 100% | 100% |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | 100% | 100% | 100% | 100% |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | 100% | 100% | 100% | 100% |
| Hy4 Preview (Reasoning, High) | 100% | 100% | 100% | 100% | 100% | 100% | 100% |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | 100% | 100% | 100% | 100% |
| Qwen 3.7 Max | 100% | 100% | 100% | 100% | 100% | 100% | 100% |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | 100% | 100% | 100% | 100% |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | 100% | 100% | 100% | 100% |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | 100% | 100% | 100% | 100% |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | 100% | 100% | 100% | 100% |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | 100% | 100% | 100% | 100% |
| GPT-5.5 (Reasoning, Medium) | 100% | 100% | 100% | 100% | 100% | 100% | 100% |
outline-count
Count chapters
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Gemma 3 4B | 100% | $0.0001 | 335ms | |
| Gemini 2.5 Flash Lite | 100% | $0.0001 | 442ms | |
| Ministral 8B | 100% | $0.0001 | 413ms | |
| Gemma 3 12B | 100% | $0.0001 | 642ms | |
| Ministral 3B | 80% | $0.0001 | 715ms | |
| Inception Mercury 2 | 100% | $0.0002 | 400ms | |
| GPT-4.1 Nano | 100% | $0.0000 | 1.2s | |
| Ministral 3 3B | 100% | $0.0002 | 665ms | |
| Gemini 2.5 Flash | 100% | $0.0002 | 487ms | |
| GPT-6 Luna | 100% | $0.0000 | 1.3s | |
| GPT-4o Mini (temp=1) | 100% | $0.0002 | 662ms | |
| Mistral Small 4 | 100% | $0.0001 | 947ms | |
| DeepSeek V4 Flash | 100% | $0.0001 | 1.4s | |
| GPT-6 Luna (Reasoning, Medium) | 100% | $0.0000 | 1.7s | |
| Gemma 3 27B | 100% | $0.0001 | 1.1s | |
| GPT-4o Mini (temp=0) | 100% | $0.0002 | 845ms | |
| Gemma 4 26B | 100% | $0.0002 | 3.2s | |
| Ministral 3 8B | 100% | $0.0002 | 815ms | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0001 | 1.2s | |
| GPT-5.6 Luna | 100% | $0.0004 | 907ms | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 5.5 (Reasoning) | 100% | 100% | 100% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | 100% | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 100% | 100% | 100% | |
| GPT-5.6 Sol (Reasoning, Medium) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Hy4 Preview (Reasoning, High) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 100% | 100% | 100% | |
| Qwen 3.8 Flash (Reasoning) | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| GPT-6 Luna (Reasoning, High) | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Gemma 3 4B | 100% | $0.0001 | 335ms | 100% | |
| Ministral 8B | 100% | $0.0001 | 413ms | 100% | |
| Inception Mercury 2 | 100% | $0.0002 | 400ms | 100% | |
| Gemini 2.5 Flash Lite | 100% | $0.0001 | 442ms | 100% | |
| Gemini 2.5 Flash | 100% | $0.0002 | 487ms | 100% | |
| Gemma 3 12B | 100% | $0.0001 | 642ms | 100% | |
| Ministral 3 3B | 100% | $0.0002 | 665ms | 100% | |
| Gemini 3.5 Flash Lite (Reasoning) | 100% | $0.0005 | 410ms | 100% | |
| GPT-4o Mini (temp=1) | 100% | $0.0002 | 662ms | 100% | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 100% | $0.0005 | 423ms | 100% | |
| Gemini 3.1 Flash Lite (Reasoning) | 100% | $0.0004 | 658ms | 100% | |
| Ministral 3 8B | 100% | $0.0002 | 815ms | 100% | |
| GPT-4o Mini (temp=0) | 100% | $0.0002 | 845ms | 100% | |
| Gemini 3.1 Flash Lite (Preview) | 100% | $0.0004 | 692ms | 100% | |
| Gemini 3.1 Flash Lite | 100% | $0.0004 | 709ms | 100% | |
| Mistral Small 4 | 100% | $0.0001 | 947ms | 100% | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0003 | 826ms | 100% | |
| GPT-5.4 Nano | 100% | $0.0003 | 834ms | 100% | |
| GPT-5.6 Luna | 100% | $0.0004 | 907ms | 100% | |
| Gemma 3 27B | 100% | $0.0001 | 1.1s | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 100.0% | Contains a count of nouns |
Count acts
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Gemma 3 4B | 100% | $0.0001 | 311ms | |
| Inception Mercury 2 | 100% | $0.0001 | 301ms | |
| Ministral 3B | 100% | $0.0001 | 718ms | |
| GPT-4.1 Nano | 100% | $0.0000 | 1.0s | |
| Laguna XS 2.1 | 100% | $0.0001 | 1.1s | |
| GPT-6 Luna (Reasoning, Medium) | 100% | $0.0000 | 1.4s | |
| GPT-6 Luna | 100% | $0.0000 | 1.6s | |
| Mistral Small 4 | 100% | $0.0001 | 1.2s | |
| Ministral 8B | 100% | $0.0001 | 520ms | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0001 | 978ms | |
| Gemini 2.5 Flash Lite | 100% | $0.0001 | 429ms | |
| DeepSeek V4 Flash (Reasoning) | 100% | $0.0001 | 1.6s | |
| DeepSeek V4 Flash | 100% | $0.0001 | 2.6s | |
| Gemma 3 12B | 100% | $0.0001 | 1.6s | |
| Mistral Small 4 (Reasoning) | 100% | $0.0002 | 1.1s | |
| Gemini 2.5 Flash | 100% | $0.0002 | 512ms | |
| GPT-6 Luna (Reasoning, High) | 100% | $0.0000 | 1.7s | |
| Ministral 3 3B | 100% | $0.0002 | 1.0s | |
| Arcee AI: Trinity Mini | 100% | $0.0001 | 1.5s | |
| Laguna S 2.1 | 100% | $0.0001 | 13.7s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 5.5 (Reasoning) | 100% | 100% | 100% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | 100% | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 100% | 100% | 100% | |
| GPT-5.6 Sol (Reasoning, Medium) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Hy4 Preview (Reasoning, High) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 100% | 100% | 100% | |
| Qwen 3.8 Flash (Reasoning) | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| GPT-6 Luna (Reasoning, High) | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Gemma 3 4B | 100% | $0.0001 | 311ms | 100% | |
| Inception Mercury 2 | 100% | $0.0001 | 301ms | 100% | |
| Gemini 2.5 Flash Lite | 100% | $0.0001 | 429ms | 100% | |
| Ministral 8B | 100% | $0.0001 | 520ms | 100% | |
| Gemini 2.5 Flash | 100% | $0.0002 | 512ms | 100% | |
| Ministral 3B | 100% | $0.0001 | 718ms | 100% | |
| GPT-4o Mini (temp=1) | 100% | $0.0002 | 663ms | 100% | |
| Gemini 3.1 Flash Lite | 100% | $0.0004 | 657ms | 100% | |
| GPT-4o Mini (temp=0) | 100% | $0.0002 | 838ms | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0001 | 978ms | 100% | |
| GPT-4.1 Nano | 100% | $0.0000 | 1.0s | 100% | |
| Gemini 3.1 Flash Lite (Reasoning) | 100% | $0.0004 | 697ms | 100% | |
| Gemini 3.5 Flash Lite (Reasoning) | 100% | $0.0006 | 521ms | 100% | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 100% | $0.0006 | 556ms | 100% | |
| Laguna XS 2.1 | 100% | $0.0001 | 1.1s | 100% | |
| Gemini 3.1 Flash Lite (Preview) | 100% | $0.0004 | 769ms | 100% | |
| Ministral 3 3B | 100% | $0.0002 | 1.0s | 100% | |
| Mistral Small 4 (Reasoning) | 100% | $0.0002 | 1.1s | 100% | |
| Mistral Small 4 | 100% | $0.0001 | 1.2s | 100% | |
| GPT-5.4 Nano | 100% | $0.0003 | 970ms | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 100.0% | Contains a count of nouns |
Count scenes
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Laguna XS 2.1 | 80% | $0.0001 | 2.2s | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0002 | 1.7s | |
| Inception Mercury 2 | 60% | $0.0004 | 610ms | |
| Gemini 2.5 Flash Lite (Reasoning) | 90% | $0.0003 | 2.0s | |
| Arcee AI: Trinity Mini | 100% | $0.0001 | 2.9s | |
| GPT-6 Luna (Reasoning, Medium) | 70% | $0.0001 | 3.4s | |
| Gemini 3.1 Flash Lite | 70% | $0.0008 | 3.1s | |
| GPT-6 Luna (Reasoning, High) | 80% | $0.0001 | 3.8s | |
| Mistral NeMO | 90% | $0.0003 | 3.1s | |
| Gemini 3.1 Flash Lite (Reasoning) | 60% | $0.0008 | 1.4s | |
| DeepSeek V4 Flash 0731 (Reasoning, High) | 100% | $0.0002 | 12.2s | |
| Mistral Small 4 (Reasoning) | 90% | $0.0005 | 3.3s | |
| GPT-5.4 Nano (Reasoning, Low) | 90% | $0.0005 | 6.3s | |
| Xiaomi MIMO v2.6 Pro | 100% | $0.0003 | 6.3s | |
| ByteDance Seed 1.6 Flash | 90% | $0.0004 | 5.4s | |
| DeepSeek V4 Flash (Reasoning) | 100% | $0.0002 | 8.0s | |
| GPT-6 Sol (Reasoning, Medium) | 100% | $0.0013 | 3.2s | |
| GPT-5.6 Terra (Reasoning, Medium) | 100% | $0.0024 | 2.5s | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0016 | 3.6s | |
| Gemini 2.5 Flash (Reasoning) | 100% | $0.0016 | 3.0s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 5.5 (Reasoning) | 100% | 100% | 100% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | 100% | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 100% | 100% | 100% | |
| GPT-5.6 Sol (Reasoning, Medium) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Hy4 Preview (Reasoning, High) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 100% | 100% | 100% | |
| Qwen 3.8 Flash (Reasoning) | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.1 | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0002 | 1.7s | 100% | |
| Arcee AI: Trinity Mini | 100% | $0.0001 | 2.9s | 100% | |
| GPT-6 Sol (Reasoning, Medium) | 100% | $0.0013 | 3.2s | 100% | |
| Gemini 2.5 Flash (Reasoning) | 100% | $0.0016 | 3.0s | 100% | |
| GPT-5.6 Terra (Reasoning, Medium) | 100% | $0.0024 | 2.5s | 100% | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0016 | 3.6s | 100% | |
| Xiaomi MIMO v2.6 Pro | 100% | $0.0003 | 6.3s | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | $0.0033 | 2.7s | 100% | |
| DeepSeek V4 Pro 0813 (Reasoning, High) | 100% | $0.0023 | 4.7s | 100% | |
| Thinking Machines Inkling Small (Reasoning, High) | 100% | $0.0010 | 6.5s | 100% | |
| Gemini 3 Flash (Preview, Reasoning) | 100% | $0.0028 | 4.3s | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | $0.0043 | 2.6s | 100% | |
| DeepSeek V4 Flash (Reasoning) | 100% | $0.0002 | 8.0s | 100% | |
| GPT-5.1 | 100% | $0.0022 | 5.6s | 100% | |
| GPT-5.4 (Reasoning, Low) | 100% | $0.0032 | 4.5s | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | $0.0043 | 3.5s | 100% | |
| GPT-5.6 Sol (Reasoning, Medium) | 100% | $0.0048 | 3.0s | 100% | |
| o4 Mini | 100% | $0.0028 | 5.8s | 100% | |
| GPT-5.4 (Reasoning) | 100% | $0.0034 | 5.2s | 100% | |
| Qwen 3.7 Flash (Reasoning) | 100% | $0.0003 | 9.5s | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 90.0% | Contains a count of nouns |
pov-count
Count point of views for Jack Harper
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Inception Mercury 2 | 100% | $0.0004 | 638ms | |
| Laguna XS 2.1 | 90% | $0.0001 | 4.1s | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0003 | 2.1s | |
| Ministral 3 8B | 60% | $0.0003 | 2.4s | |
| GPT-6 Luna (Reasoning, Medium) | 100% | $0.0001 | 3.6s | |
| GPT-5.4 Nano (Reasoning, Low) | 90% | $0.0005 | 2.2s | |
| GPT-6 Luna (Reasoning, High) | 100% | $0.0001 | 3.7s | |
| Gemini 2.5 Flash Lite (Reasoning) | 100% | $0.0004 | 2.4s | |
| DeepSeek V4 Flash | 70% | $0.0001 | 3.8s | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 100% | $0.0001 | 5.8s | |
| GPT-5.4 Nano (Reasoning) | 70% | $0.0006 | 2.3s | |
| Gemini 3.1 Flash Lite | 90% | $0.0009 | 1.5s | |
| Gemini 3.1 Flash Lite (Reasoning) | 100% | $0.0009 | 1.7s | |
| Gemini 3.1 Flash Lite (Preview) | 100% | $0.0009 | 1.7s | |
| DeepSeek V4 Flash (Reasoning) | 100% | $0.0002 | 7.9s | |
| DeepSeek V4 Flash 0731 (Reasoning, High) | 100% | $0.0002 | 9.0s | |
| Gemini 3.5 Flash Lite (Reasoning) | 90% | $0.0012 | 1.1s | |
| Ministral 3 14B | 60% | $0.0004 | 4.0s | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 90% | $0.0013 | 1.2s | |
| GPT-6 Sol (Reasoning, Medium) | 100% | $0.0010 | 3.1s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 5.5 (Reasoning) | 100% | 100% | 100% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | 100% | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 100% | 100% | 100% | |
| GPT-5.6 Sol (Reasoning, Medium) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Hy4 Preview (Reasoning, High) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 100% | 100% | 100% | |
| Qwen 3.8 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| GPT-6 Luna (Reasoning, High) | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.1 | 100% | 100% | 100% | |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Inception Mercury 2 | 100% | $0.0004 | 638ms | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0003 | 2.1s | 100% | |
| Gemini 2.5 Flash Lite (Reasoning) | 100% | $0.0004 | 2.4s | 100% | |
| Gemini 3.1 Flash Lite (Reasoning) | 100% | $0.0009 | 1.7s | 100% | |
| Gemini 3.1 Flash Lite (Preview) | 100% | $0.0009 | 1.7s | 100% | |
| GPT-6 Luna (Reasoning, Medium) | 100% | $0.0001 | 3.6s | 100% | |
| GPT-6 Luna (Reasoning, High) | 100% | $0.0001 | 3.7s | 100% | |
| GPT-6 Sol (Reasoning, Medium) | 100% | $0.0010 | 3.1s | 100% | |
| GPT-5.6 Luna (Reasoning, Medium) | 100% | $0.0017 | 1.8s | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 100% | $0.0001 | 5.8s | 100% | |
| Xiaomi MIMO v2.6 Pro | 100% | $0.0003 | 6.3s | 100% | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0021 | 2.9s | 100% | |
| DeepSeek V4 Flash (Reasoning) | 100% | $0.0002 | 7.9s | 100% | |
| Thinking Machines Inkling Small (Reasoning, High) | 100% | $0.0012 | 5.7s | 100% | |
| Gemma 3 12B | 100% | $0.0001 | 8.6s | 100% | |
| Mistral Medium 3.1 | 100% | $0.0012 | 6.3s | 100% | |
| Gemini 2.5 Flash (Reasoning) | 100% | $0.0023 | 4.0s | 100% | |
| Xiaomi MIMO v2.6 Flash | 100% | $0.0001 | 9.2s | 100% | |
| DeepSeek V4 Flash 0731 (Reasoning, High) | 100% | $0.0002 | 9.0s | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | $0.0034 | 3.3s | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 100.0% | Contains a count of nouns |
Count point of views for Olivia
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-6 Luna (Reasoning, Medium) | 100% | $0.0001 | 2.4s | |
| Inception Mercury 2 | 100% | $0.0003 | 618ms | |
| GPT-6 Luna (Reasoning, High) | 100% | $0.0001 | 2.7s | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0002 | 1.7s | |
| Ministral 3 8B | 80% | $0.0003 | 2.4s | |
| GPT-4.1 Mini | 90% | $0.0003 | 2.0s | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 100% | $0.0001 | 4.4s | |
| Gemini 2.5 Flash Lite (Reasoning) | 100% | $0.0004 | 2.4s | |
| Ministral 3 14B | 100% | $0.0003 | 3.3s | |
| Xiaomi MIMO v2.6 Pro | 100% | $0.0003 | 3.8s | |
| Gemini 3.1 Flash Lite (Preview) | 80% | $0.0007 | 1.2s | |
| Laguna S 2.1 | 80% | $0.0001 | 14.5s | |
| Nemotron 3 Super | 90% | $0.0000 | 10.7s | |
| Gemini 3.1 Flash Lite | 80% | $0.0007 | 1.3s | |
| DeepSeek V4 Flash (Reasoning) | 100% | $0.0002 | 21.4s | |
| Gemini 3.1 Flash Lite (Reasoning) | 80% | $0.0008 | 1.4s | |
| Gemini 3.5 Flash Lite (Reasoning) | 80% | $0.0010 | 942ms | |
| GPT-5.4 Nano (Reasoning) | 90% | $0.0005 | 5.3s | |
| DeepSeek V3.2 | 80% | $0.0004 | 10.0s | |
| GPT-6 Sol (Reasoning, Medium) | 100% | $0.0012 | 2.6s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 5.5 (Reasoning) | 100% | 100% | 100% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | 100% | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Hy4 Preview (Reasoning, High) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 100% | 100% | 100% | |
| Qwen 3.8 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| GPT-6 Luna (Reasoning, High) | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.1 | 100% | 100% | 100% | |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Inception Mercury 2 | 100% | $0.0003 | 618ms | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0002 | 1.7s | 100% | |
| GPT-6 Luna (Reasoning, Medium) | 100% | $0.0001 | 2.4s | 100% | |
| GPT-6 Luna (Reasoning, High) | 100% | $0.0001 | 2.7s | 100% | |
| Gemini 2.5 Flash Lite (Reasoning) | 100% | $0.0004 | 2.4s | 100% | |
| Ministral 3 14B | 100% | $0.0003 | 3.3s | 100% | |
| Xiaomi MIMO v2.6 Pro | 100% | $0.0003 | 3.8s | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 100% | $0.0001 | 4.4s | 100% | |
| GPT-6 Sol (Reasoning, Medium) | 100% | $0.0012 | 2.6s | 100% | |
| GPT-5.6 Terra (Reasoning, Medium) | 100% | $0.0016 | 1.8s | 100% | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0014 | 3.2s | 100% | |
| GPT-5.4 Mini (Reasoning) | 100% | $0.0015 | 3.6s | 100% | |
| Qwen 3.7 Flash (Reasoning) | 100% | $0.0002 | 7.0s | 100% | |
| GPT-5.4 (Reasoning, Low) | 100% | $0.0022 | 3.0s | 100% | |
| Gemini 2.5 Flash (Reasoning) | 100% | $0.0021 | 3.4s | 100% | |
| DeepSeek V4 Pro 0813 (Reasoning, High) | 100% | $0.0016 | 4.5s | 100% | |
| GPT-5.1 | 100% | $0.0018 | 4.7s | 100% | |
| GPT-5.2 | 100% | $0.0025 | 3.7s | 100% | |
| Thinking Machines Inkling Small (Reasoning, High) | 100% | $0.0011 | 7.0s | 100% | |
| GPT-OSS 120B | 100% | $0.0003 | 8.7s | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 90.0% | Contains a count of nouns |
Count point of views for Jack and Olivia
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Gemini 2.5 Flash Lite | 100% | $0.0003 | 1.0s | |
| Laguna S 2.1 | 100% | $0.0001 | 4.0s | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0005 | 3.1s | |
| GPT-5.4 Nano (Reasoning, Low) | 95% | $0.0007 | 3.2s | |
| Gemini 3.1 Flash Lite | 75% | $0.0009 | 1.6s | |
| Gemini 3.1 Flash Lite (Preview) | 80% | $0.0010 | 1.7s | |
| Gemini 3.1 Flash Lite (Reasoning) | 75% | $0.0009 | 1.6s | |
| Xiaomi MIMO v2.6 Flash | 85% | $0.0001 | 7.7s | |
| DeepSeek V4 Flash 0731 (Reasoning, High) | 100% | $0.0003 | 8.0s | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0008 | 4.8s | |
| Gemini 3.5 Flash Lite (Reasoning) | 85% | $0.0014 | 1.2s | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 80% | $0.0001 | 8.0s | |
| GPT-5.6 Luna (Reasoning, Medium) | 95% | $0.0016 | 2.0s | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 80% | $0.0012 | 1.1s | |
| Gemini 2.5 Flash Lite (Reasoning) | 95% | $0.0009 | 5.1s | |
| Mistral Large 3 | 90% | $0.0012 | 4.8s | |
| Qwen 3 235B A22B Instruct 2507 | 100% | $0.0004 | 16.4s | |
| Z.AI GLM 4.5 | 100% | $0.0009 | 8.1s | |
| DeepSeek V4 Flash (Reasoning) | 90% | $0.0003 | 10.5s | |
| Qwen 3.7 Flash (Reasoning) | 95% | $0.0003 | 12.7s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 5.5 (Reasoning) | 100% | 100% | 100% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | 100% | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| GPT-5.6 Sol (Reasoning, Medium) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Hy4 Preview (Reasoning, High) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | |
| GPT-5.5 (Reasoning, Medium) | 100% | 100% | 100% | |
| Claude Sonnet 4.6 (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| Qwen 3.8 27B (Reasoning, XHigh) | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Gemini 2.5 Flash Lite | 100% | $0.0003 | 1.0s | 100% | |
| Laguna S 2.1 | 100% | $0.0001 | 4.0s | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0005 | 3.1s | 100% | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0008 | 4.8s | 100% | |
| DeepSeek V4 Flash 0731 (Reasoning, High) | 100% | $0.0003 | 8.0s | 100% | |
| Z.AI GLM 4.5 | 100% | $0.0009 | 8.1s | 100% | |
| GPT-5.6 Terra (Reasoning, Medium) | 100% | $0.0037 | 1.8s | 100% | |
| Z.AI GLM 5 Turbo | 100% | $0.0030 | 7.2s | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | $0.0040 | 4.3s | 100% | |
| Qwen 3 235B A22B Instruct 2507 | 100% | $0.0004 | 16.4s | 100% | |
| ByteDance Seed 1.6 Flash | 100% | $0.0010 | 15.0s | 100% | |
| Gemini 3 Flash (Preview, Reasoning) | 100% | $0.0041 | 6.0s | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | $0.0054 | 4.2s | 100% | |
| GPT-5.4 (Reasoning, Low) | 100% | $0.0051 | 5.3s | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | $0.0051 | 5.6s | 100% | |
| Qwen 3.8 27B (Reasoning, XHigh) | 100% | $0.0027 | 12.8s | 100% | |
| Qwen 3.6 Flash | 100% | $0.0035 | 10.6s | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | $0.0038 | 10.7s | 100% | |
| Muse Glimmer 30B (Reasoning, Medium) | 100% | $0.0016 | 17.5s | 100% | |
| DeepSeek V4 Pro 0813 (Reasoning, High) | 100% | $0.0044 | 9.3s | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 85.0% | Either/Or composite |