Codex Extraction
Evaluates a model's ability to extract structured codex entries (characters, locations, objects, lore) from prose passages and return them as well-formed XML.
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Gemini 3 Flash (Preview) | 97% | $0.0027 | 3.9s | |
| DeepSeek V4 Flash | 95% | $0.0003 | 7.7s | |
| Qwen 3.5 Plus (2026-02-15) | 98% | $0.0030 | 10.6s | |
| Mistral Medium 3.1 | 96% | $0.0026 | 5.8s | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 98% | $0.010 | 2.9s | |
| Xiaomi MIMO v2.5 | 97% | $0.0034 | 13.4s | |
| Gemini 3.1 Flash Lite (Reasoning) | 95% | $0.0018 | 2.0s | |
| Mistral Large 3 | 94% | $0.0027 | 8.2s | |
| Gemini 2.5 Flash | 94% | $0.0023 | 2.5s | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 98% | $0.010 | 3.1s | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 93% | $0.0025 | 1.5s | |
| Gemini 3.1 Flash Lite (Preview) | 94% | $0.0017 | 2.0s | |
| Z.AI GLM 5 Turbo | 97% | $0.0068 | 16.0s | |
| Z.AI GLM 4.5 | 96% | $0.0028 | 16.8s | |
| DeepSeek V4 Pro | 95% | $0.0021 | 16.0s | |
| Z.AI GLM 5.2 (Reasoning, High) | 98% | $0.0071 | 21.2s | |
| Ministral 3 8B | 94% | $0.0006 | 3.3s | |
| Gemini 3.1 Flash Lite | 94% | $0.0017 | 5.1s | |
| Xiaomi MIMO v2.5 Pro | 96% | $0.0048 | 18.7s | |
| Laguna S 2.1 | 95% | $0.0005 | 24.7s | |
Cost vs Performance
Compares total cost for this test against the test score. Quadrant lines are drawn at the median values. Only models with available cost data are shown.
11 low-scoring outliers hidden: GPT-4o Mini (temp=1) (84.3%), Cohere Command R+ (Aug. 2024) (84.2%), Llama 3.1 70B (83.8%), GPT-5.4 Nano (Reasoning, Low) (83.8%), Gemma 3 4B (83.3%), GPT-5.4 Nano (83.2%), Gemma 4 26B (80.5%), Gemma 3 12B (77.7%), Aion 3.0 Mini (76.1%), GPT-4.1 Nano (75.3%), Mistral NeMO (26.1%).
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 4.6 (Reasoning) | 98% | 99% | 97% | |
| Claude Opus 4.5 | 99% | 99% | 97% | |
| Claude Opus 4.6 | 98% | 98% | 97% | |
| MoonshotAI: Kimi K3 (Reasoning, Low) | 98% | 99% | 97% | |
| Z.AI GLM 5.2 (Reasoning, High) | 98% | 98% | 97% | |
| Grok 4.5 (Reasoning, High) | 98% | 98% | 96% | |
| Grok 4.20 (Reasoning) | 98% | 98% | 96% | |
| Gemini 3.5 Flash (Reasoning) | 98% | 98% | 96% | |
| Claude Sonnet 4.6 | 98% | 98% | 96% | |
| Claude Opus 4.8 (Reasoning) | 98% | 97% | 96% | |
| GPT-5 | 98% | 97% | 96% | |
| Claude Opus 4 | 98% | 98% | 96% | |
| Claude Opus 4.8 (Reasoning, Low) | 98% | 97% | 96% | |
| Muse Spark 1.1 (Reasoning, Medium) | 98% | 98% | 96% | |
| MoonshotAI: Kimi K3 (Reasoning, High) | 98% | 97% | 96% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 98% | 98% | 96% | |
| Z.AI GLM 5.1 | 98% | 98% | 96% | |
| Claude Sonnet 4.6 (Reasoning) | 97% | 98% | 96% | |
| Gemini 3.6 Flash (Reasoning) | 98% | 97% | 96% | |
| Gemini 3 Flash (Preview, Reasoning) | 98% | 97% | 96% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Gemini 3 Flash (Preview) | 97% | $0.0027 | 3.9s | 95% | |
| Qwen 3.5 Plus (2026-02-15) | 98% | $0.0030 | 10.6s | 95% | |
| Gemini 3.1 Flash Lite (Reasoning) | 95% | $0.0018 | 2.0s | 92% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 98% | $0.010 | 2.9s | 96% | |
| Gemini 3.1 Flash Lite (Preview) | 94% | $0.0017 | 2.0s | 92% | |
| Mistral Medium 3.1 | 96% | $0.0026 | 5.8s | 92% | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 98% | $0.010 | 3.1s | 95% | |
| Xiaomi MIMO v2.5 | 97% | $0.0034 | 13.4s | 94% | |
| Gemini 3.1 Flash Lite | 94% | $0.0017 | 5.1s | 92% | |
| GPT-5.6 Luna | 95% | $0.0043 | 3.6s | 92% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 97% | $0.0089 | 7.1s | 94% | |
| Z.AI GLM 5.2 (Reasoning, High) | 98% | $0.0071 | 21.2s | 97% | |
| Ministral 3 8B | 94% | $0.0006 | 3.3s | 88% | |
| Z.AI GLM 5 Turbo | 97% | $0.0068 | 16.0s | 95% | |
| Gemini 2.5 Flash | 94% | $0.0023 | 2.5s | 89% | |
| Grok 4.20 | 95% | $0.0048 | 4.9s | 91% | |
| Mistral Large 3 | 94% | $0.0027 | 8.2s | 91% | |
| DeepSeek V4 Pro | 95% | $0.0021 | 16.0s | 92% | |
| Z.AI GLM 4.5 | 96% | $0.0028 | 16.8s | 92% | |
| Mistral Small 3.2 24B | 93% | $0.0005 | 4.4s | 89% | |
| Model | Total â–¼ | Short: The Rusty Lantern (Explicit) | Medium: Through the Thornveil (Scattered) | Medium: The Hollow (Inferred) | Long: The Spire of Echoes (Dense) |
|---|---|---|---|---|---|
| Claude Opus 4.5 | 99% | 99% | 98% | 99% | 98% |
| Claude Opus 4.6 (Reasoning) | 98% | 99% | 99% | 99% | 98% |
| Claude Opus 4.8 (Reasoning) | 98% | 97% | 98% | 99% | 99% |
| Claude Opus 4.8 (Reasoning, Low) | 98% | 97% | 99% | 99% | 99% |
| Z.AI GLM 5.2 (Reasoning, High) | 98% | 99% | 99% | 97% | 98% |
| Gemini 3.5 Flash (Reasoning) | 98% | 98% | 99% | 98% | 99% |
| Claude Opus 4.6 | 98% | 99% | 97% | 99% | 98% |
| Grok 4.5 (Reasoning, High) | 98% | 98% | 99% | 98% | 98% |
| Z.AI GLM 5.1 | 98% | 99% | 99% | 97% | 97% |
| GPT-5 | 98% | 99% | 98% | 99% | 96% |
| MoonshotAI: Kimi K3 (Reasoning, Low) | 98% | 98% | 98% | 98% | 97% |
| MoonshotAI: Kimi K3 (Reasoning, High) | 98% | 98% | 97% | 98% | 99% |
| Gemini 3 Flash (Preview, Reasoning) | 98% | 98% | 97% | 98% | 99% |
| Gemini 3.6 Flash (Reasoning) | 98% | 97% | 98% | 98% | 98% |
| Gemini 3.5 Flash (Reasoning, Minimal) | 98% | 98% | 99% | 97% | 97% |
Short: The Rusty Lantern (Explicit)
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Ministral 3 8B | 98% | $0.0005 | 2.6s | |
| DeepSeek V4 Flash | 98% | $0.0002 | 5.6s | |
| Mistral Medium 3.1 | 98% | $0.0021 | 6.5s | |
| Z.AI GLM 4.5 | 99% | $0.0013 | 8.1s | |
| Qwen 3.5 Plus (2026-02-15) | 99% | $0.0024 | 7.9s | |
| Gemini 3 Flash (Preview) | 98% | $0.0022 | 3.1s | |
| DeepSeek V4 Pro | 97% | $0.0005 | 10.9s | |
| Xiaomi MIMO v2.5 | 98% | $0.0032 | 12.3s | |
| DeepSeek V3 (2024-12-26) | 96% | $0.0016 | 11.9s | |
| Gemma 4 26B | 96% | $0.0004 | 12.8s | |
| MiniMax M2.7 | 99% | $0.0016 | 22.0s | |
| DeepSeek V4 Flash (Reasoning) | 99% | $0.0007 | 24.8s | |
| Laguna S 2.1 | 96% | $0.0002 | 28.5s | |
| GPT-5.4 Nano (Reasoning) | 96% | $0.0017 | 7.3s | |
| Qwen 2.5 72B | 94% | $0.0007 | 8.5s | |
| DeepSeek V3 (2025-03-24) | 98% | $0.0008 | 28.8s | |
| Xiaomi MIMO v2.5 Pro | 98% | $0.0035 | 13.8s | |
| MiniMax M3 | 99% | $0.0016 | 30.1s | |
| DeepSeek V3.2 | 96% | $0.0007 | 28.8s | |
| Hermes 3 405B | 99% | $0.0034 | 16.8s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Qwen 3.5 Plus (2026-02-15) | 99% | 100% | 99% | |
| Claude Sonnet 4.5 | 99% | 99% | 99% | |
| Claude Sonnet 4 | 99% | 100% | 99% | |
| GPT-5 | 99% | 100% | 99% | |
| Z.AI GLM 5.1 | 99% | 99% | 99% | |
| Claude Opus 4.6 | 99% | 100% | 99% | |
| Qwen3.6 Max Preview | 99% | 100% | 99% | |
| Claude Opus 4.5 | 99% | 99% | 99% | |
| Z.AI GLM 5.2 (Reasoning, High) | 99% | 100% | 99% | |
| Claude Opus 4.6 (Reasoning) | 99% | 100% | 99% | |
| Claude Opus 4 | 99% | 99% | 98% | |
| DeepSeek V4 Flash (Reasoning) | 99% | 99% | 98% | |
| Claude Sonnet 4.6 | 99% | 99% | 98% | |
| Z.AI GLM 4.5 | 99% | 99% | 98% | |
| Hermes 3 405B | 99% | 99% | 98% | |
| Thinking Machines Inkling (Reasoning) | 99% | 99% | 98% | |
| MiniMax M3 | 99% | 99% | 98% | |
| Ministral 3 8B | 98% | 99% | 98% | |
| Claude Sonnet 5 (Reasoning, Low) | 99% | 99% | 98% | |
| MoonshotAI: Kimi K3 (Reasoning, Low) | 98% | 99% | 97% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Qwen 3.5 Plus (2026-02-15) | 99% | $0.0024 | 7.9s | 99% | |
| Ministral 3 8B | 98% | $0.0005 | 2.6s | 98% | |
| Z.AI GLM 4.5 | 99% | $0.0013 | 8.1s | 98% | |
| DeepSeek V4 Flash | 98% | $0.0002 | 5.6s | 97% | |
| Gemini 3 Flash (Preview) | 98% | $0.0022 | 3.1s | 96% | |
| Mistral Medium 3.1 | 98% | $0.0021 | 6.5s | 96% | |
| Z.AI GLM 5.2 (Reasoning, High) | 99% | $0.0047 | 15.4s | 99% | |
| DeepSeek V4 Pro | 97% | $0.0005 | 10.9s | 96% | |
| DeepSeek V4 Flash (Reasoning) | 99% | $0.0007 | 24.8s | 98% | |
| Hermes 3 405B | 99% | $0.0034 | 16.8s | 98% | |
| MiniMax M2.7 | 99% | $0.0016 | 22.0s | 97% | |
| Xiaomi MIMO v2.5 | 98% | $0.0032 | 12.3s | 96% | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 98% | $0.0088 | 2.5s | 97% | |
| Z.AI GLM 5 Turbo | 98% | $0.0053 | 12.9s | 97% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 98% | $0.0080 | 3.2s | 96% | |
| Mistral Large 3 | 96% | $0.0022 | 6.3s | 95% | |
| Xiaomi MIMO v2.5 Pro | 98% | $0.0035 | 13.8s | 95% | |
| Gemma 4 26B | 96% | $0.0004 | 12.8s | 95% | |
| MiniMax M3 | 99% | $0.0016 | 30.1s | 98% | |
| Grok 4.3 | 97% | $0.0047 | 3.4s | 94% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 88.4% | Accuracy | ||
| 98.3% | Precision | ||
| 98.2% | Recall | ||
| 100.0% | Structural validity |
Medium: Through the Thornveil (Scattered)
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Gemini 3 Flash (Preview) | 98% | $0.0027 | 3.7s | |
| Xiaomi MIMO v2.5 | 96% | $0.0029 | 10.8s | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 95% | $0.0025 | 1.5s | |
| DeepSeek V4 Flash | 95% | $0.0003 | 7.1s | |
| Mistral Medium 3.1 | 96% | $0.0025 | 5.1s | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 99% | $0.010 | 2.6s | |
| Gemma 4 31B | 98% | $0.0007 | 26.6s | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 99% | $0.011 | 2.9s | |
| Qwen 3.5 Plus (2026-02-15) | 97% | $0.0029 | 11.0s | |
| Claude Haiku 4.5 | 97% | $0.0071 | 4.3s | |
| Z.AI GLM 5 Turbo | 98% | $0.0061 | 13.8s | |
| GPT-5.6 Luna | 96% | $0.0041 | 5.1s | |
| Gemini 3.5 Flash Lite (Reasoning) | 95% | $0.0025 | 1.5s | |
| Gemini 3.1 Flash Lite (Reasoning) | 95% | $0.0016 | 1.9s | |
| Z.AI GLM 5.2 (Reasoning, High) | 99% | $0.0067 | 18.2s | |
| Gemini 3.1 Flash Lite (Preview) | 95% | $0.0017 | 1.7s | |
| DeepSeek V4 Pro | 96% | $0.0009 | 14.6s | |
| Muse Spark 1.1 (Reasoning, Minimal) | 98% | $0.0082 | 7.3s | |
| Grok 4.3 | 96% | $0.0057 | 4.6s | |
| Mistral Small 3.2 24B | 94% | $0.0005 | 4.4s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Gemini 3.6 Flash (Reasoning, Minimal) | 99% | 100% | 98% | |
| Claude Opus 4.6 (Reasoning) | 99% | 100% | 98% | |
| Z.AI GLM 5.1 | 99% | 99% | 98% | |
| Claude Opus 4.8 (Reasoning) | 98% | 100% | 98% | |
| Z.AI GLM 5.2 (Reasoning, High) | 99% | 99% | 98% | |
| Grok 4.5 (Reasoning, High) | 99% | 99% | 98% | |
| Claude Opus 4.8 (Reasoning, Low) | 99% | 99% | 98% | |
| Claude Sonnet 5 | 99% | 99% | 98% | |
| Muse Spark 1.1 (Reasoning, Medium) | 98% | 100% | 98% | |
| GPT-5.6 Terra (Reasoning) | 98% | 99% | 98% | |
| Gemini 3.5 Flash (Reasoning) | 99% | 99% | 98% | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 99% | 99% | 98% | |
| Claude Sonnet 5 (Reasoning, Low) | 98% | 99% | 97% | |
| GPT-5.6 Sol | 98% | 99% | 97% | |
| Claude Opus 4.5 | 98% | 99% | 97% | |
| Z.AI GLM 5 Turbo | 98% | 99% | 97% | |
| Grok 4.5 (Reasoning, Low) | 98% | 99% | 97% | |
| Gemma 4 31B | 98% | 99% | 97% | |
| Z.AI GLM 5 | 98% | 99% | 97% | |
| Claude Sonnet 4.6 (Reasoning) | 98% | 99% | 97% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Gemini 3.6 Flash (Reasoning, Minimal) | 99% | $0.010 | 2.6s | 98% | |
| Gemini 3 Flash (Preview) | 98% | $0.0027 | 3.7s | 95% | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 99% | $0.011 | 2.9s | 98% | |
| Z.AI GLM 5 Turbo | 98% | $0.0061 | 13.8s | 97% | |
| Z.AI GLM 5.2 (Reasoning, High) | 99% | $0.0067 | 18.2s | 98% | |
| Claude Haiku 4.5 | 97% | $0.0071 | 4.3s | 97% | |
| Gemma 4 31B | 98% | $0.0007 | 26.6s | 97% | |
| Qwen 3.5 Plus (2026-02-15) | 97% | $0.0029 | 11.0s | 96% | |
| Mistral Medium 3.1 | 96% | $0.0025 | 5.1s | 96% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 98% | $0.0082 | 7.3s | 96% | |
| GPT-5.6 Luna | 96% | $0.0041 | 5.1s | 95% | |
| DeepSeek V4 Flash | 95% | $0.0003 | 7.1s | 94% | |
| Muse Spark 1.1 (Reasoning, Medium) | 98% | $0.012 | 12.8s | 98% | |
| Grok 4.3 | 96% | $0.0057 | 4.6s | 95% | |
| Gemini 3.1 Flash Lite (Reasoning) | 95% | $0.0016 | 1.9s | 94% | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 95% | $0.0025 | 1.5s | 93% | |
| GPT-5.6 Terra (Reasoning) | 98% | $0.016 | 7.3s | 98% | |
| Xiaomi MIMO v2.5 | 96% | $0.0029 | 10.8s | 94% | |
| Gemini 3.1 Flash Lite (Preview) | 95% | $0.0017 | 1.7s | 93% | |
| Grok 4.5 (Reasoning, Low) | 98% | $0.012 | 16.7s | 97% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 87.0% | Accuracy | ||
| 98.7% | Precision | ||
| 98.0% | Recall | ||
| 100.0% | Structural validity |
Medium: The Hollow (Inferred)
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Gemini 3.5 Flash Lite (Reasoning) | 97% | $0.0024 | 1.4s | |
| Gemini 3.1 Flash Lite (Reasoning) | 96% | $0.0016 | 1.7s | |
| DeepSeek V4 Flash | 96% | $0.0003 | 7.0s | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 97% | $0.0023 | 1.6s | |
| Gemini 3.1 Flash Lite | 96% | $0.0016 | 1.8s | |
| Gemini 3.1 Flash Lite (Preview) | 96% | $0.0016 | 2.2s | |
| Gemma 4 31B | 97% | $0.0007 | 14.8s | |
| Laguna S 2.1 | 95% | $0.0003 | 9.6s | |
| Gemini 2.5 Flash Lite | 92% | $0.0004 | 1.9s | |
| Mistral Large 3 | 97% | $0.0025 | 6.6s | |
| Qwen 3.5 Plus (2026-02-15) | 97% | $0.0027 | 8.7s | |
| Ministral 3 8B | 94% | $0.0006 | 2.6s | |
| Gemini 2.5 Flash | 95% | $0.0019 | 2.2s | |
| Ministral 8B | 93% | $0.0004 | 3.0s | |
| Z.AI GLM 4.5 | 96% | $0.0024 | 14.6s | |
| Gemma 4 26B | 94% | $0.0005 | 16.6s | |
| Mistral Small 3.2 24B | 93% | $0.0005 | 4.1s | |
| DeepSeek V3.1 | 96% | $0.0011 | 22.6s | |
| Gemini 3 Flash (Preview) | 95% | $0.0025 | 3.3s | |
| Gemini 2.5 Flash Lite (Reasoning) | 95% | $0.0016 | 11.4s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 4.8 (Reasoning, Low) | 99% | 99% | 99% | |
| Claude Opus 4.8 (Reasoning) | 99% | 99% | 99% | |
| GPT-5 | 99% | 100% | 98% | |
| Claude Opus 4.7 (Reasoning) | 99% | 99% | 98% | |
| Claude Opus 4.6 | 99% | 99% | 98% | |
| Claude Sonnet 4.6 | 98% | 100% | 98% | |
| GPT-5.1 | 98% | 99% | 98% | |
| Claude Opus 4.7 | 99% | 99% | 97% | |
| Claude Opus 4.6 (Reasoning) | 99% | 98% | 97% | |
| Gemini 3.6 Flash (Reasoning) | 98% | 99% | 97% | |
| MoonshotAI: Kimi K3 (Reasoning, Low) | 98% | 99% | 97% | |
| MoonshotAI: Kimi K3 (Reasoning, High) | 98% | 99% | 97% | |
| GPT-5.4 (Reasoning) | 98% | 99% | 97% | |
| Claude Sonnet 4.6 (Reasoning) | 97% | 99% | 97% | |
| Claude Opus 5 (Reasoning, Low) | 99% | 98% | 97% | |
| Claude Opus 4.5 | 99% | 99% | 97% | |
| Grok 4.5 (Reasoning, High) | 98% | 99% | 97% | |
| GPT-5.6 Sol | 98% | 99% | 97% | |
| Grok 4.20 (Reasoning) | 98% | 99% | 97% | |
| Z.AI GLM 5.2 (Reasoning, High) | 97% | 100% | 97% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 97% | $0.0023 | 1.6s | 96% | |
| Gemini 3.5 Flash Lite (Reasoning) | 97% | $0.0024 | 1.4s | 96% | |
| Gemini 3.1 Flash Lite (Reasoning) | 96% | $0.0016 | 1.7s | 95% | |
| Gemini 3.1 Flash Lite (Preview) | 96% | $0.0016 | 2.2s | 95% | |
| Gemini 3.1 Flash Lite | 96% | $0.0016 | 1.8s | 95% | |
| Mistral Large 3 | 97% | $0.0025 | 6.6s | 96% | |
| DeepSeek V4 Flash | 96% | $0.0003 | 7.0s | 93% | |
| Qwen 3.5 Plus (2026-02-15) | 97% | $0.0027 | 8.7s | 96% | |
| Gemma 4 31B | 97% | $0.0007 | 14.8s | 95% | |
| Ministral 3 8B | 94% | $0.0006 | 2.6s | 92% | |
| Laguna S 2.1 | 95% | $0.0003 | 9.6s | 94% | |
| Gemini 2.5 Flash | 95% | $0.0019 | 2.2s | 93% | |
| GPT-5.6 Luna | 95% | $0.0037 | 2.5s | 94% | |
| Ministral 8B | 93% | $0.0004 | 3.0s | 92% | |
| Gemini 3 Flash (Preview) | 95% | $0.0025 | 3.3s | 92% | |
| Inception Mercury 2 | 95% | $0.0020 | 3.2s | 91% | |
| Mistral Small 3.2 24B | 93% | $0.0005 | 4.1s | 92% | |
| Gemini 2.5 Flash Lite (Reasoning) | 95% | $0.0016 | 11.4s | 93% | |
| Claude Haiku 4.5 | 95% | $0.0066 | 3.8s | 95% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 97% | $0.0092 | 2.2s | 95% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 85.9% | Accuracy | ||
| 100.0% | Precision | ||
| 97.9% | Recall | ||
| 100.0% | Structural validity |
Long: The Spire of Echoes (Dense)
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| DeepSeek V4 Flash | 91% | $0.0005 | 11.2s | |
| Gemini 3 Flash (Preview) | 98% | $0.0033 | 5.4s | |
| Mistral Medium 3.1 | 97% | $0.0035 | 7.5s | |
| Gemini 2.5 Flash | 93% | $0.0033 | 3.6s | |
| Xiaomi MIMO v2.5 | 97% | $0.0042 | 16.1s | |
| Qwen 3.5 Plus (2026-02-15) | 97% | $0.0041 | 14.9s | |
| Gemini 3.1 Flash Lite (Preview) | 94% | $0.0022 | 2.3s | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 97% | $0.012 | 4.3s | |
| GPT-5.6 Luna | 96% | $0.0063 | 3.8s | |
| GPT-5.4 Mini (Reasoning, Low) | 95% | $0.0060 | 4.5s | |
| Gemini 3.1 Flash Lite (Reasoning) | 94% | $0.0023 | 2.7s | |
| Mistral Small 3.2 24B | 93% | $0.0007 | 5.7s | |
| Grok 4.20 | 96% | $0.0064 | 7.8s | |
| Gemini 2.5 Flash Lite (Reasoning) | 95% | $0.0025 | 15.5s | |
| DeepSeek V3.1 | 78% | $0.0016 | 38.0s | |
| Z.AI GLM 4.5 | 96% | $0.0056 | 30.8s | |
| Gemini 3 Flash (Preview, Reasoning) | 99% | $0.011 | 19.1s | |
| DeepSeek-V2 Chat | 95% | $0.0022 | 20.5s | |
| Thinking Machines Inkling | 96% | $0.0074 | 9.4s | |
| Laguna S 2.1 | 94% | $0.0007 | 27.6s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 4.8 (Reasoning) | 99% | 100% | 99% | |
| Claude Opus 4.8 (Reasoning, Low) | 99% | 99% | 98% | |
| Claude Opus 5 | 98% | 100% | 98% | |
| Gemini 3.5 Flash (Reasoning) | 99% | 99% | 98% | |
| Claude Opus 4 | 98% | 100% | 98% | |
| Claude Opus 5 (Reasoning) | 98% | 100% | 98% | |
| Gemini 3 Flash (Preview, Reasoning) | 99% | 99% | 98% | |
| Claude Opus 5 (Reasoning, Low) | 98% | 100% | 98% | |
| Claude Opus 4.5 | 98% | 100% | 98% | |
| Claude Opus 4.6 | 98% | 100% | 98% | |
| Muse Spark 1.1 (Reasoning, Medium) | 98% | 99% | 98% | |
| MoonshotAI: Kimi K3 (Reasoning, High) | 99% | 99% | 97% | |
| Claude Opus 4.7 | 97% | 100% | 97% | |
| Claude Opus 4.7 (Reasoning) | 97% | 100% | 97% | |
| Gemini 3.6 Flash (Reasoning) | 98% | 99% | 97% | |
| Z.AI GLM 5 | 98% | 99% | 97% | |
| Claude Sonnet 4.6 (Reasoning) | 97% | 99% | 97% | |
| Qwen3.6 Max Preview | 98% | 99% | 97% | |
| GPT-5.4 (Reasoning) | 98% | 99% | 97% | |
| Gemini 3 Flash (Preview) | 98% | 99% | 97% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Gemini 3 Flash (Preview) | 98% | $0.0033 | 5.4s | 97% | |
| Mistral Medium 3.1 | 97% | $0.0035 | 7.5s | 96% | |
| Qwen 3.5 Plus (2026-02-15) | 97% | $0.0041 | 14.9s | 96% | |
| Xiaomi MIMO v2.5 | 97% | $0.0042 | 16.1s | 96% | |
| Grok 4.20 | 96% | $0.0064 | 7.8s | 95% | |
| Gemini 3.1 Flash Lite (Preview) | 94% | $0.0022 | 2.3s | 93% | |
| Gemini 3.1 Flash Lite (Reasoning) | 94% | $0.0023 | 2.7s | 93% | |
| GPT-5.6 Luna | 96% | $0.0063 | 3.8s | 94% | |
| GPT-5.4 Mini (Reasoning, Low) | 95% | $0.0060 | 4.5s | 94% | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 97% | $0.012 | 4.3s | 96% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 97% | $0.013 | 3.6s | 97% | |
| Gemini 3 Flash (Preview, Reasoning) | 99% | $0.011 | 19.1s | 98% | |
| Thinking Machines Inkling | 96% | $0.0074 | 9.4s | 95% | |
| Claude Haiku 4.5 | 96% | $0.0096 | 6.6s | 95% | |
| Mistral Small 3.2 24B | 93% | $0.0007 | 5.7s | 91% | |
| GPT-5.6 Luna (Reasoning) | 96% | $0.0099 | 8.2s | 95% | |
| Gemma 4 31B | 96% | $0.0009 | 34.4s | 95% | |
| DeepSeek-V2 Chat | 95% | $0.0022 | 20.5s | 93% | |
| Gemini 3.1 Flash Lite | 94% | $0.0021 | 4.0s | 91% | |
| Muse Spark 1.1 (Reasoning, Medium) | 98% | $0.015 | 14.9s | 98% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 84.8% | Accuracy | ||
| 100.0% | Precision | ||
| 99.2% | Recall | ||
| 100.0% | Structural validity |