Codex Violation Detection
Detects factual inconsistencies between a story bible and prose passages. The model must output structured XML identifying each violation with paragraph number and substring.
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 96% | $0.0004 | 16.9s | |
| GPT-6 Sol | 99% | $0.0074 | 6.5s | |
| Xiaomi MIMO v2.6 Flash | 96% | $0.0006 | 39.8s | |
| Qwen 3.7 Flash (Reasoning) | 97% | $0.0009 | 33.3s | |
| DeepSeek V4.1 Flash (Reasoning, High) | 98% | $0.0046 | 30.8s | |
| GPT-5.6 Terra | 98% | $0.011 | 3.8s | |
| Xiaomi MIMO v2.6 Pro | 98% | $0.0023 | 40.3s | |
| Gemini 3.7 Flash (Reasoning, Medium) | 99% | $0.013 | 9.9s | |
| Z.AI GLM 5 Turbo | 97% | $0.0072 | 17.1s | |
| GPT-5.4 | 97% | $0.013 | 8.8s | |
| Gemini 2.5 Flash (Reasoning) | 97% | $0.0079 | 12.5s | |
| GPT-6 Sol (Reasoning, Medium) | 98% | $0.013 | 13.9s | |
| GPT-6 Luna (Reasoning, Medium) | 96% | $0.0010 | 18.7s | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | $0.020 | 13.0s | |
| GPT-6 Luna (Reasoning, High) | 96% | $0.0014 | 22.5s | |
| GPT-6 Luna | 93% | $0.0004 | 6.0s | |
| Z.AI GLM 5.2 (Reasoning, High) | 97% | $0.0100 | 27.9s | |
| Gemma 4 31B | 97% | $0.0009 | 37.9s | |
| Gemini 3 Flash (Preview, Reasoning) | 97% | $0.011 | 18.0s | |
| Muse Spark 1.1 (Reasoning, Minimal) | 97% | $0.011 | 10.5s | |
Cost vs Performance
Compares total cost for this test against the test score. Quadrant lines are drawn at the median values. Only models with available cost data are shown.
21 low-scoring outliers hidden: Arcee AI: Trinity Mini (71.4%), Ministral 3 14B (70.8%), Gemini 2.5 Flash Lite (67.0%), Gemma 3 12B (65.6%), Ministral 3 8B (65.2%), GPT-4o Mini (temp=0) (64.9%), GPT-4o Mini (temp=1) (64.9%), Cydonia 24B V4.1 (64.3%), Mistral Small 4 (62.0%), Ministral 3 3B (61.5%), Cohere Command R+ (Aug. 2024) (61.4%), Hermes 3 70B (60.5%), Ministral 8B (59.6%), Ministral 3B (59.5%), Mistral NeMO (53.6%), Aion 3.0 Mini (47.3%), GPT-5.4 Nano (Reasoning, Low) (42.6%), Gemma 3 4B (39.2%), WizardLM 2 8x22b (36.9%), GPT-5.4 Nano (36.6%), GPT-4.1 Nano (21.9%).
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 98% | 98% | |
| Claude Opus 5.5 (Reasoning) | 99% | 97% | 97% | |
| Gemini 3.1 Pro (Preview) | 99% | 97% | 97% | |
| Claude Opus 4.5 | 99% | 97% | 97% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 99% | 97% | 97% | |
| Kimi K3 (Reasoning, High) | 99% | 97% | 97% | |
| GPT-6 Sol | 99% | 97% | 97% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 99% | 96% | 96% | |
| Gemini 3.6 Flash (Reasoning) | 99% | 96% | 96% | |
| Claude Opus 4.6 (Reasoning) | 99% | 96% | 96% | |
| Gemini 2.5 Pro | 99% | 95% | 95% | |
| Grok 4.5 (Reasoning, High) | 98% | 95% | 95% | |
| Grok 4.6 (Reasoning, High) | 99% | 95% | 95% | |
| Grok 4.20 (Reasoning) | 98% | 95% | 95% | |
| GPT-5.6 Sol | 99% | 95% | 95% | |
| Qwen 3.6 Max Preview | 98% | 95% | 95% | |
| Kimi K3 (Reasoning, Low) | 99% | 95% | 95% | |
| Grok 4.5 (Reasoning, Low) | 99% | 95% | 95% | |
| Muse Spark 1.3 (Reasoning, Medium) | 98% | 94% | 94% | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 98% | 94% | 94% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-6 Sol | 99% | $0.0074 | 6.5s | 97% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 99% | $0.013 | 9.9s | 97% | |
| GPT-5.6 Terra | 98% | $0.011 | 3.8s | 94% | |
| GPT-6.1 Sol (Reasoning, Medium) | 98% | $0.0091 | 13.4s | 94% | |
| Qwen 3.7 Flash (Reasoning) | 97% | $0.0009 | 33.3s | 93% | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 96% | $0.0004 | 16.9s | 89% | |
| Gemini 2.5 Flash (Reasoning) | 97% | $0.0079 | 12.5s | 92% | |
| Z.AI GLM 5 Turbo | 97% | $0.0072 | 17.1s | 92% | |
| Xiaomi MIMO v2.6 Pro | 98% | $0.0023 | 40.3s | 94% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 98% | $0.0046 | 30.8s | 93% | |
| GPT-6 Luna (Reasoning, Medium) | 96% | $0.0010 | 18.7s | 88% | |
| GPT-6 Sol (Reasoning, Medium) | 98% | $0.013 | 13.9s | 94% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | $0.020 | 13.0s | 98% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 97% | $0.011 | 10.5s | 92% | |
| GPT-5.4 | 97% | $0.013 | 8.8s | 91% | |
| Gemma 4 31B | 97% | $0.0009 | 37.9s | 90% | |
| Gemini 3 Flash (Preview, Reasoning) | 97% | $0.011 | 18.0s | 92% | |
| DeepSeek V4 Flash (Reasoning) | 97% | $0.0010 | 40.3s | 90% | |
| GPT-6 Luna (Reasoning, High) | 96% | $0.0014 | 22.5s | 87% | |
| Grok 4.5 (Reasoning, Low) | 99% | $0.013 | 29.6s | 95% | |
| matrix | tiers | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Model | Total â–¼ | Small codex (7 entries), short passage (165 words) | Large codex (40 entries), short passage (165 words) | Small codex (7 entries), long passage (734 words) | Large codex (40 entries), long passage (1,019 words) | 5 codex entries | 10 codex entries | 20 codex entries | 40 codex entries |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | 99% | 98% | 100% | 100% | 100% | 100% |
| Claude Opus 5.5 (Reasoning) | 99% | 100% | 99% | 99% | 98% | 100% | 100% | 100% | 100% |
| Claude Opus 4.5 | 99% | 100% | 100% | 100% | 96% | 100% | 100% | 100% | 98% |
| Gemini 3.1 Pro (Preview) | 99% | 100% | 99% | 99% | 96% | 100% | 100% | 99% | 100% |
| Kimi K3 (Reasoning, High) | 99% | 100% | 99% | 98% | 98% | 100% | 100% | 98% | 100% |
| GPT-6 Sol | 99% | 100% | 100% | 99% | 97% | 100% | 100% | 97% | 100% |
| Gemini 3.7 Flash (Reasoning, Medium) | 99% | 100% | 99% | 97% | 96% | 100% | 100% | 100% | 100% |
| Z.AI GLM 5.3 (Reasoning, Max) | 99% | 100% | 98% | 98% | 99% | 99% | 100% | 98% | 100% |
| Gemini 3.6 Flash (Reasoning) | 99% | 100% | 98% | 98% | 97% | 100% | 99% | 98% | 100% |
| Claude Opus 4.6 (Reasoning) | 99% | 100% | 97% | 98% | 96% | 100% | 100% | 100% | 100% |
| GPT-5.6 Sol | 99% | 100% | 99% | 99% | 97% | 100% | 100% | 94% | 100% |
| Gemini 2.5 Pro | 99% | 99% | 100% | 99% | 96% | 100% | 99% | 97% | 99% |
| Claude Opus 4.6 | 99% | 100% | 98% | 99% | 91% | 100% | 100% | 100% | 100% |
| Grok 4.5 (Reasoning, Low) | 99% | 100% | 98% | 99% | 94% | 100% | 100% | 97% | 100% |
| Grok 4.6 (Reasoning, High) | 99% | 100% | 97% | 98% | 99% | 100% | 95% | 99% | 100% |
matrix
Small codex (7 entries), short passage (165 words)
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-6 Luna | 100% | $0.0003 | 4.8s | |
| Laguna S 2.1 | 99% | $0.0002 | 13.6s | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 100% | $0.0002 | 18.9s | |
| Gemini 3.1 Flash Lite | 100% | $0.0012 | 2.0s | |
| Gemini 3.1 Flash Lite (Preview) | 100% | $0.0012 | 1.9s | |
| Gemini 3.1 Flash Lite (Reasoning) | 90% | $0.0011 | 6.5s | |
| GPT-6 Luna (Reasoning, Medium) | 100% | $0.0005 | 11.1s | |
| Xiaomi MIMO v2.6 Flash | 100% | $0.0003 | 18.9s | |
| GPT-6 Luna (Reasoning, High) | 100% | $0.0006 | 10.9s | |
| DeepSeek V3.2 | 98% | $0.0006 | 16.2s | |
| Gemini 3.5 Flash Lite (Reasoning) | 100% | $0.0018 | 1.6s | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 100% | $0.0018 | 1.7s | |
| Xiaomi MIMO v2.6 Pro | 100% | $0.0009 | 16.9s | |
| Qwen 3.7 Flash (Reasoning) | 100% | $0.0006 | 22.0s | |
| DeepSeek V3 (2024-12-26) | 100% | $0.0011 | 14.8s | |
| Mistral Medium 3.1 | 97% | $0.0018 | 5.6s | |
| DeepSeek-V2 Chat | 99% | $0.0011 | 12.7s | |
| Gemini 3 Flash (Preview) | 100% | $0.0025 | 3.6s | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 100% | $0.0005 | 31.6s | |
| DeepSeek V4 Flash | 96% | $0.0002 | 6.6s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 5.5 (Reasoning) | 100% | 100% | 100% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | 100% | 100% | |
| GPT-6.1 Sol (Reasoning, Medium) | 100% | 100% | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 100% | 100% | 100% | |
| GPT-5.6 Sol (Reasoning, Medium) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Hy4 Preview (Reasoning, High) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| GPT-6 Luna (Reasoning, High) | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5.1 | 100% | 100% | 100% | |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | |
| GPT-5.5 (Reasoning, Medium) | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-6 Luna | 100% | $0.0003 | 4.8s | 100% | |
| Gemini 3.1 Flash Lite (Preview) | 100% | $0.0012 | 1.9s | 100% | |
| Gemini 3.5 Flash Lite (Reasoning) | 100% | $0.0018 | 1.6s | 100% | |
| Gemini 3 Flash (Preview) | 100% | $0.0025 | 3.6s | 100% | |
| GPT-6 Luna (Reasoning, Medium) | 100% | $0.0005 | 11.1s | 100% | |
| GPT-6 Luna (Reasoning, High) | 100% | $0.0006 | 10.9s | 100% | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 100% | $0.0018 | 1.7s | 98% | |
| Gemini 3.1 Flash Lite | 100% | $0.0012 | 2.0s | 97% | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 100% | $0.0002 | 18.9s | 100% | |
| Xiaomi MIMO v2.6 Flash | 100% | $0.0003 | 18.9s | 100% | |
| GPT-6 Sol | 100% | $0.0050 | 5.3s | 100% | |
| DeepSeek V3 (2024-12-26) | 100% | $0.0011 | 14.8s | 98% | |
| Mistral Medium 3.5 (Reasoning) | 100% | $0.0064 | 3.3s | 100% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | $0.0066 | 2.5s | 100% | |
| Gemini 2.5 Flash (Reasoning) | 100% | $0.0052 | 7.8s | 100% | |
| Gemini 2.5 Flash | 97% | $0.0017 | 2.1s | 97% | |
| Inception Mercury 2 | 97% | $0.0018 | 2.6s | 97% | |
| Laguna S 2.1 | 99% | $0.0002 | 13.6s | 96% | |
| Xiaomi MIMO v2.6 Pro | 100% | $0.0009 | 16.9s | 97% | |
| Qwen 3.7 Flash (Reasoning) | 100% | $0.0006 | 22.0s | 98% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 99.0% | Accuracy (recall) | ||
| 100.0% | Precision | ||
| 100.0% | Structural validity |
Large codex (40 entries), short passage (165 words)
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 97% | $0.0005 | 19.0s | |
| GPT-6 Sol | 100% | $0.011 | 7.8s | |
| DeepSeek V4.1 Flash (Reasoning, High) | 99% | $0.0054 | 34.9s | |
| Xiaomi MIMO v2.6 Pro | 97% | $0.0028 | 35.4s | |
| GPT-6 Luna (Reasoning, Medium) | 95% | $0.0014 | 25.1s | |
| Qwen 3.7 Flash (Reasoning) | 96% | $0.0012 | 41.8s | |
| GPT-6 Luna | 93% | $0.0006 | 7.2s | |
| Z.AI GLM 5 Turbo | 98% | $0.0097 | 19.4s | |
| Xiaomi MIMO v2.6 Flash | 86% | $0.0007 | 29.8s | |
| Grok 4.20 | 94% | $0.0081 | 8.6s | |
| Gemini 3 Flash (Preview) | 93% | $0.0039 | 6.2s | |
| DeepSeek V4 Flash | 92% | $0.0005 | 12.9s | |
| Inception Mercury 2 | 92% | $0.0040 | 5.5s | |
| GPT-6.1 Sol (Reasoning, Medium) | 97% | $0.014 | 18.9s | |
| Gemma 4 31B | 94% | $0.0013 | 1.2m | |
| Gemini 3.7 Flash (Reasoning, Medium) | 99% | $0.016 | 18.6s | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 92% | $0.0044 | 2.7s | |
| Muse Spark 1.1 (Reasoning, Minimal) | 98% | $0.014 | 12.6s | |
| DeepSeek V4 Flash (Reasoning) | 96% | $0.0015 | 58.3s | |
| Gemini 2.5 Flash | 90% | $0.0038 | 4.0s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Claude Opus 4.5 | 100% | 100% | 100% | |
| GPT-5.5 | 100% | 100% | 100% | |
| Claude Sonnet 4.5 | 100% | 100% | 100% | |
| GPT-6 Sol | 100% | 98% | 98% | |
| GPT-5.6 Sol | 99% | 98% | 98% | |
| Claude Opus 5.5 (Reasoning) | 99% | 98% | 98% | |
| Gemini 3.1 Pro (Preview) | 99% | 98% | 98% | |
| Gemini 2.5 Pro | 100% | 97% | 97% | |
| Gemini 3.6 Flash (Reasoning) | 98% | 99% | 97% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 99% | 97% | 97% | |
| Muse Spark 1.3 (Reasoning, Medium) | 98% | 99% | 97% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 99% | 98% | 97% | |
| Kimi K3 (Reasoning, Low) | 99% | 97% | 97% | |
| GPT-5.5 (Reasoning, Low) | 99% | 97% | 96% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 99% | 96% | 96% | |
| Grok 4.7 (Reasoning, High) | 97% | 99% | 96% | |
| Kimi K3 (Reasoning, High) | 99% | 98% | 96% | |
| Grok 4.6 (Reasoning, High) | 97% | 98% | 96% | |
| Gemini 3.5 Flash (Reasoning) | 98% | 97% | 96% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-6 Sol | 100% | $0.011 | 7.8s | 98% | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 97% | $0.0005 | 19.0s | 92% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 99% | $0.0054 | 34.9s | 97% | |
| Z.AI GLM 5 Turbo | 98% | $0.0097 | 19.4s | 94% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 99% | $0.016 | 18.6s | 97% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 98% | $0.014 | 12.6s | 94% | |
| GPT-6.1 Sol (Reasoning, Medium) | 97% | $0.014 | 18.9s | 96% | |
| Xiaomi MIMO v2.6 Pro | 97% | $0.0028 | 35.4s | 93% | |
| GPT-6 Luna (Reasoning, Medium) | 95% | $0.0014 | 25.1s | 92% | |
| GPT-5.4 | 98% | $0.018 | 11.4s | 93% | |
| Grok 4.5 (Reasoning, Low) | 98% | $0.018 | 20.6s | 95% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | $0.031 | 19.3s | 100% | |
| Gemini 3 Flash (Preview) | 93% | $0.0039 | 6.2s | 88% | |
| GPT-5.6 Sol | 99% | $0.033 | 7.7s | 98% | |
| Claude Sonnet 4.5 | 100% | $0.036 | 11.3s | 100% | |
| GPT-6 Luna | 93% | $0.0006 | 7.2s | 86% | |
| Qwen 3.7 Flash (Reasoning) | 96% | $0.0012 | 41.8s | 91% | |
| Inception Mercury 2 | 92% | $0.0040 | 5.5s | 88% | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 92% | $0.0044 | 2.7s | 88% | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 94% | $0.016 | 5.0s | 92% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 87.4% | Accuracy (recall) | ||
| 94.9% | Precision | ||
| 100.0% | Structural validity |
Small codex (7 entries), long passage (734 words)
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-6 Sol | 99% | $0.0058 | 5.9s | |
| Gemma 4 31B | 97% | $0.0005 | 44.4s | |
| Xiaomi MIMO v2.6 Pro | 99% | $0.0025 | 45.2s | |
| Xiaomi MIMO v2.6 Flash | 95% | $0.0006 | 43.9s | |
| Qwen 3.7 Flash (Reasoning) | 97% | $0.0009 | 34.4s | |
| DeepSeek V4.1 Flash (Reasoning, High) | 96% | $0.0046 | 29.2s | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 94% | $0.0076 | 2.9s | |
| GPT-5.6 Terra | 97% | $0.0097 | 3.6s | |
| Muse Spark 1.1 (Reasoning, Minimal) | 99% | $0.011 | 11.5s | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 93% | $0.0022 | 1.8s | |
| Gemini 3.5 Flash Lite (Reasoning) | 90% | $0.0021 | 1.7s | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 96% | $0.0087 | 2.9s | |
| Claude Haiku 4.5 | 93% | $0.0051 | 4.6s | |
| DeepSeek V4 Flash (Reasoning) | 94% | $0.0010 | 45.3s | |
| GPT-4.1 Mini | 87% | $0.0011 | 4.4s | |
| MiniMax M2.7 | 91% | $0.0021 | 28.0s | |
| Qwen 3.5 Plus (2026-02-15) | 95% | $0.0025 | 21.6s | |
| Z.AI GLM 5 Turbo | 94% | $0.0077 | 19.5s | |
| Z.AI GLM 4.5 Air | 92% | $0.0026 | 39.2s | |
| GPT-6 Luna (Reasoning, Medium) | 90% | $0.0012 | 24.8s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| Claude Opus 4.5 | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 98% | 98% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 97% | 97% | |
| Aion 3.5 (Reasoning, High) | 100% | 97% | 97% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 99% | 97% | 97% | |
| Gemini 3.1 Pro (Preview) | 99% | 97% | 97% | |
| Claude Opus 4.7 | 97% | 100% | 97% | |
| Xiaomi MIMO v2.6 Pro | 99% | 96% | 96% | |
| Grok 4.5 (Reasoning, Low) | 99% | 96% | 96% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 98% | 96% | 96% | |
| Gemini 2.5 Pro | 99% | 96% | 96% | |
| GPT-6.1 Sol (Reasoning, Medium) | 95% | 100% | 95% | |
| GPT-5.6 Sol (Reasoning, Medium) | 95% | 100% | 95% | |
| Gemini 3.6 Flash (Reasoning) | 98% | 97% | 95% | |
| Qwen 3.5 27B | 98% | 97% | 95% | |
| Claude Opus 5.5 (Reasoning) | 99% | 95% | 95% | |
| GPT-5.6 Sol | 99% | 95% | 95% | |
| GPT-6 Sol | 99% | 95% | 95% | |
| Claude Opus 4.6 | 99% | 95% | 95% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-6 Sol | 99% | $0.0058 | 5.9s | 95% | |
| Qwen 3.7 Flash (Reasoning) | 97% | $0.0009 | 34.4s | 95% | |
| Xiaomi MIMO v2.6 Pro | 99% | $0.0025 | 45.2s | 96% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 99% | $0.011 | 11.5s | 95% | |
| Claude Haiku 4.5 | 93% | $0.0051 | 4.6s | 93% | |
| Gemma 4 31B | 97% | $0.0005 | 44.4s | 93% | |
| GPT-5.6 Terra | 97% | $0.0097 | 3.6s | 92% | |
| GPT-6.1 Sol (Reasoning, Medium) | 95% | $0.0090 | 15.0s | 95% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | $0.016 | 17.2s | 97% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | $0.022 | 15.7s | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 97% | $0.014 | 10.7s | 95% | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 93% | $0.0022 | 1.8s | 86% | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 96% | $0.0087 | 2.9s | 89% | |
| GPT-5.6 Sol | 99% | $0.020 | 5.3s | 95% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 94% | $0.0076 | 2.9s | 89% | |
| Gemini 3 Flash (Preview, Reasoning) | 97% | $0.012 | 20.1s | 92% | |
| Gemini 3.5 Flash Lite (Reasoning) | 90% | $0.0021 | 1.7s | 87% | |
| Qwen 3.5 Plus (2026-02-15) | 95% | $0.0025 | 21.6s | 84% | |
| Grok 4.5 (Reasoning, Low) | 99% | $0.015 | 45.7s | 96% | |
| GPT-6 Sol (Reasoning, Medium) | 96% | $0.012 | 14.1s | 90% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 83.5% | Accuracy (recall) | ||
| 91.7% | Precision | ||
| 100.0% | Structural validity |
Large codex (40 entries), long passage (1,019 words)
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 95% | $0.0008 | 38.6s | |
| Xiaomi MIMO v2.6 Flash | 96% | $0.0016 | 2.6m | |
| GPT-6 Sol | 97% | $0.018 | 13.6s | |
| Qwen 3.7 Flash (Reasoning) | 94% | $0.0015 | 1.0m | |
| GPT-6 Luna (Reasoning, High) | 94% | $0.0036 | 55.0s | |
| GPT-6 Luna (Reasoning, Medium) | 93% | $0.0022 | 39.1s | |
| GPT-6.1 Sol (Reasoning, Medium) | 96% | $0.021 | 29.6s | |
| Muse Spark 1.1 (Reasoning, Minimal) | 96% | $0.022 | 18.9s | |
| Gemini 2.5 Flash (Reasoning) | 95% | $0.016 | 24.6s | |
| Thinking Machines Inkling Small (Reasoning, High) | 97% | $0.013 | 1.0m | |
| Inception Mercury 2 | 89% | $0.0066 | 10.4s | |
| Gemini 3 Flash (Preview) | 90% | $0.0068 | 9.3s | |
| Gemma 4 31B | 92% | $0.0018 | 55.9s | |
| DeepSeek V4 Flash (Reasoning) | 96% | $0.0022 | 1.5m | |
| Gemini 3.7 Flash (Reasoning, Medium) | 96% | $0.026 | 16.0s | |
| GPT-5.6 Luna (Reasoning, Medium) | 95% | $0.022 | 18.1s | |
| GPT-5.6 Terra | 94% | $0.025 | 7.8s | |
| Gemini 2.5 Flash | 87% | $0.0051 | 5.7s | |
| Z.AI GLM 5 Turbo | 94% | $0.016 | 36.7s | |
| Xiaomi MIMO v2.6 Pro | 97% | $0.0075 | 2.4m | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Z.AI GLM 5.3 (Reasoning, Max) | 99% | 99% | 98% | |
| Grok 4.6 (Reasoning, High) | 99% | 98% | 97% | |
| Claude Opus 5 (Reasoning, Low) | 98% | 99% | 97% | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 99% | 98% | 97% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 98% | 99% | 97% | |
| Qwen 3.6 Max Preview | 98% | 99% | 97% | |
| Claude Opus 5.5 (Reasoning) | 98% | 99% | 97% | |
| Claude Opus 5 (Reasoning) | 98% | 98% | 96% | |
| Muse Spark 1.3 (Reasoning, Medium) | 98% | 98% | 96% | |
| Muse Spark 1.2 (Reasoning, Medium) | 98% | 98% | 96% | |
| Qwen 3.7 Max | 98% | 98% | 96% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 98% | 98% | 96% | |
| Aion 3.5 Mini (Reasoning, High) | 99% | 96% | 95% | |
| Hy4 Preview (Reasoning, High) | 98% | 97% | 95% | |
| Kimi K3 (Reasoning, High) | 98% | 97% | 95% | |
| GPT-6.1 Sol (Reasoning, Medium) | 96% | 99% | 95% | |
| Claude Sonnet 4.6 (Reasoning) | 97% | 97% | 95% | |
| GPT-5 | 97% | 98% | 95% | |
| GPT-5.5 (Reasoning, Medium) | 97% | 97% | 95% | |
| Claude Opus 4.6 (Reasoning) | 96% | 97% | 94% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-6 Sol | 97% | $0.018 | 13.6s | 94% | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 95% | $0.0008 | 38.6s | 91% | |
| GPT-6.1 Sol (Reasoning, Medium) | 96% | $0.021 | 29.6s | 95% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 96% | $0.026 | 16.0s | 94% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 96% | $0.022 | 18.9s | 93% | |
| Thinking Machines Inkling Small (Reasoning, High) | 97% | $0.013 | 1.0m | 94% | |
| Gemini 2.5 Flash (Reasoning) | 95% | $0.016 | 24.6s | 92% | |
| GPT-5.6 Luna (Reasoning, Medium) | 95% | $0.022 | 18.1s | 93% | |
| Muse Spark 1.2 (Reasoning, Medium) | 98% | $0.040 | 27.6s | 96% | |
| GPT-5.6 Terra | 94% | $0.025 | 7.8s | 92% | |
| GPT-6 Luna (Reasoning, High) | 94% | $0.0036 | 55.0s | 91% | |
| Qwen 3.7 Flash (Reasoning) | 94% | $0.0015 | 1.0m | 91% | |
| GPT-6 Sol (Reasoning, Medium) | 96% | $0.029 | 29.4s | 94% | |
| DeepSeek V4 Flash (Reasoning) | 96% | $0.0022 | 1.5m | 93% | |
| Z.AI GLM 5 Turbo | 94% | $0.016 | 36.7s | 92% | |
| GPT-5.4 | 95% | $0.028 | 20.6s | 93% | |
| Muse Spark 1.1 (Reasoning, Medium) | 96% | $0.031 | 32.6s | 94% | |
| Gemma 4 31B | 92% | $0.0018 | 55.9s | 90% | |
| GPT-6 Luna (Reasoning, Medium) | 93% | $0.0022 | 39.1s | 87% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 98% | $0.047 | 28.0s | 97% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 82.6% | Accuracy (recall) | ||
| 94.2% | Precision | ||
| 100.0% | Structural validity |
tiers
5 codex entries
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-6 Luna | 100% | $0.0002 | 3.4s | |
| DeepSeek V4 Flash | 98% | $0.0001 | 3.4s | |
| Gemini 3.1 Flash Lite (Reasoning) | 96% | $0.0008 | 1.4s | |
| Gemini 3.1 Flash Lite (Preview) | 97% | $0.0008 | 1.3s | |
| Laguna XS 2.1 | 98% | $0.0002 | 6.2s | |
| Gemini 3.5 Flash Lite (Reasoning) | 100% | $0.0010 | 1.0s | |
| Gemma 4 26B | 100% | $0.0002 | 8.4s | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 100% | $0.0011 | 1.1s | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 100% | $0.0001 | 6.9s | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0011 | 7.8s | |
| Xiaomi MIMO v2.6 Flash | 99% | $0.0002 | 11.4s | |
| GPT-6 Luna (Reasoning, Medium) | 100% | $0.0004 | 8.3s | |
| Gemini 2.5 Flash Lite (Reasoning) | 98% | $0.0008 | 5.2s | |
| Gemini 3 Flash (Preview) | 100% | $0.0015 | 2.3s | |
| GPT-6 Luna (Reasoning, High) | 100% | $0.0004 | 8.6s | |
| GPT-5.6 Luna | 100% | $0.0022 | 1.9s | |
| DeepSeek-V2 Chat | 96% | $0.0007 | 6.2s | |
| DeepSeek V3 (2024-12-26) | 96% | $0.0007 | 7.3s | |
| DeepSeek V4 Flash (Reasoning) | 99% | $0.0003 | 12.7s | |
| Xiaomi MIMO v2.6 Pro | 100% | $0.0007 | 9.3s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 5.5 (Reasoning) | 100% | 100% | 100% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | 100% | 100% | |
| GPT-6.1 Sol (Reasoning, Medium) | 100% | 100% | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| GPT-5.6 Sol (Reasoning, Medium) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| GPT-6 Luna (Reasoning, High) | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.1 | 100% | 100% | 100% | |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-6 Luna | 100% | $0.0002 | 3.4s | 100% | |
| Gemini 3.5 Flash Lite (Reasoning) | 100% | $0.0010 | 1.0s | 100% | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 100% | $0.0011 | 1.1s | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 100% | $0.0001 | 6.9s | 100% | |
| Gemini 3 Flash (Preview) | 100% | $0.0015 | 2.3s | 100% | |
| Gemma 4 26B | 100% | $0.0002 | 8.4s | 100% | |
| GPT-6 Luna (Reasoning, Medium) | 100% | $0.0004 | 8.3s | 100% | |
| GPT-5.6 Luna | 100% | $0.0022 | 1.9s | 100% | |
| GPT-6 Luna (Reasoning, High) | 100% | $0.0004 | 8.6s | 100% | |
| Xiaomi MIMO v2.6 Pro | 100% | $0.0007 | 9.3s | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0011 | 7.8s | 100% | |
| GPT-6 Sol | 100% | $0.0026 | 3.9s | 100% | |
| Qwen 3 32B | 100% | $0.0005 | 13.1s | 100% | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0032 | 3.8s | 100% | |
| DeepSeek V4 Flash | 98% | $0.0001 | 3.4s | 94% | |
| GPT-6.1 Sol (Reasoning, Medium) | 100% | $0.0030 | 5.0s | 100% | |
| GPT-4.1 | 100% | $0.0035 | 3.2s | 100% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | $0.0041 | 1.5s | 100% | |
| Hermes 3 405B | 100% | $0.0016 | 10.8s | 100% | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 100% | $0.0044 | 1.7s | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 100.0% | Accuracy (recall) | ||
| 100.0% | Precision | ||
| 100.0% | Structural validity |
10 codex entries
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Gemma 4 26B | 100% | $0.0003 | 10.1s | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 98% | $0.0002 | 8.8s | |
| Gemini 3.1 Flash Lite (Preview) | 94% | $0.0011 | 1.5s | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0022 | 15.1s | |
| GPT-6 Luna (Reasoning, Medium) | 100% | $0.0004 | 8.7s | |
| Gemini 3 Flash (Preview) | 100% | $0.0015 | 2.7s | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 93% | $0.0015 | 1.2s | |
| Xiaomi MIMO v2.6 Flash | 99% | $0.0003 | 12.6s | |
| GPT-6 Luna (Reasoning, High) | 99% | $0.0005 | 9.8s | |
| Gemini 3.5 Flash Lite (Reasoning) | 81% | $0.0015 | 1.4s | |
| DeepSeek V4 Pro | 98% | $0.0027 | 11.8s | |
| Mistral Medium 3.1 | 99% | $0.0015 | 3.7s | |
| Gemma 4 31B | 100% | $0.0005 | 32.7s | |
| Inception Mercury 2 | 98% | $0.0020 | 3.2s | |
| Qwen 3 235B A22B Instruct 2507 | 96% | $0.0004 | 10.3s | |
| DeepSeek V4 Flash (Reasoning) | 98% | $0.0005 | 17.7s | |
| GPT-6 Luna | 92% | $0.0002 | 3.4s | |
| Qwen 3.5 Plus (2026-02-15) | 94% | $0.0018 | 12.4s | |
| Xiaomi MIMO v2.6 Pro | 97% | $0.0009 | 16.2s | |
| GPT-6.1 Sol (Reasoning, Medium) | 100% | $0.0034 | 5.3s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 5.5 (Reasoning) | 100% | 100% | 100% | |
| Qwen 3.8 Max (Reasoning, XHigh) | 100% | 100% | 100% | |
| GPT-6.1 Sol (Reasoning, Medium) | 100% | 100% | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | |
| GPT-5.5 (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| Kimi K3 (Reasoning, High) | 100% | 100% | 100% | |
| Qwen 3.8 27B (Reasoning, XHigh) | 100% | 100% | 100% | |
| Claude Sonnet 5.5 (Reasoning) | 100% | 100% | 100% | |
| GPT-6 Sol (Reasoning, Medium) | 100% | 100% | 100% | |
| GPT-5.5 (Reasoning, Low) | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Gemini 3 Flash (Preview) | 100% | $0.0015 | 2.7s | 100% | |
| GPT-6 Luna (Reasoning, Medium) | 100% | $0.0004 | 8.7s | 100% | |
| Gemma 4 26B | 100% | $0.0003 | 10.1s | 100% | |
| GPT-6 Sol | 100% | $0.0035 | 3.9s | 100% | |
| GPT-6.1 Sol (Reasoning, Medium) | 100% | $0.0034 | 5.3s | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0022 | 15.1s | 100% | |
| Z.AI GLM 5 Turbo | 100% | $0.0035 | 9.0s | 100% | |
| GPT-5.6 Terra | 100% | $0.0051 | 2.2s | 100% | |
| Mistral Medium 3.1 | 99% | $0.0015 | 3.7s | 96% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | $0.0055 | 1.7s | 100% | |
| GPT-6 Luna (Reasoning, High) | 99% | $0.0005 | 9.8s | 96% | |
| Xiaomi MIMO v2.6 Flash | 99% | $0.0003 | 12.6s | 95% | |
| Mistral Medium 3.5 (Reasoning) | 100% | $0.0057 | 2.3s | 100% | |
| Gemini 2.5 Flash (Reasoning) | 100% | $0.0049 | 7.5s | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | $0.0044 | 11.2s | 100% | |
| GPT-5.4 | 100% | $0.0061 | 4.2s | 100% | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 100% | $0.0065 | 2.2s | 100% | |
| GPT-6 Sol (Reasoning, Medium) | 100% | $0.0057 | 6.9s | 100% | |
| Gemma 4 31B | 100% | $0.0005 | 32.7s | 100% | |
| Inception Mercury 2 | 98% | $0.0020 | 3.2s | 94% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 95.0% | Accuracy (recall) | ||
| 97.1% | Precision | ||
| 100.0% | Structural validity |
20 codex entries
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 99% | $0.0027 | 1.8s | |
| Gemini 3.5 Flash Lite (Reasoning) | 96% | $0.0027 | 1.9s | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 98% | $0.0003 | 14.8s | |
| Grok 4.20 | 99% | $0.0047 | 5.5s | |
| Xiaomi MIMO v2.6 Flash | 95% | $0.0005 | 27.6s | |
| DeepSeek V4.1 Flash (Reasoning, High) | 95% | $0.0034 | 27.1s | |
| DeepSeek V4 Flash (Reasoning) | 94% | $0.0009 | 34.1s | |
| Gemini 2.5 Flash | 93% | $0.0023 | 2.5s | |
| GPT-6 Luna (Reasoning, Medium) | 93% | $0.0008 | 16.9s | |
| GPT-6 Luna (Reasoning, High) | 94% | $0.0011 | 17.8s | |
| Gemma 4 31B | 92% | $0.0007 | 20.8s | |
| Qwen 3.7 Flash (Reasoning) | 94% | $0.0009 | 34.3s | |
| GPT-6 Sol | 97% | $0.0066 | 5.9s | |
| Gemini 3 Flash (Preview) | 92% | $0.0031 | 4.0s | |
| DeepSeek V4 Flash | 88% | $0.0003 | 8.1s | |
| Mistral Medium 3.1 | 92% | $0.0027 | 8.1s | |
| Xiaomi MIMO v2.6 Pro | 93% | $0.0018 | 31.6s | |
| ByteDance Seed 1.6 Flash | 87% | $0.0009 | 11.8s | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | $0.012 | 6.6s | |
| GPT-6 Luna | 91% | $0.0003 | 4.8s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Claude Opus 4.6 | 100% | 100% | 100% | |
| Claude Opus 4.5 | 100% | 100% | 100% | |
| Claude Opus 5.5 (Reasoning) | 100% | 98% | 98% | |
| Grok 4.20 | 99% | 98% | 98% | |
| Grok 4.6 (Reasoning, High) | 99% | 97% | 97% | |
| Gemini 3.1 Pro (Preview) | 99% | 97% | 97% | |
| Kimi K3 (Reasoning, High) | 98% | 96% | 96% | |
| Gemini 3.6 Flash (Reasoning) | 98% | 97% | 96% | |
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 99% | 95% | 95% | |
| Claude Opus 5 (Reasoning) | 99% | 95% | 95% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 98% | 95% | 95% | |
| GPT-5 | 97% | 97% | 94% | |
| Claude Opus 5 (Reasoning, Low) | 98% | 94% | 94% | |
| Grok 4.20 (Reasoning) | 96% | 96% | 93% | |
| Aion 3.5 (Reasoning, High) | 98% | 93% | 93% | |
| GPT-5.1 | 96% | 96% | 93% | |
| Claude Opus 5 | 95% | 97% | 93% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Gemini 3.5 Flash Lite (Reasoning, Minimal) | 99% | $0.0027 | 1.8s | 95% | |
| Grok 4.20 | 99% | $0.0047 | 5.5s | 98% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | $0.012 | 6.6s | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 98% | $0.0003 | 14.8s | 92% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | $0.014 | 8.5s | 100% | |
| Gemini 3.5 Flash Lite (Reasoning) | 96% | $0.0027 | 1.9s | 90% | |
| GPT-6 Sol | 97% | $0.0066 | 5.9s | 92% | |
| Gemini 3 Flash (Preview) | 92% | $0.0031 | 4.0s | 92% | |
| Gemma 4 31B | 92% | $0.0007 | 20.8s | 92% | |
| Gemini 2.5 Flash | 93% | $0.0023 | 2.5s | 88% | |
| GPT-5.6 Terra | 96% | $0.0098 | 3.1s | 91% | |
| GPT-6 Luna (Reasoning, High) | 94% | $0.0011 | 17.8s | 88% | |
| Mistral Medium 3.5 (Reasoning) | 95% | $0.011 | 4.2s | 93% | |
| Xiaomi MIMO v2.6 Flash | 95% | $0.0005 | 27.6s | 88% | |
| Mistral Medium 3.1 | 92% | $0.0027 | 8.1s | 88% | |
| GPT-5.4 | 95% | $0.011 | 8.4s | 93% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 92% | $0.010 | 3.1s | 92% | |
| GPT-6.1 Sol (Reasoning, Medium) | 92% | $0.0082 | 12.7s | 92% | |
| GPT-6 Luna (Reasoning, Medium) | 93% | $0.0008 | 16.9s | 86% | |
| Z.AI GLM 5.2 (Reasoning, High) | 97% | $0.0091 | 27.8s | 91% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 84.1% | Accuracy (recall) | ||
| 90.4% | Precision | ||
| 100.0% | Structural validity |
40 codex entries
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-6 Luna | 98% | $0.0004 | 5.1s | |
| Xiaomi MIMO v2.6 Flash | 98% | $0.0004 | 18.6s | |
| Gemma 4 31B | 100% | $0.0012 | 29.3s | |
| GPT-6 Luna (Reasoning, High) | 98% | $0.0011 | 16.5s | |
| Xiaomi MIMO v2.6 Pro | 100% | $0.0016 | 21.9s | |
| Qwen 3.7 Flash (Reasoning) | 99% | $0.0008 | 27.2s | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0031 | 20.8s | |
| GPT-6 Sol | 100% | $0.0072 | 5.4s | |
| DeepSeek V4 Flash (Reasoning) | 99% | $0.0010 | 36.2s | |
| Gemini 2.5 Flash Lite (Reasoning) | 97% | $0.0016 | 11.6s | |
| Z.AI GLM 5 Turbo | 100% | $0.0057 | 13.3s | |
| GPT-6.1 Sol (Reasoning, Medium) | 100% | $0.0080 | 10.9s | |
| Gemini 2.5 Flash | 96% | $0.0027 | 3.3s | |
| GPT-6 Luna (Reasoning, Medium) | 97% | $0.0008 | 15.9s | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 95% | $0.0005 | 13.0s | |
| GPT-5.6 Terra | 99% | $0.0100 | 2.8s | |
| Xiaomi MIMO v2.5 | 97% | $0.0045 | 16.2s | |
| MiniMax M3 | 98% | $0.0025 | 38.8s | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | $0.0076 | 17.0s | |
| DeepSeek V4 Flash 0731 (Reasoning, High) | 99% | $0.0020 | 51.3s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 5.5 (Reasoning) | 100% | 100% | 100% | |
| GPT-6.1 Sol (Reasoning, Medium) | 100% | 100% | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Max) | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Muse Spark 1.3 (Reasoning, Medium) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | |
| GPT-5.5 (Reasoning, Medium) | 100% | 100% | 100% | |
| Claude Sonnet 4.6 (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 100% | 100% | |
| Kimi K3 (Reasoning, High) | 100% | 100% | 100% | |
| Qwen 3.8 27B (Reasoning, XHigh) | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-6 Sol | 100% | $0.0072 | 5.4s | 100% | |
| DeepSeek V4.1 Flash (Reasoning, High) | 100% | $0.0031 | 20.8s | 100% | |
| GPT-6 Luna | 98% | $0.0004 | 5.1s | 95% | |
| GPT-6.1 Sol (Reasoning, Medium) | 100% | $0.0080 | 10.9s | 100% | |
| Gemma 4 31B | 100% | $0.0012 | 29.3s | 100% | |
| Z.AI GLM 5 Turbo | 100% | $0.0057 | 13.3s | 98% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | $0.0076 | 17.0s | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | $0.013 | 6.7s | 100% | |
| Xiaomi MIMO v2.6 Pro | 100% | $0.0016 | 21.9s | 97% | |
| GPT-6 Sol (Reasoning, Medium) | 100% | $0.012 | 12.6s | 100% | |
| GPT-5.6 Terra | 99% | $0.0100 | 2.8s | 96% | |
| GPT-6 Luna (Reasoning, High) | 98% | $0.0011 | 16.5s | 95% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | $0.014 | 12.4s | 100% | |
| Grok 4.5 (Reasoning, Low) | 100% | $0.013 | 14.8s | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | $0.016 | 10.7s | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | $0.014 | 8.4s | 98% | |
| GPT-5.6 Luna (Reasoning, Medium) | 99% | $0.0094 | 9.3s | 96% | |
| GPT-5.4 | 99% | $0.011 | 7.9s | 96% | |
| GPT-5.4 (Reasoning, Low) | 100% | $0.017 | 11.0s | 100% | |
| Qwen 3.7 Flash (Reasoning) | 99% | $0.0008 | 27.2s | 95% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 94.5% | Accuracy (recall) | ||
| 97.8% | Precision | ||
| 100.0% | Structural validity |