Codex Red Herring (False Positive Detection)
Tests whether models correctly report "no violations" when a codex is fully consistent with the prose passage. Models that hallucinate false violations (false positives) fail. Uses a 2×2 matrix of text length × codex size, with bare and detailed-entry variants.
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-5.6 Luna | 70% | $0.0020 | 1.2s | |
| GPT-4.1 Nano | 63% | $0.0005 | 4.6s | |
| GPT-5.4 Nano | 68% | $0.0005 | 1.5s | |
| Ministral 8B | 68% | $0.0007 | 4.4s | |
| Ministral 3 8B | 78% | $0.0013 | 17.9s | |
| GPT-5.4 Nano (Reasoning, Low) | 97% | $0.0008 | 3.9s | |
| Inception Mercury 2 | 96% | $0.0027 | 3.8s | |
| GPT-5.4 Mini (Reasoning, Low) | 95% | $0.0034 | 4.0s | |
| GPT-5.4 Nano (Reasoning) | 94% | $0.0017 | 11.4s | |
| Gemma 4 31B | 71% | $0.0009 | 11.7s | |
| ByteDance Seed 1.6 Flash | 94% | $0.0008 | 9.1s | |
| Arcee AI: Trinity Mini | 73% | $0.0009 | 26.3s | |
| GPT-5.6 Luna (Reasoning) | 92% | $0.0048 | 4.7s | |
| GPT-4.1 | 86% | $0.0048 | 1.2s | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 79% | $0.0078 | 1.6s | |
| Laguna XS 2.1 | 91% | $0.0005 | 16.4s | |
| GPT-5.6 Sol | 75% | $0.0091 | 1.7s | |
| Laguna S 2.1 | 92% | $0.0008 | 41.9s | |
| GPT-5.4 Mini (Reasoning) | 89% | $0.0090 | 10.8s | |
| Gemini 2.5 Flash Lite (Reasoning) | 92% | $0.0023 | 16.6s | |
Cost vs Performance
Compares total cost for this test against the test score. Quadrant lines are drawn at the median values. Only models with available cost data are shown.
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Nemotron 3 Super | 99% | 83% | 83% | |
| o4 Mini High | 97% | 72% | 72% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 97% | 72% | 72% | |
| GPT-5.4 Nano (Reasoning, Low) | 97% | 70% | 70% | |
| o4 Mini | 96% | 67% | 67% | |
| Inception Mercury 2 | 96% | 67% | 67% | |
| Z.AI GLM 5 Turbo | 96% | 65% | 65% | |
| GPT-5.1 | 95% | 64% | 64% | |
| GPT-5.4 Mini (Reasoning, Low) | 95% | 64% | 64% | |
| Muse Spark 1.1 (Reasoning, Medium) | 95% | 61% | 61% | |
| Claude Opus 4.6 (Reasoning) | 94% | 60% | 60% | |
| Grok 4.5 (Reasoning, High) | 94% | 60% | 60% | |
| ByteDance Seed 1.6 Flash | 94% | 59% | 59% | |
| Grok 4.5 (Reasoning, Low) | 94% | 58% | 58% | |
| Z.AI GLM 5.2 (Reasoning, High) | 94% | 58% | 58% | |
| GPT-5.4 Nano (Reasoning) | 94% | 57% | 57% | |
| Laguna S 2.1 | 92% | 56% | 56% | |
| Z.AI GLM 5 | 93% | 56% | 56% | |
| GPT-5 Mini | 93% | 56% | 56% | |
| GPT-5 Nano | 93% | 55% | 55% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Nemotron 3 Super | 99% | $0.0000 | 1.3m | 83% | |
| GPT-5.4 Nano (Reasoning, Low) | 97% | $0.0008 | 3.9s | 70% | |
| Inception Mercury 2 | 96% | $0.0027 | 3.8s | 67% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 97% | $0.012 | 11.2s | 72% | |
| GPT-5.4 Mini (Reasoning, Low) | 95% | $0.0034 | 4.0s | 64% | |
| Z.AI GLM 5 Turbo | 96% | $0.0071 | 16.0s | 65% | |
| o4 Mini | 96% | $0.014 | 25.0s | 67% | |
| ByteDance Seed 1.6 Flash | 94% | $0.0008 | 9.1s | 59% | |
| GPT-5.4 Nano (Reasoning) | 94% | $0.0017 | 11.4s | 57% | |
| o4 Mini High | 97% | $0.027 | 52.5s | 72% | |
| Grok 4.5 (Reasoning, Low) | 94% | $0.012 | 17.0s | 58% | |
| Muse Spark 1.1 (Reasoning, Medium) | 95% | $0.019 | 19.4s | 61% | |
| Z.AI GLM 5.2 (Reasoning, High) | 94% | $0.0081 | 25.8s | 58% | |
| GPT-5.1 | 95% | $0.025 | 26.1s | 64% | |
| GPT-5.6 Luna (Reasoning) | 92% | $0.0048 | 4.7s | 51% | |
| Gemini 2.5 Flash Lite (Reasoning) | 92% | $0.0023 | 16.6s | 53% | |
| Laguna XS 2.1 | 91% | $0.0005 | 16.4s | 52% | |
| Laguna S 2.1 | 92% | $0.0008 | 41.9s | 56% | |
| GPT-5 Mini | 93% | $0.0059 | 37.8s | 56% | |
| GPT-5 Nano | 93% | $0.0035 | 1.1m | 55% | |
| basic entries | detailed entries | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Model | Total ▼ | Short text (~524 words), small codex (11 entries) | Short text (~524 words), big codex (51 entries) | Long text (~1594 words), small codex (11 entries) | Long text (~1594 words), big codex (51 entries) | Short text (~524 words), small codex (11 detailed entries) | Short text (~524 words), big codex (51 detailed entries) | Long text (~1594 words), small codex (11 detailed entries) | Long text (~1594 words), big codex (51 detailed entries) |
| Nemotron 3 Super | 99% | 100% | 100% | 100% | 93% | 100% | 100% | 100% | 100% |
| Muse Spark 1.1 (Reasoning, Minimal) | 97% | 93% | 85% | 100% | 100% | 100% | 100% | 100% | 100% |
| o4 Mini High | 97% | 93% | 100% | 100% | 85% | 100% | 100% | 100% | 100% |
| GPT-5.4 Nano (Reasoning, Low) | 97% | 100% | 90% | 100% | 100% | 93% | 93% | 100% | 100% |
| o4 Mini | 96% | 100% | 100% | 100% | 85% | 93% | 100% | 93% | 100% |
| Inception Mercury 2 | 96% | 100% | 100% | 100% | 100% | 85% | 100% | 100% | 85% |
| Z.AI GLM 5 Turbo | 96% | 100% | 100% | 100% | 68% | 100% | 100% | 100% | 100% |
| GPT-5.1 | 95% | 93% | 93% | 100% | 100% | 93% | 85% | 100% | 100% |
| GPT-5.4 Mini (Reasoning, Low) | 95% | 93% | 85% | 100% | 85% | 100% | 100% | 100% | 100% |
| Muse Spark 1.1 (Reasoning, Medium) | 95% | 85% | 100% | 100% | 83% | 100% | 100% | 100% | 92% |
| Claude Opus 4.6 (Reasoning) | 94% | 100% | 100% | 100% | 100% | 85% | 70% | 100% | 100% |
| Grok 4.5 (Reasoning, High) | 94% | 100% | 100% | 100% | 100% | 70% | 85% | 100% | 100% |
| ByteDance Seed 1.6 Flash | 94% | 100% | 100% | 100% | 93% | 84% | 93% | 100% | 84% |
| Grok 4.5 (Reasoning, Low) | 94% | 85% | 100% | 100% | 75% | 93% | 100% | 100% | 100% |
| Z.AI GLM 5.2 (Reasoning, High) | 94% | 93% | 100% | 100% | 59% | 100% | 100% | 100% | 100% |
basic entries
Short text (~524 words), small codex (11 entries)
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Gemma 4 26B | 100% | $0.0002 | 3.8s | |
| GPT-5.6 Luna | 100% | $0.0005 | 709ms | |
| GPT-5.4 Nano | 80% | $0.0003 | 1.0s | |
| GPT-5.4 Nano (Reasoning, Low) | 100% | $0.0005 | 2.8s | |
| GPT-5.6 Sol | 100% | $0.0023 | 2.0s | |
| Arcee AI: Trinity Mini | 81% | $0.0012 | 36.6s | |
| Gemma 4 31B | 100% | $0.0002 | 12.4s | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0008 | 3.9s | |
| ByteDance Seed 1.6 Flash | 100% | $0.0004 | 5.3s | |
| Inception Mercury 2 | 100% | $0.0013 | 2.0s | |
| Thinking Machines Inkling | 80% | $0.0034 | 9.0s | |
| Laguna S 2.1 | 95% | $0.0001 | 11.8s | |
| GPT-5.6 Luna (Reasoning) | 100% | $0.0016 | 2.6s | |
| GPT-5.5 | 100% | $0.0041 | 1.3s | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | $0.0024 | 990ms | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 100% | $0.0024 | 850ms | |
| Gemini 2.5 Flash Lite (Reasoning) | 93% | $0.0012 | 8.6s | |
| GPT-5.4 Mini (Reasoning, Low) | 93% | $0.0019 | 3.6s | |
| Mistral Small 4 (Reasoning) | 100% | $0.0009 | 9.3s | |
| Laguna XS 2.1 | 93% | $0.0003 | 14.8s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Qwen3.7 Max | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Z.AI GLM 5.1 | 100% | 100% | 100% | |
| Qwen3.6 Max Preview | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| Claude Opus 4.7 (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.8 (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.6 | 100% | 100% | 100% | |
| MoonshotAI: Kimi K3 (Reasoning, Low) | 100% | 100% | 100% | |
| Claude Opus 5 (Reasoning, Low) | 100% | 100% | 100% | |
| Claude Opus 4.8 (Reasoning, Low) | 100% | 100% | 100% | |
| GPT-5 Mini | 100% | 100% | 100% | |
| Claude Opus 5 (Reasoning) | 100% | 100% | 100% | |
| Grok 4.20 (Reasoning) | 100% | 100% | 100% | |
| GPT-5.6 Sol | 100% | 100% | 100% | |
| GPT-5.6 Luna (Reasoning) | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-5.6 Luna | 100% | $0.0005 | 709ms | 100% | |
| Gemma 4 26B | 100% | $0.0002 | 3.8s | 100% | |
| GPT-5.4 Nano (Reasoning, Low) | 100% | $0.0005 | 2.8s | 100% | |
| ByteDance Seed 1.6 Flash | 100% | $0.0004 | 5.3s | 100% | |
| Inception Mercury 2 | 100% | $0.0013 | 2.0s | 100% | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0008 | 3.9s | 100% | |
| GPT-5.6 Luna (Reasoning) | 100% | $0.0016 | 2.6s | 100% | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 100% | $0.0024 | 850ms | 100% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | $0.0024 | 990ms | 100% | |
| GPT-5.6 Sol | 100% | $0.0023 | 2.0s | 100% | |
| Mistral Small 4 (Reasoning) | 100% | $0.0009 | 9.3s | 100% | |
| Gemma 4 31B | 100% | $0.0002 | 12.4s | 100% | |
| GPT-5.5 | 100% | $0.0041 | 1.3s | 100% | |
| Z.AI GLM 4.5 Air | 100% | $0.0012 | 19.2s | 100% | |
| ByteDance Seed 1.6 | 100% | $0.0017 | 16.9s | 100% | |
| Z.AI GLM 5 Turbo | 100% | $0.0036 | 9.8s | 100% | |
| GPT-5.4 Mini (Reasoning) | 100% | $0.0039 | 9.0s | 100% | |
| MiniMax M2.7 | 100% | $0.0014 | 22.4s | 100% | |
| Gemini 2.5 Flash (Reasoning) | 100% | $0.0051 | 8.5s | 100% | |
| Claude Opus 4.7 | 100% | $0.011 | 940ms | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 65.0% | Correct "no violations" response | ||
| 80.0% | No hallucinated violations |
Short text (~524 words), big codex (51 entries)
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Ministral 8B | 68% | $0.0003 | 3.4s | |
| Gemma 4 26B | 95% | $0.0003 | 2.8s | |
| Ministral 3 8B | 93% | $0.0004 | 1.2s | |
| GPT-5.6 Luna | 100% | $0.0008 | 867ms | |
| GPT-5.4 Nano | 73% | $0.0004 | 1.4s | |
| Gemma 4 31B | 100% | $0.0004 | 1.7s | |
| GPT-5.4 Nano (Reasoning, Low) | 90% | $0.0006 | 3.2s | |
| GPT-4.1 | 100% | $0.0020 | 737ms | |
| Laguna XS 2.1 | 100% | $0.0003 | 11.6s | |
| GPT-5.6 Sol | 100% | $0.0027 | 928ms | |
| ByteDance Seed 1.6 Flash | 100% | $0.0005 | 6.7s | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0010 | 5.1s | |
| Arcee AI: Trinity Mini | 83% | $0.0003 | 15.8s | |
| Gemini 2.5 Flash Lite (Reasoning) | 100% | $0.0011 | 6.6s | |
| Thinking Machines Inkling | 76% | $0.0049 | 7.9s | |
| Hermes 3 405B | 75% | $0.0026 | 1.7s | |
| Laguna S 2.1 | 73% | $0.0002 | 17.7s | |
| GPT-5.6 Luna (Reasoning) | 75% | $0.0031 | 4.1s | |
| Qwen 3 32B | 93% | $0.0004 | 10.6s | |
| Inception Mercury 2 | 100% | $0.0024 | 3.6s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Qwen3.7 Max | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.1 | 100% | 100% | 100% | |
| Qwen3.6 Max Preview | 100% | 100% | 100% | |
| Claude Sonnet 4.6 (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| Claude Opus 4.7 (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.8 (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.6 | 100% | 100% | 100% | |
| Claude Opus 5 (Reasoning, Low) | 100% | 100% | 100% | |
| Claude Opus 4.8 (Reasoning, Low) | 100% | 100% | 100% | |
| GPT-5 Mini | 100% | 100% | 100% | |
| Claude Opus 5 (Reasoning) | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, Low) | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Gemma 4 31B | 100% | $0.0004 | 1.7s | 100% | |
| GPT-5.6 Luna | 100% | $0.0008 | 867ms | 100% | |
| GPT-4.1 | 100% | $0.0020 | 737ms | 100% | |
| ByteDance Seed 1.6 Flash | 100% | $0.0005 | 6.7s | 100% | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0010 | 5.1s | 100% | |
| Gemini 2.5 Flash Lite (Reasoning) | 100% | $0.0011 | 6.6s | 100% | |
| GPT-5.6 Sol | 100% | $0.0027 | 928ms | 100% | |
| Inception Mercury 2 | 100% | $0.0024 | 3.6s | 100% | |
| Laguna XS 2.1 | 100% | $0.0003 | 11.6s | 100% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | $0.0043 | 890ms | 100% | |
| Z.AI GLM 5 Turbo | 100% | $0.0034 | 7.9s | 100% | |
| ByteDance Seed 1.6 | 100% | $0.0021 | 16.2s | 100% | |
| GPT-5.5 | 100% | $0.0069 | 1.6s | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | $0.0045 | 12.9s | 100% | |
| Grok 4.5 (Reasoning, Low) | 100% | $0.0063 | 9.4s | 100% | |
| GPT-5 Mini | 100% | $0.0044 | 28.8s | 100% | |
| MiniMax M3 | 100% | $0.0021 | 38.9s | 100% | |
| Nemotron 3 Super | 100% | $0.0000 | 51.1s | 100% | |
| o4 Mini | 100% | $0.010 | 20.6s | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | $0.013 | 15.2s | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 70.0% | Correct "no violations" response | ||
| 76.7% | No hallucinated violations |
Long text (~1594 words), small codex (11 entries)
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-4.1 Nano | 93% | $0.0001 | 962ms | |
| Gemini 2.5 Flash Lite | 74% | $0.0003 | 516ms | |
| Mistral Small 3.2 24B | 72% | $0.0003 | 1.0s | |
| Ministral 3 8B | 90% | $0.0004 | 1.4s | |
| GPT-5.6 Luna | 100% | $0.0006 | 765ms | |
| GPT-5.4 Nano | 66% | $0.0004 | 1.6s | |
| Gemini 3.1 Flash Lite | 85% | $0.0007 | 741ms | |
| Gemini 3.1 Flash Lite (Reasoning) | 79% | $0.0008 | 874ms | |
| Gemini 3.1 Flash Lite (Preview) | 70% | $0.0008 | 882ms | |
| GPT-5.6 Terra | 100% | $0.0014 | 992ms | |
| Gemma 4 31B | 100% | $0.0004 | 20.6s | |
| Mistral Medium 3.1 | 95% | $0.0011 | 764ms | |
| GPT-5.4 Nano (Reasoning, Low) | 100% | $0.0006 | 3.6s | |
| GPT-4.1 | 100% | $0.0022 | 815ms | |
| Inception Mercury 2 | 100% | $0.0013 | 2.0s | |
| Cydonia 24B V4.1 | 62% | $0.0008 | 9.4s | |
| GPT-5.6 Sol | 100% | $0.0044 | 1.1s | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0010 | 3.7s | |
| ByteDance Seed 1.6 Flash | 100% | $0.0005 | 7.4s | |
| GPT-5.6 Luna (Reasoning) | 100% | $0.0021 | 2.8s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| GPT-5.6 Sol (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Qwen3.7 Max | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.1 | 100% | 100% | 100% | |
| Qwen3.6 Max Preview | 100% | 100% | 100% | |
| GPT-5.5 (Reasoning) | 100% | 100% | 100% | |
| Claude Sonnet 4.6 (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| MoonshotAI: Kimi K3 (Reasoning, High) | 100% | 100% | 100% | |
| MoonshotAI: Kimi K2.6 | 100% | 100% | 100% | |
| Claude Opus 4.7 (Reasoning) | 100% | 100% | 100% | |
| GPT-5.5 (Reasoning, Low) | 100% | 100% | 100% | |
| GPT-5.6 Terra (Reasoning) | 100% | 100% | 100% | |
| MoonshotAI: Kimi K3 (Reasoning, Low) | 100% | 100% | 100% | |
| GPT-5 | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-5.6 Luna | 100% | $0.0006 | 765ms | 100% | |
| GPT-5.6 Terra | 100% | $0.0014 | 992ms | 100% | |
| GPT-5.4 Nano (Reasoning, Low) | 100% | $0.0006 | 3.6s | 100% | |
| Inception Mercury 2 | 100% | $0.0013 | 2.0s | 100% | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0010 | 3.7s | 100% | |
| GPT-4.1 | 100% | $0.0022 | 815ms | 100% | |
| GPT-5.6 Luna (Reasoning) | 100% | $0.0021 | 2.8s | 100% | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0021 | 3.0s | 100% | |
| ByteDance Seed 1.6 Flash | 100% | $0.0005 | 7.4s | 100% | |
| GPT-5.6 Terra (Reasoning) | 100% | $0.0035 | 2.4s | 100% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | $0.0042 | 819ms | 100% | |
| GPT-5.6 Sol | 100% | $0.0044 | 1.1s | 100% | |
| DeepSeek V4 Flash (Reasoning) | 100% | $0.0005 | 19.3s | 100% | |
| Z.AI GLM 5 Turbo | 100% | $0.0039 | 9.7s | 100% | |
| Gemma 4 31B | 100% | $0.0004 | 20.6s | 100% | |
| Xiaomi MIMO v2.5 | 100% | $0.0035 | 14.7s | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | $0.0040 | 14.1s | 100% | |
| GPT-5.4 Mini (Reasoning) | 100% | $0.0065 | 7.8s | 100% | |
| GPT-5.4 (Reasoning, Low) | 100% | $0.0077 | 5.5s | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | $0.0074 | 8.5s | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 80.0% | Correct "no violations" response | ||
| 90.0% | No hallucinated violations |
Long text (~1594 words), big codex (51 entries)
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-4.1 Nano | 93% | $0.0003 | 2.2s | |
| Ministral 3 8B | 93% | $0.0006 | 1.9s | |
| Cydonia 24B V4.1 | 71% | $0.0008 | 4.4s | |
| GPT-5.4 Nano (Reasoning, Low) | 100% | $0.0011 | 6.4s | |
| ByteDance Seed 1.6 Flash | 93% | $0.0010 | 14.8s | |
| Inception Mercury 2 | 100% | $0.0039 | 5.5s | |
| GPT-5.4 Mini (Reasoning, Low) | 85% | $0.0048 | 6.5s | |
| Laguna XS 2.1 | 93% | $0.0006 | 23.3s | |
| GPT-5.6 Luna (Reasoning) | 75% | $0.0060 | 6.0s | |
| Mistral Small 4 (Reasoning) | 92% | $0.0026 | 21.1s | |
| Gemini 2.5 Flash Lite (Reasoning) | 93% | $0.0033 | 22.0s | |
| DeepSeek V4 Flash (Reasoning) | 78% | $0.0010 | 39.3s | |
| Z.AI GLM 5 Turbo | 68% | $0.0096 | 25.3s | |
| Gemini 2.5 Flash (Reasoning) | 85% | $0.012 | 18.1s | |
| GPT-5.2 | 92% | $0.015 | 17.4s | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | $0.017 | 20.3s | |
| Xiaomi MIMO v2.5 | 93% | $0.011 | 47.4s | |
| GPT-OSS 120B | 85% | $0.0013 | 1.2m | |
| GPT-5 Nano | 100% | $0.0038 | 1.3m | |
| Laguna S 2.1 | 86% | $0.0017 | 1.2m | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Claude Opus 5 (Reasoning, Low) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | 100% | 100% | |
| GPT-5.1 | 100% | 100% | 100% | |
| DeepSeek V4 Pro (Reasoning) | 100% | 100% | 100% | |
| Aion 2.0 | 100% | 100% | 100% | |
| Inception Mercury 2 | 100% | 100% | 100% | |
| GPT-5 Nano | 100% | 100% | 100% | |
| GPT-5.4 Nano (Reasoning, Low) | 100% | 100% | 100% | |
| Claude Opus 4.6 | 94% | 61% | 61% | |
| Ministral 3 8B | 93% | 56% | 56% | |
| GPT-4.1 Nano | 93% | 55% | 55% | |
| Gemini 3.6 Flash (Reasoning) | 93% | 55% | 55% | |
| Xiaomi MIMO v2.5 | 93% | 55% | 55% | |
| Gemini 2.5 Flash Lite (Reasoning) | 93% | 55% | 55% | |
| Nemotron 3 Super | 93% | 55% | 55% | |
| Laguna XS 2.1 | 93% | 55% | 55% | |
| Nemotron 3 Nano | 93% | 55% | 55% | |
| ByteDance Seed 1.6 Flash | 93% | 55% | 55% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-5.4 Nano (Reasoning, Low) | 100% | $0.0011 | 6.4s | 100% | |
| Inception Mercury 2 | 100% | $0.0039 | 5.5s | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | $0.017 | 20.3s | 100% | |
| GPT-5 Nano | 100% | $0.0038 | 1.3m | 100% | |
| GPT-5.1 | 100% | $0.029 | 28.6s | 100% | |
| Aion 2.0 | 100% | $0.0086 | 1.3m | 100% | |
| Ministral 3 8B | 93% | $0.0006 | 1.9s | 56% | |
| GPT-4.1 Nano | 93% | $0.0003 | 2.2s | 55% | |
| ByteDance Seed 1.6 Flash | 93% | $0.0010 | 14.8s | 55% | |
| Grok 4.5 (Reasoning, High) | 100% | $0.063 | 2.4m | 100% | |
| Laguna XS 2.1 | 93% | $0.0006 | 23.3s | 55% | |
| Gemini 2.5 Flash Lite (Reasoning) | 93% | $0.0033 | 22.0s | 55% | |
| Mistral Small 4 (Reasoning) | 92% | $0.0026 | 21.1s | 50% | |
| DeepSeek V4 Pro (Reasoning) | 100% | $0.013 | 4.9m | 100% | |
| Xiaomi MIMO v2.5 | 93% | $0.011 | 47.4s | 55% | |
| GPT-5.2 | 92% | $0.015 | 17.4s | 50% | |
| Claude Opus 4.6 | 94% | $0.048 | 16.8s | 61% | |
| Claude Opus 5 (Reasoning, Low) | 100% | $0.138 | 54.2s | 100% | |
| GPT-5.4 Mini (Reasoning, Low) | 85% | $0.0048 | 6.5s | 40% | |
| Nemotron 3 Super | 93% | $0.0000 | 2.3m | 55% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 30.0% | Correct "no violations" response | ||
| 46.7% | No hallucinated violations |
detailed entries
Short text (~524 words), small codex (11 detailed entries)
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Ministral 8B | 100% | $0.0004 | 338ms | |
| Mistral Small 3.2 24B | 63% | $0.0004 | 1.7s | |
| GPT-5.4 Nano | 83% | $0.0005 | 1.3s | |
| GPT-5.6 Luna | 100% | $0.0008 | 969ms | |
| Ministral 3 8B | 100% | $0.0006 | 339ms | |
| Gemma 4 26B | 100% | $0.0004 | 3.9s | |
| Gemma 4 31B | 100% | $0.0005 | 7.1s | |
| GPT-4.1 Mini | 93% | $0.0007 | 1.6s | |
| Cydonia 24B V4.1 | 83% | $0.0007 | 1.4s | |
| Ministral 3 14B | 100% | $0.0008 | 531ms | |
| GPT-5.4 Nano (Reasoning, Low) | 93% | $0.0006 | 2.8s | |
| Laguna S 2.1 | 100% | $0.0005 | 14.3s | |
| Arcee AI: Trinity Mini | 93% | $0.0013 | 41.5s | |
| Laguna XS 2.1 | 100% | $0.0003 | 7.4s | |
| Mistral Large 3 | 100% | $0.0020 | 774ms | |
| ByteDance Seed 1.6 Flash | 84% | $0.0006 | 7.9s | |
| GPT-5.6 Sol | 93% | $0.0075 | 1.2s | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0023 | 3.9s | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0012 | 7.5s | |
| GPT-4.1 | 100% | $0.0035 | 613ms | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.1 | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| Claude Opus 4.7 (Reasoning) | 100% | 100% | 100% | |
| GPT-5.6 Terra (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | 100% | 100% | |
| GPT-5 Mini | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning, Low) | 100% | 100% | 100% | |
| Claude Sonnet 4.6 | 100% | 100% | 100% | |
| GPT-5.6 Luna (Reasoning) | 100% | 100% | 100% | |
| MiniMax M3 | 100% | 100% | 100% | |
| Qwen 3.5 27B | 100% | 100% | 100% | |
| Claude Opus 5 | 100% | 100% | 100% | |
| Claude Opus 4.7 | 100% | 100% | 100% | |
| GPT-5.4 Mini (Reasoning) | 100% | 100% | 100% | |
| Gemma 4 31B (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.5 | 100% | 100% | 100% | |
| Z.AI GLM 5 | 100% | 100% | 100% | |
| ByteDance Seed 1.6 | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Ministral 8B | 100% | $0.0004 | 338ms | 100% | |
| Ministral 3 8B | 100% | $0.0006 | 339ms | 100% | |
| Ministral 3 14B | 100% | $0.0008 | 531ms | 100% | |
| GPT-5.6 Luna | 100% | $0.0008 | 969ms | 100% | |
| Gemma 4 26B | 100% | $0.0004 | 3.9s | 100% | |
| Mistral Large 3 | 100% | $0.0020 | 774ms | 100% | |
| Laguna XS 2.1 | 100% | $0.0003 | 7.4s | 100% | |
| Gemma 4 31B | 100% | $0.0005 | 7.1s | 100% | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0023 | 3.9s | 100% | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0012 | 7.5s | 100% | |
| GPT-4.1 | 100% | $0.0035 | 613ms | 100% | |
| GPT-5.6 Luna (Reasoning) | 100% | $0.0036 | 3.7s | 100% | |
| Laguna S 2.1 | 100% | $0.0005 | 14.3s | 100% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | $0.0059 | 725ms | 100% | |
| GPT-5.6 Terra (Reasoning) | 100% | $0.0052 | 3.4s | 100% | |
| GPT-5.4 Mini (Reasoning) | 100% | $0.0050 | 6.1s | 100% | |
| Gemini 2.5 Flash Lite (Reasoning) | 100% | $0.0021 | 15.1s | 100% | |
| Mistral Large 2 | 100% | $0.0078 | 650ms | 100% | |
| GPT-5.4 (Reasoning, Low) | 100% | $0.0068 | 5.9s | 100% | |
| Z.AI GLM 5 Turbo | 100% | $0.0055 | 11.5s | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 80.0% | Correct "no violations" response | ||
| 86.7% | No hallucinated violations |
Short text (~524 words), big codex (51 detailed entries)
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-5.4 Nano | 74% | $0.0006 | 1.4s | |
| GPT-5.4 Nano (Reasoning, Low) | 93% | $0.0008 | 3.4s | |
| Ministral 8B | 100% | $0.0013 | 564ms | |
| Gemma 4 26B | 88% | $0.0012 | 5.3s | |
| Arcee AI: Trinity Mini | 100% | $0.0007 | 6.9s | |
| Gemma 4 31B | 100% | $0.0018 | 3.1s | |
| Ministral 3 8B | 100% | $0.0020 | 589ms | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0038 | 2.7s | |
| Laguna XS 2.1 | 100% | $0.0009 | 21.5s | |
| ByteDance Seed 1.6 Flash | 93% | $0.0013 | 7.7s | |
| Inception Mercury 2 | 100% | $0.0031 | 3.7s | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0020 | 8.1s | |
| Laguna S 2.1 | 95% | $0.0007 | 31.1s | |
| DeepSeek V4 Flash (Reasoning) | 100% | $0.0009 | 19.7s | |
| GPT-5.4 Mini (Reasoning) | 100% | $0.0063 | 5.2s | |
| Gemini 2.5 Flash Lite (Reasoning) | 85% | $0.0023 | 14.2s | |
| Mistral Small 4 (Reasoning) | 93% | $0.0028 | 23.8s | |
| GPT-4.1 | 100% | $0.0086 | 1.0s | |
| Mistral Large 3 | 100% | $0.0066 | 1.4s | |
| GPT-5.6 Luna (Reasoning) | 100% | $0.0075 | 5.2s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Qwen3.7 Max | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| Claude Opus 4.8 (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.6 | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | 100% | 100% | |
| GPT-5 Mini | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, Low) | 100% | 100% | 100% | |
| Claude Sonnet 4.6 | 100% | 100% | 100% | |
| GPT-5.6 Luna (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 5 | 100% | 100% | 100% | |
| GPT-5.4 Mini (Reasoning) | 100% | 100% | 100% | |
| Qwen 3.5 Plus (2026-04-20) | 100% | 100% | 100% | |
| Gemma 4 31B (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.5 | 100% | 100% | 100% | |
| ByteDance Seed 1.6 | 100% | 100% | 100% | |
| GPT-5.2 | 100% | 100% | 100% | |
| Gemma 4 26B (Reasoning) | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Ministral 8B | 100% | $0.0013 | 564ms | 100% | |
| Ministral 3 8B | 100% | $0.0020 | 589ms | 100% | |
| Gemma 4 31B | 100% | $0.0018 | 3.1s | 100% | |
| Arcee AI: Trinity Mini | 100% | $0.0007 | 6.9s | 100% | |
| Inception Mercury 2 | 100% | $0.0031 | 3.7s | 100% | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0038 | 2.7s | 100% | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0020 | 8.1s | 100% | |
| Mistral Large 3 | 100% | $0.0066 | 1.4s | 100% | |
| GPT-5.4 Mini (Reasoning) | 100% | $0.0063 | 5.2s | 100% | |
| GPT-4.1 | 100% | $0.0086 | 1.0s | 100% | |
| Thinking Machines Inkling | 100% | $0.0087 | 1.6s | 100% | |
| GPT-5.6 Luna (Reasoning) | 100% | $0.0075 | 5.2s | 100% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | $0.0099 | 862ms | 100% | |
| DeepSeek V4 Flash (Reasoning) | 100% | $0.0009 | 19.7s | 100% | |
| Laguna XS 2.1 | 100% | $0.0009 | 21.5s | 100% | |
| MiniMax M2.7 | 100% | $0.0045 | 17.4s | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | $0.0063 | 15.8s | 100% | |
| Z.AI GLM 5 Turbo | 100% | $0.0077 | 13.6s | 100% | |
| ByteDance Seed 1.6 | 100% | $0.0050 | 19.7s | 100% | |
| Grok 4.5 (Reasoning, Low) | 100% | $0.013 | 9.6s | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 70.0% | Correct "no violations" response | ||
| 83.3% | No hallucinated violations |
Long text (~1594 words), small codex (11 detailed entries)
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-4.1 Nano | 78% | $0.0003 | 1.4s | |
| GPT-4o Mini (temp=1) | 100% | $0.0004 | 597ms | |
| GPT-4o Mini (temp=0) | 100% | $0.0005 | 670ms | |
| GPT-5.6 Luna | 100% | $0.0010 | 717ms | |
| GPT-5.4 Nano (Reasoning, Low) | 100% | $0.0006 | 3.0s | |
| GPT-5.6 Terra | 100% | $0.0040 | 939ms | |
| Laguna S 2.1 | 100% | $0.0004 | 15.5s | |
| Inception Mercury 2 | 100% | $0.0018 | 2.7s | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0029 | 3.0s | |
| GPT-5.4 Nano (Reasoning) | 93% | $0.0014 | 6.7s | |
| ByteDance Seed 1.6 Flash | 100% | $0.0008 | 9.1s | |
| GPT-4.1 | 100% | $0.0045 | 728ms | |
| GPT-5.6 Luna (Reasoning) | 100% | $0.0030 | 2.6s | |
| Laguna XS 2.1 | 84% | $0.0005 | 15.7s | |
| GPT-5.6 Terra (Reasoning) | 100% | $0.0063 | 3.5s | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | $0.0077 | 710ms | |
| GPT-OSS 120B | 93% | $0.0008 | 34.8s | |
| DeepSeek V4 Flash (Reasoning) | 85% | $0.0010 | 35.4s | |
| Z.AI GLM 5 Turbo | 100% | $0.0064 | 16.6s | |
| MiniMax M2.5 | 73% | $0.0029 | 22.1s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| GPT-5.6 Sol (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.1 | 100% | 100% | 100% | |
| Claude Sonnet 4.6 (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| Claude Opus 4.7 (Reasoning) | 100% | 100% | 100% | |
| GPT-5.6 Terra (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.8 (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 5 (Reasoning, Low) | 100% | 100% | 100% | |
| Claude Opus 4.8 (Reasoning, Low) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | 100% | 100% | |
| GPT-5 Mini | 100% | 100% | 100% | |
| Claude Opus 5 (Reasoning) | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, Low) | 100% | 100% | 100% | |
| GPT-5.4 (Reasoning, Low) | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-4o Mini (temp=1) | 100% | $0.0004 | 597ms | 100% | |
| GPT-4o Mini (temp=0) | 100% | $0.0005 | 670ms | 100% | |
| GPT-5.6 Luna | 100% | $0.0010 | 717ms | 100% | |
| GPT-5.4 Nano (Reasoning, Low) | 100% | $0.0006 | 3.0s | 100% | |
| Inception Mercury 2 | 100% | $0.0018 | 2.7s | 100% | |
| ByteDance Seed 1.6 Flash | 100% | $0.0008 | 9.1s | 100% | |
| GPT-5.6 Luna (Reasoning) | 100% | $0.0030 | 2.6s | 100% | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0029 | 3.0s | 100% | |
| GPT-5.6 Terra | 100% | $0.0040 | 939ms | 100% | |
| GPT-4.1 | 100% | $0.0045 | 728ms | 100% | |
| Laguna S 2.1 | 100% | $0.0004 | 15.5s | 100% | |
| GPT-5.6 Terra (Reasoning) | 100% | $0.0063 | 3.5s | 100% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | $0.0077 | 710ms | 100% | |
| GPT-5.4 Mini (Reasoning) | 100% | $0.0084 | 8.9s | 100% | |
| Z.AI GLM 5 Turbo | 100% | $0.0064 | 16.6s | 100% | |
| GPT-5.4 (Reasoning, Low) | 100% | $0.010 | 9.1s | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | $0.011 | 10.5s | 100% | |
| Grok 4.5 (Reasoning, Low) | 100% | $0.010 | 13.3s | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | $0.0077 | 24.2s | 100% | |
| GPT-5.6 Sol (Reasoning) | 100% | $0.017 | 5.5s | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 60.0% | Correct "no violations" response | ||
| 75.0% | No hallucinated violations |
Long text (~1594 words), big codex (51 detailed entries)
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-5.4 Nano | 78% | $0.0008 | 1.0s | |
| Ministral 8B | 100% | $0.0014 | 525ms | |
| Ministral 3 8B | 100% | $0.0022 | 678ms | |
| Ministral 3 14B | 93% | $0.0029 | 2.7s | |
| GPT-5.4 Nano (Reasoning, Low) | 100% | $0.0014 | 6.3s | |
| Arcee AI: Trinity Mini | 90% | $0.0018 | 45.5s | |
| GPT-4.1 | 100% | $0.0097 | 972ms | |
| GPT-5.6 Sol | 67% | $0.016 | 2.5s | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0073 | 5.9s | |
| Inception Mercury 2 | 85% | $0.0056 | 7.7s | |
| ByteDance Seed 1.6 Flash | 84% | $0.0016 | 13.8s | |
| Laguna XS 2.1 | 78% | $0.0009 | 23.0s | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0035 | 40.9s | |
| GPT-5.6 Terra (Reasoning) | 93% | $0.018 | 6.9s | |
| GPT-5.6 Luna (Reasoning) | 85% | $0.012 | 10.3s | |
| Gemini 2.5 Flash Lite (Reasoning) | 93% | $0.0038 | 27.3s | |
| ByteDance Seed 2.0 Lite | 100% | $0.0056 | 25.4s | |
| GPT-5.4 (Reasoning, Low) | 92% | $0.019 | 14.5s | |
| Gemini 2.5 Flash (Reasoning) | 85% | $0.015 | 19.0s | |
| Grok 4.5 (Reasoning, Low) | 100% | $0.017 | 15.1s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5.1 | 100% | 100% | 100% | |
| Qwen3.6 Max Preview | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| MoonshotAI: Kimi K3 (Reasoning, High) | 100% | 100% | 100% | |
| MoonshotAI: Kimi K2.6 | 100% | 100% | 100% | |
| Claude Opus 4.7 (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.8 (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.6 | 100% | 100% | 100% | |
| MoonshotAI: Kimi K3 (Reasoning, Low) | 100% | 100% | 100% | |
| Claude Opus 5 (Reasoning, Low) | 100% | 100% | 100% | |
| Claude Opus 4.8 (Reasoning, Low) | 100% | 100% | 100% | |
| GPT-5 | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | 100% | 100% | |
| GPT-5 Mini | 100% | 100% | 100% | |
| Claude Opus 5 (Reasoning) | 100% | 100% | 100% | |
| Grok 4.3 (Reasoning) | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Ministral 8B | 100% | $0.0014 | 525ms | 100% | |
| Ministral 3 8B | 100% | $0.0022 | 678ms | 100% | |
| GPT-5.4 Nano (Reasoning, Low) | 100% | $0.0014 | 6.3s | 100% | |
| GPT-4.1 | 100% | $0.0097 | 972ms | 100% | |
| GPT-5.4 Mini (Reasoning, Low) | 100% | $0.0073 | 5.9s | 100% | |
| ByteDance Seed 2.0 Lite | 100% | $0.0056 | 25.4s | 100% | |
| Grok 4.5 (Reasoning, Low) | 100% | $0.017 | 15.1s | 100% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 100% | $0.024 | 16.7s | 100% | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0035 | 40.9s | 100% | |
| Z.AI GLM 5 Turbo | 100% | $0.016 | 33.5s | 100% | |
| GPT-5 Mini | 100% | $0.0090 | 53.0s | 100% | |
| o4 Mini | 100% | $0.026 | 43.6s | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | $0.018 | 53.6s | 100% | |
| DeepSeek V4 Flash (Reasoning) | 100% | $0.0021 | 1.2m | 100% | |
| Xiaomi MIMO v2.5 | 100% | $0.017 | 1.1m | 100% | |
| Grok 4.20 (Reasoning) | 100% | $0.027 | 57.4s | 100% | |
| MoonshotAI: Kimi K3 (Reasoning, Low) | 100% | $0.035 | 49.7s | 100% | |
| Grok 4.3 (Reasoning) | 100% | $0.027 | 1.1m | 100% | |
| GPT-5.1 | 100% | $0.051 | 44.5s | 100% | |
| Aion 2.0 | 100% | $0.017 | 1.7m | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 70.0% | Correct "no violations" response | ||
| 77.5% | No hallucinated violations |