Codex Red Herring (False Positive Detection)
Tests whether models correctly report "no violations" when a codex is fully consistent with the prose passage. Models that hallucinate false violations (false positives) fail. Uses a 2×2 matrix of text length × codex size, with bare and detailed-entry variants.
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| GPT-5.6 Luna | 70% | $0.0020 | 1.2s | |
| GPT-4.1 Nano | 63% | $0.0005 | 4.6s | |
| GPT-5.4 Nano | 68% | $0.0005 | 1.5s | |
| Ministral 8B | 68% | $0.0007 | 4.4s | |
| Ministral 3 8B | 78% | $0.0013 | 17.9s | |
| GPT-5.4 Nano (Reasoning, Low) | 97% | $0.0008 | 3.9s | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 96% | $0.0003 | 7.3s | |
| Inception Mercury 2 | 96% | $0.0027 | 3.8s | |
| GPT-5.4 Mini (Reasoning, Low) | 95% | $0.0034 | 4.0s | |
| GPT-5.4 Nano (Reasoning) | 94% | $0.0017 | 11.4s | |
| Gemma 4 31B | 71% | $0.0009 | 11.7s | |
| ByteDance Seed 1.6 Flash | 94% | $0.0008 | 9.1s | |
| Arcee AI: Trinity Mini | 73% | $0.0009 | 26.3s | |
| GPT-5.6 Luna (Reasoning) | 92% | $0.0048 | 4.7s | |
| GPT-4.1 | 86% | $0.0048 | 1.2s | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 79% | $0.0078 | 1.6s | |
| Laguna XS 2.1 | 91% | $0.0005 | 16.4s | |
| GPT-5.6 Sol | 75% | $0.0091 | 1.7s | |
| Laguna S 2.1 | 92% | $0.0008 | 41.9s | |
| GPT-5.4 Mini (Reasoning) | 89% | $0.0090 | 10.8s | |
Cost vs Performance
Compares total cost for this test against the test score. Quadrant lines are drawn at the median values. Only models with available cost data are shown.
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Nemotron 3 Super | 99% | 83% | 83% | |
| o4 Mini High | 97% | 72% | 72% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 97% | 72% | 72% | |
| GPT-5.4 Nano (Reasoning, Low) | 97% | 70% | 70% | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 96% | 67% | 67% | |
| o4 Mini | 96% | 67% | 67% | |
| Inception Mercury 2 | 96% | 67% | 67% | |
| Z.AI GLM 5 Turbo | 96% | 65% | 65% | |
| GPT-5.1 | 95% | 64% | 64% | |
| GPT-5.4 Mini (Reasoning, Low) | 95% | 64% | 64% | |
| Muse Spark 1.1 (Reasoning, Medium) | 95% | 61% | 61% | |
| Claude Opus 4.6 (Reasoning) | 94% | 60% | 60% | |
| Grok 4.5 (Reasoning, High) | 94% | 60% | 60% | |
| Muse Spark 1.2 (Reasoning, Medium) | 95% | 59% | 59% | |
| ByteDance Seed 1.6 Flash | 94% | 59% | 59% | |
| Grok 4.5 (Reasoning, Low) | 94% | 58% | 58% | |
| Z.AI GLM 5.2 (Reasoning, High) | 94% | 58% | 58% | |
| GPT-5.4 Nano (Reasoning) | 94% | 57% | 57% | |
| Laguna S 2.1 | 92% | 56% | 56% | |
| Z.AI GLM 5 | 93% | 56% | 56% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Nemotron 3 Super | 99% | $0.0000 | 1.3m | 83% | |
| GPT-5.4 Nano (Reasoning, Low) | 97% | $0.0008 | 3.9s | 70% | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 96% | $0.0003 | 7.3s | 67% | |
| Inception Mercury 2 | 96% | $0.0027 | 3.8s | 67% | |
| Muse Spark 1.1 (Reasoning, Minimal) | 97% | $0.012 | 11.2s | 72% | |
| GPT-5.4 Mini (Reasoning, Low) | 95% | $0.0034 | 4.0s | 64% | |
| Z.AI GLM 5 Turbo | 96% | $0.0071 | 16.0s | 65% | |
| o4 Mini | 96% | $0.014 | 25.0s | 67% | |
| ByteDance Seed 1.6 Flash | 94% | $0.0008 | 9.1s | 59% | |
| GPT-5.4 Nano (Reasoning) | 94% | $0.0017 | 11.4s | 57% | |
| o4 Mini High | 97% | $0.027 | 52.5s | 72% | |
| Grok 4.5 (Reasoning, Low) | 94% | $0.012 | 17.0s | 58% | |
| Muse Spark 1.1 (Reasoning, Medium) | 95% | $0.019 | 19.4s | 61% | |
| Z.AI GLM 5.2 (Reasoning, High) | 94% | $0.0081 | 25.8s | 58% | |
| GPT-5.1 | 95% | $0.025 | 26.1s | 64% | |
| GPT-5.6 Luna (Reasoning) | 92% | $0.0048 | 4.7s | 51% | |
| Gemini 2.5 Flash Lite (Reasoning) | 92% | $0.0023 | 16.6s | 53% | |
| Laguna XS 2.1 | 91% | $0.0005 | 16.4s | 52% | |
| Laguna S 2.1 | 92% | $0.0008 | 41.9s | 56% | |
| GPT-5 Mini | 93% | $0.0059 | 37.8s | 56% | |
| basic entries | detailed entries | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Model | Total ▼ | Short text (~524 words), small codex (11 entries) | Short text (~524 words), big codex (51 entries) | Long text (~1594 words), small codex (11 entries) | Long text (~1594 words), big codex (51 entries) | Short text (~524 words), small codex (11 detailed entries) | Short text (~524 words), big codex (51 detailed entries) | Long text (~1594 words), small codex (11 detailed entries) | Long text (~1594 words), big codex (51 detailed entries) |
| Nemotron 3 Super | 99% | 100% | 100% | 100% | 93% | 100% | 100% | 100% | 100% |
| Muse Spark 1.1 (Reasoning, Minimal) | 97% | 93% | 85% | 100% | 100% | 100% | 100% | 100% | 100% |
| o4 Mini High | 97% | 93% | 100% | 100% | 85% | 100% | 100% | 100% | 100% |
| GPT-5.4 Nano (Reasoning, Low) | 97% | 100% | 90% | 100% | 100% | 93% | 93% | 100% | 100% |
| o4 Mini | 96% | 100% | 100% | 100% | 85% | 93% | 100% | 93% | 100% |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 96% | 100% | 93% | 100% | 93% | 93% | 100% | 93% | 100% |
| Inception Mercury 2 | 96% | 100% | 100% | 100% | 100% | 85% | 100% | 100% | 85% |
| Z.AI GLM 5 Turbo | 96% | 100% | 100% | 100% | 68% | 100% | 100% | 100% | 100% |
| GPT-5.1 | 95% | 93% | 93% | 100% | 100% | 93% | 85% | 100% | 100% |
| GPT-5.4 Mini (Reasoning, Low) | 95% | 93% | 85% | 100% | 85% | 100% | 100% | 100% | 100% |
| Muse Spark 1.1 (Reasoning, Medium) | 95% | 85% | 100% | 100% | 83% | 100% | 100% | 100% | 92% |
| Muse Spark 1.2 (Reasoning, Medium) | 95% | 100% | 85% | 100% | 100% | 100% | 100% | 100% | 73% |
| Claude Opus 4.6 (Reasoning) | 94% | 100% | 100% | 100% | 100% | 85% | 70% | 100% | 100% |
| Grok 4.5 (Reasoning, High) | 94% | 100% | 100% | 100% | 100% | 70% | 85% | 100% | 100% |
| ByteDance Seed 1.6 Flash | 94% | 100% | 100% | 100% | 93% | 84% | 93% | 100% | 84% |
basic entries
Short text (~524 words), small codex (11 entries)
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Gemma 4 26B | 100% | $0.0002 | 3.8s | |
| GPT-5.6 Luna | 100% | $0.0005 | 709ms | |
| GPT-5.4 Nano | 80% | $0.0003 | 1.0s | |
| GPT-5.4 Nano (Reasoning, Low) | 100% | $0.0005 | 2.8s | |
| GPT-5.6 Sol | 100% | $0.0023 | 2.0s | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 100% | $0.0001 | 5.4s | |
| Arcee AI: Trinity Mini | 81% | $0.0012 | 36.6s | |
| Gemma 4 31B | 100% | $0.0002 | 12.4s | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0008 | 3.9s | |
| ByteDance Seed 1.6 Flash | 100% | $0.0004 | 5.3s | |
| Inception Mercury 2 | 100% | $0.0013 | 2.0s | |
| Thinking Machines Inkling | 80% | $0.0034 | 9.0s | |
| Laguna S 2.1 | 95% | $0.0001 | 11.8s | |
| GPT-5.6 Luna (Reasoning) | 100% | $0.0016 | 2.6s | |
| GPT-5.5 | 100% | $0.0041 | 1.3s | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | $0.0024 | 990ms | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 100% | $0.0024 | 850ms | |
| Gemini 2.5 Flash Lite (Reasoning) | 93% | $0.0012 | 8.6s | |
| GPT-5.4 Mini (Reasoning, Low) | 93% | $0.0019 | 3.6s | |
| DeepSeek V4.1 Flash (Reasoning, High) | 93% | $0.0016 | 11.5s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Muse Spark 1.2 (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Z.AI GLM 5.1 | 100% | 100% | 100% | |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| Grok 4.6 (Reasoning, High) | 100% | 100% | 100% | |
| Claude Opus 4.7 (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.8 (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.6 | 100% | 100% | 100% | |
| Kimi K3 (Reasoning, Low) | 100% | 100% | 100% | |
| Claude Opus 5 (Reasoning, Low) | 100% | 100% | 100% | |
| Claude Opus 4.8 (Reasoning, Low) | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| GPT-5.6 Luna | 100% | $0.0005 | 709ms | 100% | |
| Gemma 4 26B | 100% | $0.0002 | 3.8s | 100% | |
| GPT-5.4 Nano (Reasoning, Low) | 100% | $0.0005 | 2.8s | 100% | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 100% | $0.0001 | 5.4s | 100% | |
| ByteDance Seed 1.6 Flash | 100% | $0.0004 | 5.3s | 100% | |
| Inception Mercury 2 | 100% | $0.0013 | 2.0s | 100% | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0008 | 3.9s | 100% | |
| GPT-5.6 Luna (Reasoning) | 100% | $0.0016 | 2.6s | 100% | |
| Gemini 3.5 Flash (Reasoning, Minimal) | 100% | $0.0024 | 850ms | 100% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | $0.0024 | 990ms | 100% | |
| GPT-5.6 Sol | 100% | $0.0023 | 2.0s | 100% | |
| Mistral Small 4 (Reasoning) | 100% | $0.0009 | 9.3s | 100% | |
| Gemma 4 31B | 100% | $0.0002 | 12.4s | 100% | |
| GPT-5.5 | 100% | $0.0041 | 1.3s | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | $0.0041 | 4.2s | 100% | |
| Z.AI GLM 4.5 Air | 100% | $0.0012 | 19.2s | 100% | |
| ByteDance Seed 1.6 | 100% | $0.0017 | 16.9s | 100% | |
| Z.AI GLM 5 Turbo | 100% | $0.0036 | 9.8s | 100% | |
| GPT-5.4 Mini (Reasoning) | 100% | $0.0039 | 9.0s | 100% | |
| MiniMax M2.7 | 100% | $0.0014 | 22.4s | 100% | |
| Median | Evaluator | Top 3 | Flop 3 |
|---|---|---|---|
| 70.0% | Correct "no violations" response | ||
| 82.5% | No hallucinated violations |
Short text (~524 words), big codex (51 entries)
Performance Score Distribution (Top 20)
Click a model name to view its detail page.
Price-Performance Score Distribution (Top 20)
Click a model name to view its detail page.
| Score | Cost | Time | ||
|---|---|---|---|---|
| Ministral 8B | 68% | $0.0003 | 3.4s | |
| Gemma 4 26B | 95% | $0.0003 | 2.8s | |
| Ministral 3 8B | 93% | $0.0004 | 1.2s | |
| GPT-5.6 Luna | 100% | $0.0008 | 867ms | |
| GPT-5.4 Nano | 73% | $0.0004 | 1.4s | |
| Gemma 4 31B | 100% | $0.0004 | 1.7s | |
| Z.AI GLM 5.3 Flash (Reasoning, Low) | 93% | $0.0002 | 5.7s | |
| GPT-5.4 Nano (Reasoning, Low) | 90% | $0.0006 | 3.2s | |
| GPT-4.1 | 100% | $0.0020 | 737ms | |
| Laguna XS 2.1 | 100% | $0.0003 | 11.6s | |
| GPT-5.6 Sol | 100% | $0.0027 | 928ms | |
| ByteDance Seed 1.6 Flash | 100% | $0.0005 | 6.7s | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0010 | 5.1s | |
| Arcee AI: Trinity Mini | 83% | $0.0003 | 15.8s | |
| Gemini 2.5 Flash Lite (Reasoning) | 100% | $0.0011 | 6.6s | |
| Thinking Machines Inkling | 76% | $0.0049 | 7.9s | |
| Hermes 3 405B | 75% | $0.0026 | 1.7s | |
| Laguna S 2.1 | 73% | $0.0002 | 17.7s | |
| GPT-5.6 Luna (Reasoning) | 75% | $0.0031 | 4.1s | |
| Qwen 3 32B | 93% | $0.0004 | 10.6s | |
Most Stable Models (Top 20)
Ranked by stability (median × consistency). Click a model name to view its detail page.
| Score | Consistency | Stability | ||
|---|---|---|---|---|
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.3 (Reasoning, Max) | 100% | 100% | 100% | |
| Claude Opus 4.6 (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.6 Flash (Reasoning) | 100% | 100% | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | 100% | 100% | |
| Qwen 3.7 Max | 100% | 100% | 100% | |
| Grok 4.5 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.1 Pro (Preview) | 100% | 100% | 100% | |
| Muse Spark 1.1 (Reasoning, Medium) | 100% | 100% | 100% | |
| Z.AI GLM 5.1 | 100% | 100% | 100% | |
| Qwen 3.6 Max Preview | 100% | 100% | 100% | |
| Claude Sonnet 4.6 (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | 100% | 100% | |
| Gemini 3.5 Flash (Reasoning) | 100% | 100% | 100% | |
| Z.AI GLM 5 Turbo | 100% | 100% | 100% | |
| Grok 4.6 (Reasoning, High) | 100% | 100% | 100% | |
| Claude Opus 4.7 (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.8 (Reasoning) | 100% | 100% | 100% | |
| Claude Opus 4.6 | 100% | 100% | 100% | |
| Claude Opus 5 (Reasoning, Low) | 100% | 100% | 100% | |
Top Overall Models (Top 20)
Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.
| Score | Cost | Speed | Stability | ||
|---|---|---|---|---|---|
| Gemma 4 31B | 100% | $0.0004 | 1.7s | 100% | |
| GPT-5.6 Luna | 100% | $0.0008 | 867ms | 100% | |
| GPT-4.1 | 100% | $0.0020 | 737ms | 100% | |
| ByteDance Seed 1.6 Flash | 100% | $0.0005 | 6.7s | 100% | |
| GPT-5.4 Nano (Reasoning) | 100% | $0.0010 | 5.1s | 100% | |
| Gemini 2.5 Flash Lite (Reasoning) | 100% | $0.0011 | 6.6s | 100% | |
| GPT-5.6 Sol | 100% | $0.0027 | 928ms | 100% | |
| Inception Mercury 2 | 100% | $0.0024 | 3.6s | 100% | |
| Laguna XS 2.1 | 100% | $0.0003 | 11.6s | 100% | |
| Gemini 3.6 Flash (Reasoning, Minimal) | 100% | $0.0043 | 890ms | 100% | |
| Z.AI GLM 5 Turbo | 100% | $0.0034 | 7.9s | 100% | |
| ByteDance Seed 1.6 | 100% | $0.0021 | 16.2s | 100% | |
| Gemini 3.7 Flash (Reasoning, Medium) | 100% | $0.0052 | 6.1s | 100% | |
| GPT-5.5 | 100% | $0.0069 | 1.6s | 100% | |
| DeepSeek V4 Flash 0731 (Reasoning, High) | 100% | $0.0007 | 25.0s | 100% | |
| Z.AI GLM 5.2 (Reasoning, High) | 100% | $0.0045 | 12.9s | 100% | |
| Grok 4.5 (Reasoning, Low) | 100% | $0.0063 | 9.4s | 100% | |
| GPT-5 Mini | 100% | $0.0044 | 28.8s | 100% | |
| MiniMax M3 | 100% | $0.0021 | 38.9s | 100% | |
| Gemini 3.8 Flash (Reasoning, Medium) | 100% | $0.011 | 7.2s | 100% | |