Codex Violation Detection

Detects factual inconsistencies between a story bible and prose passages. The model must output structured XML identifying each violation with paragraph number and substring.

Price-Performance Score Distribution (Top 20)

Click a model name to view its detail page.

ScoreCostTime
GPT-5.6 Terra98%$0.0113.8s
GPT-5.497%$0.0138.8s
Gemini 2.5 Flash (Reasoning)97%$0.007912.5s
Z.AI GLM 5 Turbo97%$0.007217.1s
Z.AI GLM 5.2 (Reasoning, High)97%$0.010027.9s
Gemini 3 Flash (Preview, Reasoning)97%$0.01118.0s
Gemma 4 31B97%$0.000937.9s
Gemini 3.5 Flash (Reasoning, Minimal)95%$0.0113.6s
Grok 4.5 (Reasoning, Low)99%$0.01329.6s
GPT-5.6 Sol99%$0.0266.4s
DeepSeek V4 Flash (Reasoning)97%$0.001040.3s
Xiaomi MIMO v2.595%$0.005821.8s
Qwen 3.6 Flash96%$0.01129.9s
Gemini 2.5 Flash91%$0.00252.8s
GPT-5.4 (Reasoning, Low)96%$0.02013.5s
Inception Mercury 292%$0.00304.6s
Gemini 3 Flash (Preview)94%$0.00314.5s
GPT-5.4 Mini (Reasoning, Low)93%$0.00556.7s
Xiaomi MIMO v2.5 Pro96%$0.009137.0s
Gemini 2.5 Flash Lite (Reasoning)93%$0.002017.6s
0.700.800.901.00

Cost vs Performance

Compares total cost for this test against the test score. Quadrant lines are drawn at the median values. Only models with available cost data are shown.

14 low-scoring outliers hidden: Cydonia 24B V4.1 (64.3%), Mistral Small 4 (62.0%), Ministral 3 3B (61.5%), Cohere Command R+ (Aug. 2024) (61.4%), Hermes 3 70B (60.5%), Ministral 8B (59.6%), Ministral 3B (59.5%), Mistral NeMO (53.6%), Aion 3.0 Mini (47.3%), GPT-5.4 Nano (Reasoning, Low) (42.6%), Gemma 3 4B (39.2%), WizardLM 2 8x22b (36.9%), GPT-5.4 Nano (36.6%), GPT-4.1 Nano (21.9%).

Most Stable Models (Top 20)

Ranked by stability (median × consistency). Click a model name to view its detail page.

ScoreConsistencyStability
Gemini 3.1 Pro (Preview)99%97%97%
Claude Opus 4.599%97%97%
Claude Opus 4.6 (Reasoning)99%96%96%
Gemini 2.5 Pro99%95%95%
Grok 4.5 (Reasoning, High)98%95%95%
Grok 4.20 (Reasoning)98%95%95%
GPT-5.6 Sol99%95%95%
Qwen3.6 Max Preview98%95%95%
Grok 4.5 (Reasoning, Low)99%95%95%
GPT-5.6 Terra98%94%94%
Gemini 3.5 Flash (Reasoning)98%94%94%
Claude Opus 4.699%94%94%
Qwen 3.5 27B98%94%94%
Z.AI GLM 5.198%94%94%
GPT-5.598%93%93%
GPT-5.5 (Reasoning)97%93%93%
Qwen 3.5 Plus (2026-04-20)97%93%93%
GPT-5.5 (Reasoning, Low)97%93%93%
Gemma 4 31B (Reasoning)97%93%93%
Qwen3.7 Max98%93%93%
80%90%100%

Top Overall Models (Top 20)

Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.

ScoreCostSpeedStability
GPT-5.6 Terra98%$0.0113.8s94%
Gemini 2.5 Flash (Reasoning)97%$0.007912.5s92%
Z.AI GLM 5 Turbo97%$0.007217.1s92%
GPT-5.497%$0.0138.8s91%
Gemini 3 Flash (Preview, Reasoning)97%$0.01118.0s92%
Gemini 3 Flash (Preview)94%$0.00314.5s83%
Gemma 4 31B97%$0.000937.9s90%
Grok 4.5 (Reasoning, Low)99%$0.01329.6s95%
GPT-5.6 Sol99%$0.0266.4s95%
Inception Mercury 292%$0.00304.6s83%
Gemini 3.5 Flash (Reasoning, Minimal)95%$0.0113.6s86%
DeepSeek V4 Flash (Reasoning)97%$0.001040.3s90%
Gemini 2.5 Flash91%$0.00252.8s82%
Z.AI GLM 5.2 (Reasoning, High)97%$0.010027.9s90%
Gemini 2.5 Flash Lite (Reasoning)93%$0.002017.6s84%
GPT-5.6 Luna (Reasoning)95%$0.0109.3s85%
GPT-5.4 Mini (Reasoning, Low)93%$0.00556.7s82%
GPT-5.598%$0.0307.7s93%
Xiaomi MIMO v2.5 Pro96%$0.009137.0s89%
Grok 4.20 (Reasoning)98%$0.01545.4s95%
80%90%100%
matrixtiers
Model Total â–¼Small codex (7 entries), short passage (165 words)Large codex (40 entries), short passage (165 words)Small codex (7 entries), long passage (734 words)Large codex (40 entries), long passage (1,019 words)5 codex entries10 codex entries20 codex entries40 codex entries
Claude Opus 4.599%100%100%100%96%100%100%100%98%
Gemini 3.1 Pro (Preview)99%100%99%99%96%100%100%99%100%
Claude Opus 4.6 (Reasoning)99%100%97%98%96%100%100%100%100%
GPT-5.6 Sol99%100%99%99%97%100%100%94%100%
Gemini 2.5 Pro99%99%100%99%96%100%99%97%99%
Claude Opus 4.699%100%98%99%91%100%100%100%100%
Grok 4.5 (Reasoning, Low)99%100%98%99%94%100%100%97%100%
Grok 4.5 (Reasoning, High)98%100%98%98%97%100%98%96%100%
Qwen3.6 Max Preview98%100%97%98%98%100%100%94%100%
Qwen3.7 Max98%100%98%95%98%100%100%95%100%
Grok 4.20 (Reasoning)98%100%97%97%98%100%97%96%100%
Gemini 3.5 Flash (Reasoning)98%100%98%98%95%100%99%95%100%
GPT-5.6 Terra98%100%96%97%94%100%100%96%99%
Z.AI GLM 5.198%100%98%96%96%100%99%93%99%
GPT-5.598%100%100%94%95%100%99%92%100%
1–15 of 146
Page 1 / 10

matrix

Small codex (7 entries), short passage (165 words)

Large codex (40 entries), short passage (165 words)

Small codex (7 entries), long passage (734 words)