Codex Violation Detection

Detects factual inconsistencies between a story bible and prose passages. The model must output structured XML identifying each violation with paragraph number and substring.

Price-Performance Score Distribution (Top 20)

Click a model name to view its detail page.

ScoreCostTime
GPT-5.6 Terra98%$0.0113.8s
Z.AI GLM 5 Turbo97%$0.007217.1s
GPT-5.497%$0.0138.8s
Gemini 2.5 Flash (Reasoning)97%$0.007912.5s
Z.AI GLM 5.2 (Reasoning, High)97%$0.010027.9s
Gemma 4 31B97%$0.000937.9s
Gemini 3 Flash (Preview, Reasoning)97%$0.01118.0s
Muse Spark 1.1 (Reasoning, Minimal)97%$0.01110.5s
Grok 4.5 (Reasoning, Low)99%$0.01329.6s
Gemini 3.5 Flash (Reasoning, Minimal)95%$0.0113.6s
GPT-5.6 Sol99%$0.0266.4s
DeepSeek V4 Flash (Reasoning)97%$0.001040.3s
Muse Spark 1.1 (Reasoning, Medium)97%$0.01616.1s
Gemini 3.6 Flash (Reasoning, Minimal)95%$0.0113.3s
Gemini 3.5 Flash Lite (Reasoning, Minimal)94%$0.00302.1s
Xiaomi MIMO v2.595%$0.005821.8s
Qwen 3.6 Flash96%$0.01129.9s
Gemini 2.5 Flash91%$0.00252.8s
GPT-5.4 (Reasoning, Low)96%$0.02013.5s
Inception Mercury 292%$0.00304.6s
0.700.800.901.00

Cost vs Performance

Compares total cost for this test against the test score. Quadrant lines are drawn at the median values. Only models with available cost data are shown.

17 low-scoring outliers hidden: Ministral 3 8B (65.2%), GPT-4o Mini (temp=0) (64.9%), GPT-4o Mini (temp=1) (64.9%), Cydonia 24B V4.1 (64.3%), Mistral Small 4 (62.0%), Ministral 3 3B (61.5%), Cohere Command R+ (Aug. 2024) (61.4%), Hermes 3 70B (60.5%), Ministral 8B (59.6%), Ministral 3B (59.5%), Mistral NeMO (53.6%), Aion 3.0 Mini (47.3%), GPT-5.4 Nano (Reasoning, Low) (42.6%), Gemma 3 4B (39.2%), WizardLM 2 8x22b (36.9%), GPT-5.4 Nano (36.6%), GPT-4.1 Nano (21.9%).

Most Stable Models (Top 20)

Ranked by stability (median × consistency). Click a model name to view its detail page.

ScoreConsistencyStability
Gemini 3.1 Pro (Preview)99%97%97%
Claude Opus 4.599%97%97%
MoonshotAI: Kimi K3 (Reasoning, High)99%97%97%
Gemini 3.6 Flash (Reasoning)99%96%96%
Claude Opus 4.6 (Reasoning)99%96%96%
Gemini 2.5 Pro99%95%95%
Grok 4.5 (Reasoning, High)98%95%95%
Grok 4.20 (Reasoning)98%95%95%
GPT-5.6 Sol99%95%95%
Qwen3.6 Max Preview98%95%95%
MoonshotAI: Kimi K3 (Reasoning, Low)99%95%95%
Grok 4.5 (Reasoning, Low)99%95%95%
GPT-5.6 Terra98%94%94%
Gemini 3.5 Flash (Reasoning)98%94%94%
Claude Opus 4.699%94%94%
Qwen 3.5 27B98%94%94%
Z.AI GLM 5.198%94%94%
GPT-5.598%93%93%
Muse Spark 1.1 (Reasoning, Medium)97%93%93%
GPT-5.5 (Reasoning)97%93%93%
90%100%

Top Overall Models (Top 20)

Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.

ScoreCostSpeedStability
GPT-5.6 Terra98%$0.0113.8s94%
Gemini 2.5 Flash (Reasoning)97%$0.007912.5s92%
Z.AI GLM 5 Turbo97%$0.007217.1s92%
Muse Spark 1.1 (Reasoning, Minimal)97%$0.01110.5s92%
GPT-5.497%$0.0138.8s91%
Gemini 3 Flash (Preview, Reasoning)97%$0.01118.0s92%
Gemma 4 31B97%$0.000937.9s90%
DeepSeek V4 Flash (Reasoning)97%$0.001040.3s90%
Grok 4.5 (Reasoning, Low)99%$0.01329.6s95%
Muse Spark 1.1 (Reasoning, Medium)97%$0.01616.1s93%
Gemini 3 Flash (Preview)94%$0.00314.5s83%
GPT-5.6 Sol99%$0.0266.4s95%
Gemini 3.6 Flash (Reasoning, Minimal)95%$0.0113.3s87%
Inception Mercury 292%$0.00304.6s83%
Gemini 3.5 Flash (Reasoning, Minimal)95%$0.0113.6s86%
Gemini 3.5 Flash Lite (Reasoning, Minimal)94%$0.00302.1s80%
Z.AI GLM 5.2 (Reasoning, High)97%$0.010027.9s90%
Gemini 2.5 Flash91%$0.00252.8s82%
Gemini 2.5 Flash Lite (Reasoning)93%$0.002017.6s84%
Grok 4.20 (Reasoning)98%$0.01545.4s95%
60%70%80%90%100%
matrixtiers
Model Total â–¼Small codex (7 entries), short passage (165 words)Large codex (40 entries), short passage (165 words)Small codex (7 entries), long passage (734 words)Large codex (40 entries), long passage (1,019 words)5 codex entries10 codex entries20 codex entries40 codex entries
Claude Opus 4.599%100%100%100%96%100%100%100%98%
Gemini 3.1 Pro (Preview)99%100%99%99%96%100%100%99%100%
MoonshotAI: Kimi K3 (Reasoning, High)99%100%99%98%98%100%100%98%100%
Gemini 3.6 Flash (Reasoning)99%100%98%98%97%100%99%98%100%
Claude Opus 4.6 (Reasoning)99%100%97%98%96%100%100%100%100%
GPT-5.6 Sol99%100%99%99%97%100%100%94%100%
Gemini 2.5 Pro99%99%100%99%96%100%99%97%99%
Claude Opus 4.699%100%98%99%91%100%100%100%100%
Grok 4.5 (Reasoning, Low)99%100%98%99%94%100%100%97%100%
MoonshotAI: Kimi K3 (Reasoning, Low)99%100%99%97%96%100%100%96%100%
Grok 4.5 (Reasoning, High)98%100%98%98%97%100%98%96%100%
Qwen3.6 Max Preview98%100%97%98%98%100%100%94%100%
Qwen3.7 Max98%100%98%95%98%100%100%95%100%
Grok 4.20 (Reasoning)98%100%97%97%98%100%97%96%100%
Gemini 3.5 Flash (Reasoning)98%100%98%98%95%100%99%95%100%
1–15 of 161
Page 1 / 11

matrix

Small codex (7 entries), short passage (165 words)

Large codex (40 entries), short passage (165 words)

Small codex (7 entries), long passage (734 words)

Large codex (40 entries), long passage (1,019 words)

tiers

5 codex entries

10 codex entries

20 codex entries

40 codex entries