Relationship tree

Extracts a deterministic XML family and relationship tree from cumulative literary prose.

Price-Performance Score Distribution (Top 20)

Click a model name to view its detail page.

ScoreCostTime
GPT-5.6 Terra (Reasoning)91%$0.06024.2s
GPT-5.5 (Reasoning, Low)87%$0.09742.6s
GPT-5.6 Luna (Reasoning)84%$0.02718.6s
Grok 4.5 (Reasoning, Low)89%$0.04049.7s
GPT-5.6 Sol91%$0.09618.1s
Gemini 3 Flash (Preview)81%$0.00877.1s
Gemini 2.5 Pro89%$0.09958.2s
GPT-5.6 Terra84%$0.0349.4s
Gemini 2.5 Flash80%$0.00756.1s
Grok 4.5 (Reasoning, High)93%$0.0802.0m
GPT-5.4 (Reasoning, Low)88%$0.05335.5s
GPT-5.588%$0.10537.1s
Xiaomi MIMO v2.584%$0.00271.1m
GPT-5.6 Sol (Reasoning)96%$0.18659.0s
Gemini 3.1 Flash Lite (Preview)78%$0.00463.2s
GPT-5.287%$0.06250.7s
Gemini 3.1 Flash Lite (Reasoning)78%$0.00333.2s
Gemma 4 26B79%$0.001827.2s
DeepSeek V4 Pro (Reasoning)85%$0.0202.3m
Qwen 3.6 Flash81%$0.01551.7s
0.800.901.00

Cost vs Performance

Compares total cost for this test against the test score. Quadrant lines are drawn at the median values. Only models with available cost data are shown.

1 low-scoring outlier hidden: Gemma 3 12B (37.1%).

Most Stable Models (Top 20)

Ranked by stability (median × consistency). Click a model name to view its detail page.

ScoreConsistencyStability
GPT-5.4 (Reasoning)96%93%90%
GPT-5.6 Sol (Reasoning)96%94%90%
Claude Opus 4.6 (Reasoning)95%93%88%
GPT-5.5 (Reasoning)94%93%87%
Claude Opus 4.8 (Reasoning)94%90%86%
Grok 4.5 (Reasoning, High)93%91%85%
Claude Sonnet 4.6 (Reasoning)92%88%83%
MoonshotAI: Kimi K2.692%89%82%
Z.AI GLM 5.2 (Reasoning, High)85%94%80%
GPT-5.4 (Reasoning, Low)88%93%80%
Claude Opus 4.691%90%80%
Claude Sonnet 5 (Reasoning)90%89%79%
GPT-5.6 Sol91%89%79%
GPT-5.287%92%79%
GPT-5.6 Terra (Reasoning)91%88%79%
Z.AI GLM 5.191%88%79%
MiniMax M387%91%78%
Claude Sonnet 5 (Reasoning, Low)89%89%78%
Claude Opus 4.585%92%78%
Claude Opus 4.8 (Reasoning, Low)90%86%77%
80%90%100%

Top Overall Models (Top 20)

Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.

ScoreCostSpeedStability
GPT-5.6 Terra (Reasoning)91%$0.06024.2s79%
GPT-5.4 (Reasoning, Low)88%$0.05335.5s80%
Gemini 3 Flash (Preview)81%$0.00877.1s76%
GPT-5.6 Sol91%$0.09618.1s79%
GPT-5.6 Sol (Reasoning)96%$0.18659.0s90%
GPT-5.6 Terra84%$0.0349.4s76%
Grok 4.5 (Reasoning, High)93%$0.0802.0m85%
Gemini 3.1 Flash Lite (Preview)78%$0.00463.2s76%
Gemini 2.5 Flash80%$0.00756.1s75%
Grok 4.5 (Reasoning, Low)89%$0.04049.7s75%
GPT-5.287%$0.06250.7s79%
Gemma 4 26B79%$0.001827.2s76%
GPT-5.481%$0.03317.4s77%
Gemini 3.1 Flash Lite (Reasoning)78%$0.00333.2s74%
GPT-5.6 Luna (Reasoning)84%$0.02718.6s72%
Qwen 3.6 Flash81%$0.01551.7s76%
Z.AI GLM 5.2 (Reasoning, High)85%$0.0391.8m80%
Xiaomi MIMO v2.584%$0.00271.1m73%
Claude Opus 4.691%$0.15431.4s80%
GPT-5.4 (Reasoning)96%$0.1752.6m90%
70%80%90%100%
1–15 of 146
Page 1 / 10

Core relationship tree

Family relationship tree