Data extraction

Extract key details from a given block of text.

Price-Performance Score Distribution (Top 20)

Click a model name to view its detail page.

ScoreCostTime
Gemma 3 4B92%$0.0000303ms
Ministral 3B73%$0.0000308ms
Ministral 8B75%$0.0000331ms
Gemini 2.5 Flash Lite92%$0.0000357ms
Ministral 3 3B78%$0.0000416ms
Ministral 3 14B88%$0.0000448ms
Gemma 3 12B92%$0.0000542ms
Gemini 3.5 Flash Lite (Reasoning)100%$0.0000395ms
Ministral 3 8B71%$0.0000382ms
Mistral Small 3.2 24B83%$0.0000691ms
Gemini 3.5 Flash Lite (Reasoning, Minimal)100%$0.0000462ms
Mistral Small 488%$0.0000539ms
Gemini 2.5 Flash83%$0.0000473ms
Gemma 3 27B92%$0.0000780ms
Cydonia 24B V4.181%$0.0000593ms
GPT-5.4 Nano93%$0.0000768ms
Mistral Medium 3.188%$0.0000655ms
Gemini 3.1 Flash Lite (Reasoning)91%$0.00001.2s
Mistral Large 388%$0.0000945ms
Gemma 4 31B97%$0.00005.1s
0.700.800.901.00

Cost vs Performance

Compares total cost for this test against the test score. Quadrant lines are drawn at the median values. Only models with available cost data are shown.

12 low-scoring outliers hidden: Grok 4.20 (88.6%), Arcee AI: Trinity Mini (88.6%), Cydonia 24B V4.1 (87.3%), Ministral 3 3B (85.5%), Ministral 8B (80.9%), WizardLM 2 8x22b (79.1%), DeepSeek V4 Flash (77.7%), Ministral 3B (77.7%), Ministral 3 8B (77.3%), Thinking Machines Inkling (75.0%), Grok 4.20 (Reasoning) (72.3%), Cohere Command R+ (Aug. 2024) (68.2%).

Most Stable Models (Top 20)

Ranked by stability (median × consistency). Click a model name to view its detail page.

ScoreConsistencyStability
GPT-5.6 Sol (Reasoning)100%100%100%
Gemini 3.6 Flash (Reasoning)100%100%100%
Grok 4.5 (Reasoning, High)100%100%100%
Z.AI GLM 5.2 (Reasoning, High)100%100%100%
MoonshotAI: Kimi K3 (Reasoning, High)100%100%100%
GPT-5.6 Terra (Reasoning)100%100%100%
MoonshotAI: Kimi K3 (Reasoning, Low)100%100%100%
GPT-5.6 Sol100%100%100%
GPT-5.6 Luna (Reasoning)100%100%100%
GPT-5.6 Terra100%100%100%
Gemini 3.6 Flash (Reasoning, Minimal)100%100%100%
GPT-5.6 Luna100%100%100%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100%100%100%
Gemini 3.5 Flash Lite (Reasoning)100%100%100%
Grok 4.5 (Reasoning, Low)100%91%91%
Gemini 3.5 Flash (Reasoning)99%82%82%
Gemini 3 Flash (Preview, Reasoning)99%82%82%
Aion 3.0 Mini98%75%75%
Gemma 4 26B (Reasoning)98%74%74%
Claude Sonnet 496%72%72%
0%10%20%30%40%50%60%70%80%90%100%

Top Overall Models (Top 20)

Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.

ScoreCostSpeedStability
Gemini 3.5 Flash Lite (Reasoning)100%$0.0000395ms100%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100%$0.0000462ms100%
GPT-5.6 Luna100%$0.0001698ms100%
Gemini 3.6 Flash (Reasoning, Minimal)100%$0.0002693ms100%
GPT-5.6 Terra100%$0.0003800ms100%
GPT-5.6 Terra (Reasoning)100%$0.00041.1s100%
GPT-5.6 Luna (Reasoning)100%$0.00031.7s100%
GPT-5.6 Sol100%$0.00061.1s100%
GPT-5.6 Sol (Reasoning)100%$0.00071.2s100%
MoonshotAI: Kimi K3 (Reasoning, Low)100%$0.00134.2s100%
Gemini 3.6 Flash (Reasoning)100%$0.00231.8s100%
Z.AI GLM 5.2 (Reasoning, High)100%$0.00125.7s100%
MoonshotAI: Kimi K3 (Reasoning, High)100%$0.00174.9s100%
Grok 4.5 (Reasoning, High)100%$0.00185.6s100%
Grok 4.5 (Reasoning, Low)100%$0.00146.2s91%
Gemini 3 Flash (Preview, Reasoning)99%$0.00267.0s82%
Claude Sonnet 496%$0.00041.6s72%
Laguna XS 2.195%$0.00002.4s71%
Aion 3.0 Mini98%$0.00058.5s75%
Claude Sonnet 5 (Reasoning, Low)95%$0.00053.4s71%
0%10%20%30%40%50%60%70%80%90%100%
Model Total â–¼Who's the tallest?What's the color of the car?What instrument does Lucy play?Guess the petWho's the sister?Contextual pronounIndirect birth yearFruits excluding citrusFuture event timeHighest-rated movieAll valid emails
GPT-5.6 Sol (Reasoning)100%100%100%100%100%100%100%100%100%100%100%100%
Gemini 3.6 Flash (Reasoning)100%100%100%100%100%100%100%100%100%100%100%100%
Qwen3.7 Max100%100%100%100%100%100%100%100%100%100%100%100%
Grok 4.5 (Reasoning, High)100%100%100%100%100%100%100%100%100%100%100%100%
Gemini 3.1 Pro (Preview)100%100%100%100%100%100%100%100%100%100%100%100%
GPT-5.4 (Reasoning)100%100%100%100%100%100%100%100%100%100%100%100%
Z.AI GLM 5.1100%100%100%100%100%100%100%100%100%100%100%100%
Qwen3.6 Max Preview100%100%100%100%100%100%100%100%100%100%100%100%
GPT-5.5 (Reasoning)100%100%100%100%100%100%100%100%100%100%100%100%
Z.AI GLM 5.2 (Reasoning, High)100%100%100%100%100%100%100%100%100%100%100%100%
Gemini 3.5 Flash (Reasoning)100%100%100%100%100%100%100%100%100%100%100%100%
MoonshotAI: Kimi K3 (Reasoning, High)100%100%100%100%100%100%100%100%100%100%100%100%
MoonshotAI: Kimi K2.6100%100%100%100%100%100%100%100%100%100%100%100%
Claude Opus 4.7 (Reasoning)100%100%100%100%100%100%100%100%100%100%100%100%
GPT-5.5 (Reasoning, Low)100%100%100%100%100%100%100%100%100%100%100%100%
1–15 of 161
Page 1 / 11

Who's the tallest?

What's the color of the car?

What instrument does Lucy play?

Guess the pet

Who's the sister?

Contextual pronoun

Indirect birth year

Fruits excluding citrus

Future event time

Highest-rated movie

All valid emails