Language Comprehension

Does the model understand more than just English?

Price-Performance Score Distribution (Top 20)

Click a model name to view its detail page.

ScoreCostTime
Mistral NeMO95%$0.0000625ms
Ministral 3 3B100%$0.0000833ms
Ministral 8B55%$0.0000540ms
Gemini 2.5 Flash Lite80%$0.0001648ms
GPT-4o Mini (temp=1)55%$0.0000942ms
GPT-6 Luna90%$0.00001.6s
GPT-5.4 Nano70%$0.0001990ms
Gemini 3.1 Flash Lite (Preview)95%$0.0001975ms
Gemini 3.1 Flash Lite (Reasoning)95%$0.00021.6s
Gemma 3 4B70%$0.00001.7s
Gemini 3.1 Flash Lite85%$0.0001905ms
GPT-5.4 Mini80%$0.0002747ms
Mistral Small 3.2 24B75%$0.00002.4s
Cydonia 24B V4.195%$0.00012.2s
GPT-4.1 Nano65%$0.00001.7s
Mistral Small 455%$0.00011.1s
DeepSeek V4 Flash90%$0.000021.6s
GPT-5.6 Luna100%$0.0003911ms
Inception Mercury 275%$0.0003771ms
Gemini 2.5 Flash75%$0.0002817ms
0.700.800.901.00

Cost vs Performance

Compares total cost for this test against the test score. Quadrant lines are drawn at the median values. Only models with available cost data are shown.

10 low-scoring outliers hidden: Gemma 4 31B (50.0%), GPT-4o, Aug. 6th (temp=0) (50.0%), Mistral Small 4 (Reasoning) (50.0%), GPT-4o Mini (temp=0) (50.0%), Mistral Medium 3.1 (50.0%), Ministral 3 14B (50.0%), Ministral 3 8B (50.0%), ByteDance Seed 1.6 Flash (40.0%), Laguna XS 2.1 (35.0%), Ministral 3B (25.0%).

Most Stable Models (Top 20)

Ranked by stability (median × consistency). Click a model name to view its detail page.

ScoreConsistencyStability
Claude Opus 5.5 (Reasoning)100%100%100%
Qwen 3.8 Max (Reasoning, XHigh)100%100%100%
Gemini 3.8 Flash (Reasoning, Medium)100%100%100%
Z.AI GLM 5.3 (Reasoning, Max)100%100%100%
GPT-5.6 Sol (Reasoning, Medium)100%100%100%
Claude Opus 4.6 (Reasoning)100%100%100%
Gemini 3.6 Flash (Reasoning)100%100%100%
Gemini 3.7 Flash (Reasoning, Medium)100%100%100%
Hy4 Preview (Reasoning, High)100%100%100%
Muse Spark 1.2 (Reasoning, Medium)100%100%100%
Qwen 3.7 Max100%100%100%
Z.AI GLM 5.3 Flash (Reasoning, Max)100%100%100%
Qwen 3.8 Flash (Reasoning)100%100%100%
Grok 4.5 (Reasoning, High)100%100%100%
GPT-6 Luna (Reasoning, High)100%100%100%
Qwen 3.6 Max Preview100%100%100%
GPT-5.5 (Reasoning, Medium)100%100%100%
Claude Sonnet 4.6 (Reasoning)100%100%100%
Z.AI GLM 5.2 (Reasoning, High)100%100%100%
Z.AI GLM 5 Turbo100%100%100%
100%

Top Overall Models (Top 20)

Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.

ScoreCostSpeedStability
Ministral 3 3B100%$0.0000833ms100%
GPT-5.6 Luna100%$0.0003911ms100%
GPT-6 Sol100%$0.00042.1s100%
Mistral Large 3100%$0.00023.7s100%
GPT-6 Luna (Reasoning, Medium)100%$0.00014.3s100%
DeepSeek V3 (2024-12-26)100%$0.00024.8s100%
GPT-6 Luna (Reasoning, High)100%$0.00015.0s100%
Qwen 3.5 Plus (2026-02-15)100%$0.00034.8s100%
DeepSeek-V2 Chat100%$0.00006.6s100%
DeepSeek V3 (2025-03-24)100%$0.00017.5s100%
Mistral Large 2100%$0.00093.8s100%
GPT-6 Sol (Reasoning, Medium)100%$0.00113.8s100%
Hermes 3 405B100%$0.000012.1s100%
GPT-5.4 Mini (Reasoning)100%$0.00124.8s100%
Claude Sonnet 4.6100%$0.00213.1s100%
Gemini 3.8 Flash (Reasoning, Medium)100%$0.00223.0s100%
Gemini 3.7 Flash (Reasoning, Medium)100%$0.00186.7s100%
Muse Glimmer 30B (Reasoning, Medium)100%$0.001013.2s100%
Aion 2.0100%$0.001115.9s100%
ByteDance Seed 1.6100%$0.001315.8s100%
100%
Model Total â–¼Friend got new kittens (Tagalog)Friend got new kittens (German)Asking for directions (German)Asking for directions (Dutch)
Claude Opus 5.5 (Reasoning)100%100%100%100%100%
Qwen 3.8 Max (Reasoning, XHigh)100%100%100%100%100%
Gemini 3.8 Flash (Reasoning, Medium)100%100%100%100%100%
Z.AI GLM 5.3 (Reasoning, Max)100%100%100%100%100%
GPT-5.6 Sol (Reasoning, Medium)100%100%100%100%100%
Claude Opus 4.6 (Reasoning)100%100%100%100%100%
Gemini 3.6 Flash (Reasoning)100%100%100%100%100%
Gemini 3.7 Flash (Reasoning, Medium)100%100%100%100%100%
Hy4 Preview (Reasoning, High)100%100%100%100%100%
Muse Spark 1.2 (Reasoning, Medium)100%100%100%100%100%
Qwen 3.7 Max100%100%100%100%100%
Z.AI GLM 5.3 Flash (Reasoning, Max)100%100%100%100%100%
Qwen 3.8 Flash (Reasoning)100%100%100%100%100%
Grok 4.5 (Reasoning, High)100%100%100%100%100%
GPT-6 Luna (Reasoning, High)100%100%100%100%100%
1–15 of 190
Page 1 / 13

Friend got new kittens (Tagalog)

Friend got new kittens (German)

Asking for directions (German)

Asking for directions (Dutch)