Voice/dialogue sheets

Extract dialogue from given text as voice sheets.

Price-Performance Score Distribution (Top 20)

Click a model name to view its detail page.

ScoreCostTime
DeepSeek V4 Flash62%$0.00013.7s
Mistral Small 3.2 24B72%$0.00012.1s
Gemini 2.5 Flash Lite66%$0.0001610ms
Mistral Small 460%$0.00011.3s
GPT-4o Mini (temp=0)60%$0.00013.7s
Gemma 4 26B88%$0.00014.5s
Qwen3 235B A22B Instruct 250772%$0.00014.9s
DeepSeek-V2 Chat80%$0.00018.2s
Gemma 3 12B52%$0.00004.1s
Gemma 4 31B100%$0.00018.3s
DeepSeek V4 Flash (Reasoning)78%$0.000220.6s
Hermes 3 405B58%$0.000013.3s
Z.AI GLM 4.576%$0.00045.3s
Gemini 3.1 Flash Lite (Reasoning)78%$0.00031.4s
Gemini 3.1 Flash Lite (Preview)70%$0.0003979ms
DeepSeek V3 (2025-03-24)84%$0.00036.1s
ByteDance Seed 1.6 Flash66%$0.00024.5s
GPT-4o Mini (temp=1)60%$0.000115.0s
Gemini 3.1 Flash Lite76%$0.00031.1s
Gemini 3.5 Flash Lite (Reasoning, Minimal)80%$0.0005776ms
0.600.700.800.901.00

Cost vs Performance

Compares total cost for this test against the test score. Quadrant lines are drawn at the median values. Only models with available cost data are shown.

3 low-scoring outliers hidden: Arcee AI: Trinity Mini (8.0%), Ministral 8B (8.0%), Ministral 3 3B (0.0%).

Most Stable Models (Top 20)

Ranked by stability (median × consistency). Click a model name to view its detail page.

ScoreConsistencyStability
Claude Opus 4.6 (Reasoning)100%100%100%
Grok 4.5 (Reasoning, High)100%100%100%
Claude Opus 4.6100%100%100%
Claude Sonnet 4.6100%100%100%
Claude Sonnet 4100%100%100%
Gemma 4 31B100%100%100%
Qwen3.7 Max98%72%72%
Claude Sonnet 598%72%72%
Qwen3.6 Max Preview96%61%61%
GPT-4.196%61%61%
ByteDance Seed 1.694%53%53%
Thinking Machines Inkling92%46%46%
Claude Sonnet 5 (Reasoning, Low)92%46%46%
Gemma 4 31B (Reasoning)92%46%46%
Gemini 3.6 Flash (Reasoning)92%46%46%
Grok 4.5 (Reasoning, Low)92%46%46%
Grok 4.20 (Reasoning)92%46%46%
GPT-4o, Aug. 6th (temp=0)92%46%46%
Claude Sonnet 5 (Reasoning)90%40%40%
Claude Sonnet 4.6 (Reasoning)90%40%40%
0%10%20%30%40%50%60%70%80%90%100%

Top Overall Models (Top 20)

Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.

ScoreCostSpeedStability
Gemma 4 31B100%$0.00018.3s100%
Claude Sonnet 4.6100%$0.00331.9s100%
Claude Sonnet 4100%$0.00332.8s100%
Claude Opus 4.6100%$0.00553.9s100%
Claude Opus 4.6 (Reasoning)100%$0.00603.1s100%
Grok 4.5 (Reasoning, High)100%$0.00499.0s100%
Claude Sonnet 598%$0.00324.2s72%
GPT-4.196%$0.00172.6s61%
Thinking Machines Inkling92%$0.00085.2s46%
GPT-4o, Aug. 6th (temp=0)92%$0.00222.4s46%
Gemini 2.5 Flash88%$0.0005933ms35%
ByteDance Seed 1.694%$0.001314.2s53%
Gemma 4 26B88%$0.00014.5s35%
Claude Sonnet 5 (Reasoning, Low)92%$0.00375.0s46%
Qwen 3.5 Plus (2026-02-15)86%$0.00056.6s31%
Grok 4.5 (Reasoning, Low)92%$0.003410.7s46%
Claude Sonnet 5 (Reasoning)90%$0.00374.6s40%
DeepSeek V3 (2025-03-24)84%$0.00036.1s27%
Grok 4.20 (Reasoning)92%$0.003512.9s46%
Gemini 3.5 Flash Lite (Reasoning, Minimal)80%$0.0005776ms20%
0%10%20%30%40%50%60%70%80%90%100%
Model Total â–¼SimpleSimple (1-shot)Simple (5-shot)Multiple speakersUnattributed dialogue
Claude Opus 4.6 (Reasoning)100%100%100%100%100%100%
Grok 4.5 (Reasoning, High)100%100%100%100%100%100%
Claude Opus 4.6100%100%100%100%100%100%
Claude Sonnet 4.6100%100%100%100%100%100%
Claude Sonnet 4100%100%100%100%100%100%
Gemma 4 31B100%100%100%100%100%100%
Qwen3.7 Max98%90%100%100%100%100%
Claude Sonnet 598%100%100%100%90%100%
Qwen3.6 Max Preview96%90%100%100%90%100%
GPT-4.196%90%100%100%90%100%
ByteDance Seed 1.694%90%100%100%80%100%
Gemini 3.6 Flash (Reasoning)92%70%100%90%100%100%
Grok 4.5 (Reasoning, Low)92%90%100%100%70%100%
Grok 4.20 (Reasoning)92%100%100%100%60%100%
Claude Sonnet 5 (Reasoning, Low)92%80%100%100%80%100%
1–15 of 161
Page 1 / 11

Simple

Simple (1-shot)

Simple (5-shot)

Few-shot Rule Following

Multiple speakers

Unattributed dialogue