Voice/dialogue sheets

Extract dialogue from given text as voice sheets.

Price-Performance Score Distribution (Top 20)

Click a model name to view its detail page.

ScoreCostTime
DeepSeek V4 Flash62%$0.00013.7s
Mistral Small 3.2 24B72%$0.00012.1s
Gemini 2.5 Flash Lite66%$0.0001610ms
Z.AI GLM 5.3 Flash (Reasoning, Low)76%$0.00003.6s
Mistral Small 460%$0.00011.3s
GPT-4o Mini (temp=0)60%$0.00013.7s
Gemma 4 26B88%$0.00014.5s
Qwen 3 235B A22B Instruct 250772%$0.00014.9s
GPT-6 Luna (Reasoning, Medium)70%$0.00013.8s
DeepSeek-V2 Chat80%$0.00018.2s
Gemma 3 12B52%$0.00004.1s
Gemma 4 31B100%$0.00018.3s
GPT-6 Luna (Reasoning, High)70%$0.00014.3s
DeepSeek V4 Flash (Reasoning)78%$0.000220.6s
Hermes 3 405B58%$0.000013.3s
Z.AI GLM 4.576%$0.00045.3s
Gemini 3.1 Flash Lite (Reasoning)78%$0.00031.4s
Gemini 3.1 Flash Lite (Preview)70%$0.0003979ms
DeepSeek V3 (2025-03-24)84%$0.00036.1s
ByteDance Seed 1.6 Flash66%$0.00024.5s
0.600.700.800.901.00

Cost vs Performance

Compares total cost for this test against the test score. Quadrant lines are drawn at the median values. Only models with available cost data are shown.

4 low-scoring outliers hidden: Ministral 3B (10.0%), Arcee AI: Trinity Mini (8.0%), Ministral 8B (8.0%), Ministral 3 3B (0.0%).

Most Stable Models (Top 20)

Ranked by stability (median × consistency). Click a model name to view its detail page.

ScoreConsistencyStability
Claude Opus 4.6 (Reasoning)100%100%100%
Grok 4.5 (Reasoning, High)100%100%100%
Claude Opus 4.6100%100%100%
Claude Sonnet 4.6100%100%100%
Claude Sonnet 4100%100%100%
Gemma 4 31B100%100%100%
Qwen 3.7 Max98%72%72%
Claude Sonnet 598%72%72%
Qwen 3.6 Max Preview96%61%61%
GPT-4.196%61%61%
Claude Opus 5.5 (Reasoning)94%53%53%
Qwen 3.8 Max (Reasoning, XHigh)94%53%53%
ByteDance Seed 1.694%53%53%
Thinking Machines Inkling92%46%46%
Grok 4.6 (Reasoning, High)92%46%46%
Claude Sonnet 5 (Reasoning, Low)92%46%46%
Gemma 4 31B (Reasoning)92%46%46%
Gemini 3.6 Flash (Reasoning)92%46%46%
Grok 4.5 (Reasoning, Low)92%46%46%
Grok 4.20 (Reasoning)92%46%46%
0%10%20%30%40%50%60%70%80%90%100%

Top Overall Models (Top 20)

Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.

ScoreCostSpeedStability
Gemma 4 31B100%$0.00018.3s100%
Claude Sonnet 4.6100%$0.00331.9s100%
Claude Sonnet 4100%$0.00332.8s100%
Claude Opus 4.6100%$0.00553.9s100%
Grok 4.5 (Reasoning, High)100%$0.00499.0s100%
Claude Opus 4.6 (Reasoning)100%$0.00603.1s100%
Claude Sonnet 598%$0.00324.2s72%
GPT-4.196%$0.00172.6s61%
Thinking Machines Inkling92%$0.00085.2s46%
ByteDance Seed 1.694%$0.001314.2s53%
GPT-4o, Aug. 6th (temp=0)92%$0.00222.4s46%
Gemini 2.5 Flash88%$0.0005933ms35%
Gemma 4 26B88%$0.00014.5s35%
Claude Sonnet 5 (Reasoning, Low)92%$0.00375.0s46%
Qwen 3.5 Plus (2026-02-15)86%$0.00056.6s31%
Grok 4.5 (Reasoning, Low)92%$0.003410.7s46%
Grok 4.20 (Reasoning)92%$0.003512.9s46%
DeepSeek V3 (2025-03-24)84%$0.00036.1s27%
Claude Sonnet 5 (Reasoning)90%$0.00374.6s40%
Claude Haiku 4.582%$0.00111.6s23%
0%10%20%30%40%50%60%70%80%90%100%
Model Total â–¼SimpleSimple (1-shot)Simple (5-shot)Multiple speakersUnattributed dialogue
Claude Opus 4.6 (Reasoning)100%100%100%100%100%100%
Grok 4.5 (Reasoning, High)100%100%100%100%100%100%
Claude Opus 4.6100%100%100%100%100%100%
Claude Sonnet 4.6100%100%100%100%100%100%
Claude Sonnet 4100%100%100%100%100%100%
Gemma 4 31B100%100%100%100%100%100%
Qwen 3.7 Max98%90%100%100%100%100%
Claude Sonnet 598%100%100%100%90%100%
Qwen 3.6 Max Preview96%90%100%100%90%100%
GPT-4.196%90%100%100%90%100%
Claude Opus 5.5 (Reasoning)94%100%100%90%80%100%
Qwen 3.8 Max (Reasoning, XHigh)94%90%100%100%80%100%
ByteDance Seed 1.694%90%100%100%80%100%
Gemini 3.6 Flash (Reasoning)92%70%100%90%100%100%
Grok 4.6 (Reasoning, High)92%80%100%100%80%100%
1–15 of 190
Page 1 / 13

Simple

Simple (1-shot)

Simple (5-shot)

Few-shot Rule Following

Multiple speakers

Unattributed dialogue