Tool usage within Novelcrafter

Output messages that are related to tool usage within Novelcrafter

Price-Performance Score Distribution (Top 20)

Click a model name to view its detail page.

ScoreCostTime
Ministral 3B80%$0.00002.1s
Gemini 2.5 Flash Lite100%$0.00021.5s
Inception Mercury 297%$0.00041.1s
Mistral NeMO97%$0.00013.2s
Ministral 8B80%$0.00016.9s
Ministral 3 3B90%$0.00013.6s
Mistral Small 3.2 24B100%$0.00014.9s
GPT-4.1 Nano90%$0.00014.0s
Gemini 3.1 Flash Lite (Preview)100%$0.00082.6s
Gemini 3.1 Flash Lite (Reasoning)100%$0.00075.1s
Gemini 3.1 Flash Lite100%$0.00075.6s
Laguna S 2.1100%$0.00017.3s
Gemini 2.5 Flash100%$0.00102.4s
GPT-4.1 Mini97%$0.00064.3s
GPT-4o Mini (temp=0)100%$0.00035.5s
Arcee AI: Trinity Mini97%$0.00026.4s
Gemini 3.5 Flash Lite (Reasoning)100%$0.00122.3s
GPT-4o Mini (temp=1)100%$0.00038.0s
Gemini 3.5 Flash Lite (Reasoning, Minimal)100%$0.00122.3s
Ministral 3 8B100%$0.00026.6s
0.700.800.901.00

Cost vs Performance

Compares total cost for this test against the test score. Quadrant lines are drawn at the median values. Only models with available cost data are shown.

47 low-scoring outliers hidden: Z.AI GLM 5.2 (Reasoning, High) (96.7%), Muse Spark 1.1 (Reasoning, Minimal) (96.7%), GPT-5.1 (96.7%), ByteDance Seed 1.6 (96.7%), Qwen 3.6 27B (96.7%), MiniMax M2.5 (96.7%), Gemini 3 Flash (Preview) (96.7%), GPT-5.4 (96.7%), Qwen 3.5 9B (96.7%), Inception Mercury 2 (96.7%), GPT-4.1 Mini (96.7%), Qwen 3 32B (96.7%), Mistral Medium 3.1 (96.7%), WizardLM 2 8x22b (96.7%), Arcee AI: Trinity Mini (96.7%), Mistral NeMO (96.7%), Qwen 3.5 Plus (2026-04-20) (93.3%), Gemma 4 26B (93.3%), DeepSeek V4 Flash (93.3%), Mistral Small 4 (93.3%), DeepSeek V4 Flash (Reasoning) (93.3%), Z.AI GLM 5 Turbo (90.0%), Qwen 3.8 27B (Reasoning, XHigh) (90.0%), Muse Glimmer 30B (Reasoning, Medium) (90.0%), Qwen 3.5 35B (90.0%), Z.AI GLM 4.7 Flash (90.0%), Nemotron 3 Super (90.0%), Grok 4.20 (90.0%), DeepSeek V3 (2025-03-24) (90.0%), Grok 4.3 (90.0%), Ministral 3 14B (90.0%), GPT-4.1 Nano (90.0%), Cohere Command R+ (Aug. 2024) (90.0%), Ministral 3 3B (90.0%), Llama 3.1 70B (86.7%), Cydonia 24B V4.1 (86.7%), Aion 3.0 Mini (83.3%), Laguna XS 2.1 (83.3%), Qwen 3.8 Flash (Reasoning) (80.0%), Qwen 3.7 Flash (Reasoning) (80.0%), Qwen 3.5 Flash (80.0%), Ministral 8B (80.0%), Ministral 3B (80.0%), Nemotron 3 Nano (73.3%), Qwen 3.6 35B (66.7%), Thinking Machines Inkling (16.7%), ByteDance Seed 1.6 Flash (0.0%).

Most Stable Models (Top 20)

Ranked by stability (median × consistency). Click a model name to view its detail page.

ScoreConsistencyStability
Claude Opus 5.5 (Reasoning)100%100%100%
Qwen 3.8 Max (Reasoning, XHigh)100%100%100%
Gemini 3.8 Flash (Reasoning, Medium)100%100%100%
Z.AI GLM 5.3 (Reasoning, Max)100%100%100%
GPT-5.6 Sol (Reasoning, Medium)100%100%100%
Claude Opus 4.6 (Reasoning)100%100%100%
Gemini 3.6 Flash (Reasoning)100%100%100%
Gemini 3.7 Flash (Reasoning, Medium)100%100%100%
Hy4 Preview (Reasoning, High)100%100%100%
Muse Spark 1.2 (Reasoning, Medium)100%100%100%
Qwen 3.7 Max100%100%100%
DeepSeek V4.1 Flash (Reasoning, High)100%100%100%
Z.AI GLM 5.3 Flash (Reasoning, Max)100%100%100%
Grok 4.5 (Reasoning, High)100%100%100%
Gemini 3.1 Pro (Preview)100%100%100%
Muse Spark 1.3 (Reasoning, Medium)100%100%100%
GPT-6 Luna (Reasoning, High)100%100%100%
GPT-5.4 (Reasoning)100%100%100%
Muse Spark 1.1 (Reasoning, Medium)100%100%100%
Z.AI GLM 5.1100%100%100%
100%

Top Overall Models (Top 20)

Ranked by composite score (performance, cost, speed & stability). Click a model name to view its detail page.

ScoreCostSpeedStability
Gemini 2.5 Flash Lite100%$0.00021.5s100%
Gemini 3.1 Flash Lite (Preview)100%$0.00082.6s100%
Gemini 2.5 Flash100%$0.00102.4s100%
Gemini 3.5 Flash Lite (Reasoning)100%$0.00122.3s100%
Gemini 3.5 Flash Lite (Reasoning, Minimal)100%$0.00122.3s100%
Mistral Small 3.2 24B100%$0.00014.9s100%
GPT-4o Mini (temp=0)100%$0.00035.5s100%
Gemini 3.1 Flash Lite (Reasoning)100%$0.00075.1s100%
Ministral 3 8B100%$0.00026.6s100%
Gemini 3.1 Flash Lite100%$0.00075.6s100%
Gemini 2.5 Flash (Reasoning)100%$0.00173.7s100%
GPT-6 Luna100%$0.00036.7s100%
DeepSeek V4.1 Flash (Reasoning, High)100%$0.00056.2s100%
Gemini 2.5 Flash Lite (Reasoning)100%$0.00076.0s100%
Laguna S 2.1100%$0.00017.3s100%
GPT-6 Luna (Reasoning, High)100%$0.00036.9s100%
GPT-5.4 Nano100%$0.00145.1s100%
GPT-5.4 Mini100%$0.00243.2s100%
GPT-6 Luna (Reasoning, Medium)100%$0.00037.4s100%
GPT-5.4 Nano (Reasoning)100%$0.00135.5s100%
100%

Create alternate prose sections