Vendors

Model creators/vendors and how their models compare across the benchmark.

Vendor Models Avg Score Best Score ▼Best Model
Anthropic2190.66%96.43%Claude Opus 5.5 (Reasoning)
Qwen2088.01%96.21%Qwen 3.8 Max (Reasoning, XHigh)
Google2685.74%95.72%Gemini 3.8 Flash (Reasoning, Medium)
Z.AI1289.29%95.20%Z.AI GLM 5.3 (Reasoning, Max)
OpenAI3886.39%95.15%GPT-5.6 Sol (Reasoning, Medium)
tencent194.80%94.80%Hy4 Preview (Reasoning, High)
meta592.57%94.71%Muse Spark 1.2 (Reasoning, Medium)
DeepSeek1285.43%94.30%DeepSeek V4.1 Flash (Reasoning, High)
xAI888.94%94.12%Grok 4.5 (Reasoning, High)
MoonshotAI492.12%92.99% Kimi K3 (Reasoning, High)
aion-labs588.68%92.36%Aion 3.5 Mini (Reasoning, High)
xiaomi487.20%91.50%Xiaomi MIMO v2.6 Pro
thinkingmachines384.04%90.78%Thinking Machines Inkling (Reasoning)
minimax387.80%90.45%MiniMax M3
bytedance-seed482.62%89.59%ByteDance Seed 1.6
Mistral AI1373.20%85.32%Mistral Medium 3.5 (Reasoning)
inception181.99%81.99%Inception Mercury 2
NVIDIA278.10%81.69%Nemotron 3 Super
Nous Research275.27%80.80%Hermes 3 405B
poolside277.70%79.99%Laguna S 2.1
Writer178.11%78.11%Writer: Palmyra X5
Meta177.41%77.41%Llama 3.1 70B
TheDrummer172.68%72.68%Cydonia 24B V4.1
Microsoft171.45%71.45%WizardLM 2 8x22b
arcee-ai167.68%67.68%Arcee AI: Trinity Mini
Cohere167.04%67.04%Cohere Command R+ (Aug. 2024)