OpenAI

Comparing 38 models from OpenAI.

Model Total ▼ Released Context CoTTooling Creative Writing Language Utility Reasoning Text Editing Rule Following Hallucination
GPT-5.6 Sol (Reasoning, Medium)95.15%Jul 9, 261m✓100.00%91.03%99.93%97.51%96.86%98.26%85.88%91.72%
GPT-6 Luna (Reasoning, High)93.95%Sep 22, 261m✓100.00%90.86%99.78%92.68%94.22%97.19%80.63%96.23%
GPT-5.4 (Reasoning)93.85%Mar 5, 261m✓100.00%91.17%94.90%96.89%94.89%98.42%79.29%95.22%
GPT-5.5 (Reasoning, Medium)93.72%Apr 24, 261m✓100.00%90.26%99.69%96.60%92.87%98.79%79.40%92.12%
GPT-6 Sol (Reasoning, Medium)92.63%Sep 22, 261m✓99.95%91.40%100.00%91.07%96.65%98.37%69.71%93.91%
GPT-5.5 (Reasoning, Low)92.51%Apr 24, 261m✓98.50%90.24%99.24%96.36%88.87%98.59%76.90%91.37%
GPT-5.6 Terra (Reasoning, Medium)92.49%Jul 9, 261m✓99.31%90.72%97.22%95.58%91.03%98.11%72.99%94.98%
GPT-6 Luna (Reasoning, Medium)92.40%Sep 22, 261m✓99.99%90.20%99.78%91.17%90.50%97.87%73.20%96.53%
GPT-591.48%Aug 7, 25400k✓98.67%86.87%91.50%93.53%89.34%98.90%77.13%95.92%
GPT-5 Mini91.31%Aug 7, 25400k✓99.99%80.48%96.49%98.39%83.31%97.13%76.44%98.28%
GPT-5.4 (Reasoning, Low)90.91%Mar 5, 261m✓99.97%90.51%90.79%95.32%86.99%98.01%70.02%95.71%
GPT-5.6 Sol90.76%Jul 9, 261m–100.00%91.04%94.60%80.44%91.25%98.43%74.47%95.87%
GPT-5.190.73%Nov 13, 25400k✓98.33%87.20%93.64%95.33%82.57%98.54%74.05%96.22%
GPT-5.6 Luna (Reasoning, Medium)90.61%Jul 9, 261m✓99.97%90.10%96.67%92.18%84.74%97.77%64.83%98.65%
GPT-6 Sol90.05%Sep 22, 261m–99.95%91.22%100.00%81.18%92.95%98.56%67.23%89.32%
GPT-5.4 Mini (Reasoning)89.82%Mar 17, 26400k✓100.00%88.66%98.12%94.44%86.10%95.78%57.38%98.11%
GPT-5.289.45%Dec 10, 25400k–100.00%80.36%91.19%96.22%85.61%97.54%67.10%97.55%
GPT-5.589.37%Apr 24, 261m–100.00%90.39%94.15%81.88%87.68%98.20%72.34%90.28%
o4 Mini High88.78%Apr 16, 25200k✓100.00%82.72%79.76%98.67%82.51%94.36%72.70%99.53%
GPT-5.6 Terra88.23%Jul 9, 261m–99.33%90.92%91.87%77.09%84.98%98.21%72.82%90.63%
GPT-4.186.82%Apr 14, 251m–97.71%81.24%93.91%90.57%74.40%94.40%66.78%95.60%
o4 Mini86.56%Apr 16, 25200k✓100.00%82.04%80.00%96.31%80.39%90.61%64.61%98.54%
GPT-5.6 Luna85.06%Jul 9, 261m–99.90%89.69%99.33%75.00%72.88%95.60%54.70%93.37%
GPT-OSS 120B84.81%Aug 5, 25131k✓100.00%67.85%97.18%92.03%77.00%91.73%55.03%97.63%
GPT-5.484.31%Mar 5, 261m–98.04%90.94%81.49%81.95%80.92%96.73%58.11%86.32%
GPT-6 Luna83.73%Sep 22, 261m–99.33%90.37%92.49%69.00%76.94%97.46%51.69%92.57%
GPT-5.4 Mini (Reasoning, Low)83.57%Mar 17, 26400k✓100.00%87.72%92.45%88.49%74.50%92.63%33.99%98.78%
GPT-4o, Aug. 6th (temp=0)82.18%Aug 6, 24128k–99.96%73.65%75.00%82.11%75.40%93.77%74.19%83.33%
GPT-4.1 Mini81.40%Apr 14, 251m–96.94%74.52%89.64%82.30%67.35%95.62%58.59%86.23%
GPT-4o, Aug. 6th (temp=1)81.28%Aug 6, 24128k–98.86%75.50%82.21%82.44%70.58%86.72%67.91%86.00%
GPT-5.4 Mini80.45%Mar 17, 26400k–98.55%88.10%88.75%79.37%70.07%90.60%46.32%81.85%
GPT-5 Nano80.16%Aug 7, 25400k✓99.34%67.04%77.18%93.91%70.50%82.74%57.57%92.99%
GPT-5.4 Nano (Reasoning)80.02%Mar 17, 26400k✓96.43%80.97%83.99%93.34%77.96%83.32%27.15%96.98%
GPT-4o Mini (temp=1)77.82%Jul 18, 24128k–98.71%74.37%77.50%82.16%62.26%85.78%56.50%85.28%
GPT-5.4 Nano (Reasoning, Low)77.46%Mar 17, 26400k✓91.46%80.93%81.87%91.42%64.43%82.23%31.65%95.71%
GPT-4o Mini (temp=0)76.86%Jul 18, 24128k–97.45%73.10%75.00%81.43%62.17%84.62%58.84%82.23%
GPT-5.4 Nano72.16%Mar 17, 26400k–91.85%80.50%80.82%78.57%58.53%79.22%20.94%86.86%
GPT-4.1 Nano69.90%Apr 14, 251m–78.47%71.81%78.95%68.45%54.55%76.06%40.88%90.07%
Model Performance
Cost vs Performance

Compares total benchmark cost against overall score for OpenAI models. Quadrant lines are drawn at the median values.

Cost Breakdown

Total benchmark cost per model, broken down by input, reasoning, and output tokens. Toggle between USD and token views.