THE MODEL SCOREBOARD
Big claims.
Measured results.
See how AI models perform on the tests behind the headlines. Explore the scores, compare like for like, and follow the evidence.
Automatic source updates· Hourly checks while in use
EXPLORE THE EVIDENCE
Choose a benchmark.
Retrieved 2026-09-07 18:18 UTC
GPQA diamond
178 matching results · higher is betterAdjusted scores on a 0–100 scale, not raw accuracy percentages. Epoch rescales some tests for chance performance or known errors. Compare within the same benchmark. Model release dates are not test dates.
“Reported in” identifies the report containing the result; it can compare models from other companies. Effort is shown only when specified in the dataset.
| Model | Adjusted score | Model released | Reported in |
|---|---|---|---|
| GPT-6 AstraEffort: Max | 94.4/100 | Epoch AI datasetOriginal report not specified | |
| GLM-5.3-FlashEffort: Max | 86.9/100 | Epoch AI datasetOriginal report not specified | |
| GLM-5.3Effort: Max | 87.9/100 | Epoch AI datasetOriginal report not specified | |
| Gemini 3.7 FlashEffort: High | 93.1/100 | Epoch AI datasetOriginal report not specified | |
| DeepSeek V4 Pro 0813Effort: Max | 88.9/100 | Epoch AI datasetOriginal report not specified | |
| Grok 4.6Effort: Extra high | 92.0/100 | Epoch AI datasetOriginal report not specified | |
| Qwen 3.8 MaxEffort: Extra high | 90.2/100 | Epoch AI datasetOriginal report not specified | |
| DeepSeek V4 Flash 0731Effort: Max | 88.0/100 | Epoch AI datasetOriginal report not specified | |
| Qwen3.7 FlashEffort unknown | 76.4/100 | Epoch AI datasetOriginal report not specified | |
| Claude Opus 5Effort unknown | 91.8/100 | Epoch AI datasetOriginal report not specified | |
| Gemini 3.6 FlashEffort: Minimal | 92.2/100 | Epoch AI datasetOriginal report not specified | |
| Gemini 3.5 Flash-LiteEffort: Low | 77.8/100 | Epoch AI datasetOriginal report not specified | |
| Kimi K3Effort: Low | 90.8/100 | Epoch AI datasetOriginal report not specified | |
| Inkling-SmallEffort: Extra high | 84.7/100 | Epoch AI datasetOriginal report not specified | |
| InklingEffort: Extra high | 84.3/100 | Epoch AI datasetOriginal report not specified | |
| GPT-5.6 SolEffort: None | 91.3/100 | Epoch AI datasetOriginal report not specified | |
| GPT-5.6 TerraEffort: None | 91.1/100 | Epoch AI datasetOriginal report not specified | |
| GPT-5.6 LunaEffort: None | 88.8/100 | Epoch AI datasetOriginal report not specified | |
| Grok 4.5Effort: High | 91.2/100 | Epoch AI datasetOriginal report not specified | |
| Claude Sonnet 5Effort: Max | 87.4/100 | Epoch AI datasetOriginal report not specified | |
| GLM-5.2Effort: None | 89.1/100 | Epoch AI datasetOriginal report not specified | |
| Kimi K2.7 CodeEffort unknown | 83.8/100 | Epoch AI datasetOriginal report not specified | |
| Claude Fable 5Effort: Max | 81.1/100 | Epoch AI datasetOriginal report not specified | |
| Nemotron 3 UltraEffort unknown | 80.5/100 | Epoch AI datasetOriginal report not specified | |
| Qwen3.7-PlusEffort unknown | 83.8/100 | Epoch AI datasetOriginal report not specified | |
| MiniMax-M3Effort: None | 87.9/100 | Epoch AI datasetOriginal report not specified | |
| Claude Opus 4.8Effort: None | 88.0/100 | Epoch AI datasetOriginal report not specified | |
| Gemini 3.5 FlashEffort: Low | 90.4/100 | Epoch AI datasetOriginal report not specified | |
| Qwen3.7-MaxEffort unknown | 87.9/100 | Epoch AI datasetOriginal report not specified | |
| GPT-5.5 InstantEffort unknown | 76.7/100 | Epoch AI datasetOriginal report not specified | |
| Qwen 3.6 FlashEffort unknown | 77.8/100 | Epoch AI datasetOriginal report not specified | |
| DeepSeek-V4-ProEffort: None | 87.9/100 | Epoch AI datasetOriginal report not specified | |
| GPT-5.5Effort: None | 92.0/100 | Epoch AI datasetOriginal report not specified | |
| GPT-5.5 ProEffort: Extra high | 91.9/100 | Epoch AI datasetOriginal report not specified | |
| Qwen3.6 27BEffort unknown | 81.1/100 | Epoch AI datasetOriginal report not specified | |
| Kimi K2.6Effort unknown | 87.7/100 | Epoch AI datasetOriginal report not specified | |
| Qwen 3.6 Max (Preview)Effort unknown | 83.2/100 | Epoch AI datasetOriginal report not specified | |
| Grok 4.3 BetaEffort: High | 85.1/100 | Epoch AI datasetOriginal report not specified | |
| Claude Opus 4.7Effort: Max | 86.9/100 | Epoch AI datasetOriginal report not specified | |
| Qwen 3.6 35B-A3BEffort unknown | 79.8/100 | Epoch AI datasetOriginal report not specified | |
| Muse SparkEffort unknown | 86.4/100 | Epoch AI datasetOriginal report not specified | |
| GLM-5.1Effort unknown | 86.5/100 | Epoch AI datasetOriginal report not specified | |
| Gemma 4 31B ITEffort: Minimal | 67.7/100 | Epoch AI datasetOriginal report not specified | |
| Gemma 4 26B A4BEffort: Minimal | 64.3/100 | Epoch AI datasetOriginal report not specified | |
| Qwen 3.6 PlusEffort unknown | 84.5/100 | Epoch AI datasetOriginal report not specified | |
| GPT-5.4 MiniEffort: Extra high | 82.5/100 | Epoch AI datasetOriginal report not specified | |
| GPT-5.4 NanoEffort: None | 71.3/100 | Epoch AI datasetOriginal report not specified | |
| GPT-5.4 ProEffort: Extra high | 92.8/100 | Epoch AI datasetOriginal report not specified | |
| GPT-5.4Effort: Medium | 91.1/100 | Epoch AI datasetOriginal report not specified | |
| Gemini 3.1 Flash-LiteEffort: Minimal | 75.8/100 | Epoch AI datasetOriginal report not specified |