BenchmarksLiveAInews
NEW MODELGPT-6 AstraThe briefingGo Pro
THE MODEL SCOREBOARD

Big claims.
Measured results.

See how AI models perform on the tests behind the headlines. Explore the scores, compare like for like, and follow the evidence.

Automatic source updates· Hourly checks while in use
267models
59benchmarks
2,842results

Open data from Epoch AI

EXPLORE THE EVIDENCE

Choose a benchmark.

Retrieved 2026-09-07 18:18 UTC

GPQA diamond

178 matching results · higher is better

Adjusted scores on a 0–100 scale, not raw accuracy percentages. Epoch rescales some tests for chance performance or known errors. Compare within the same benchmark. Model release dates are not test dates.

“Reported in” identifies the report containing the result; it can compare models from other companies. Effort is shown only when specified in the dataset.

ModelAdjusted scoreModel releasedReported in
GPT-6 AstraEffort: Max94.4/100Epoch AI datasetOriginal report not specified
GLM-5.3-FlashEffort: Max86.9/100Epoch AI datasetOriginal report not specified
GLM-5.3Effort: Max87.9/100Epoch AI datasetOriginal report not specified
Gemini 3.7 FlashEffort: High93.1/100Epoch AI datasetOriginal report not specified
DeepSeek V4 Pro 0813Effort: Max88.9/100Epoch AI datasetOriginal report not specified
Grok 4.6Effort: Extra high92.0/100Epoch AI datasetOriginal report not specified
Qwen 3.8 MaxEffort: Extra high90.2/100Epoch AI datasetOriginal report not specified
DeepSeek V4 Flash 0731Effort: Max88.0/100Epoch AI datasetOriginal report not specified
Qwen3.7 FlashEffort unknown76.4/100Epoch AI datasetOriginal report not specified
Claude Opus 5Effort unknown91.8/100Epoch AI datasetOriginal report not specified
Gemini 3.6 FlashEffort: Minimal92.2/100Epoch AI datasetOriginal report not specified
Gemini 3.5 Flash-LiteEffort: Low77.8/100Epoch AI datasetOriginal report not specified
Kimi K3Effort: Low90.8/100Epoch AI datasetOriginal report not specified
Inkling-SmallEffort: Extra high84.7/100Epoch AI datasetOriginal report not specified
InklingEffort: Extra high84.3/100Epoch AI datasetOriginal report not specified
GPT-5.6 SolEffort: None91.3/100Epoch AI datasetOriginal report not specified
GPT-5.6 TerraEffort: None91.1/100Epoch AI datasetOriginal report not specified
GPT-5.6 LunaEffort: None88.8/100Epoch AI datasetOriginal report not specified
Grok 4.5Effort: High91.2/100Epoch AI datasetOriginal report not specified
Claude Sonnet 5Effort: Max87.4/100Epoch AI datasetOriginal report not specified
GLM-5.2Effort: None89.1/100Epoch AI datasetOriginal report not specified
Kimi K2.7 CodeEffort unknown83.8/100Epoch AI datasetOriginal report not specified
Claude Fable 5Effort: Max81.1/100Epoch AI datasetOriginal report not specified
Nemotron 3 UltraEffort unknown80.5/100Epoch AI datasetOriginal report not specified
Qwen3.7-PlusEffort unknown83.8/100Epoch AI datasetOriginal report not specified
MiniMax-M3Effort: None87.9/100Epoch AI datasetOriginal report not specified
Claude Opus 4.8Effort: None88.0/100Epoch AI datasetOriginal report not specified
Gemini 3.5 FlashEffort: Low90.4/100Epoch AI datasetOriginal report not specified
Qwen3.7-MaxEffort unknown87.9/100Epoch AI datasetOriginal report not specified
GPT-5.5 InstantEffort unknown76.7/100Epoch AI datasetOriginal report not specified
Qwen 3.6 FlashEffort unknown77.8/100Epoch AI datasetOriginal report not specified
DeepSeek-V4-ProEffort: None87.9/100Epoch AI datasetOriginal report not specified
GPT-5.5Effort: None92.0/100Epoch AI datasetOriginal report not specified
GPT-5.5 ProEffort: Extra high91.9/100Epoch AI datasetOriginal report not specified
Qwen3.6 27BEffort unknown81.1/100Epoch AI datasetOriginal report not specified
Kimi K2.6Effort unknown87.7/100Epoch AI datasetOriginal report not specified
Qwen 3.6 Max (Preview)Effort unknown83.2/100Epoch AI datasetOriginal report not specified
Grok 4.3 BetaEffort: High85.1/100Epoch AI datasetOriginal report not specified
Claude Opus 4.7Effort: Max86.9/100Epoch AI datasetOriginal report not specified
Qwen 3.6 35B-A3BEffort unknown79.8/100Epoch AI datasetOriginal report not specified
Muse SparkEffort unknown86.4/100Epoch AI datasetOriginal report not specified
GLM-5.1Effort unknown86.5/100Epoch AI datasetOriginal report not specified
Gemma 4 31B ITEffort: Minimal67.7/100Epoch AI datasetOriginal report not specified
Gemma 4 26B A4BEffort: Minimal64.3/100Epoch AI datasetOriginal report not specified
Qwen 3.6 PlusEffort unknown84.5/100Epoch AI datasetOriginal report not specified
GPT-5.4 MiniEffort: Extra high82.5/100Epoch AI datasetOriginal report not specified
GPT-5.4 NanoEffort: None71.3/100Epoch AI datasetOriginal report not specified
GPT-5.4 ProEffort: Extra high92.8/100Epoch AI datasetOriginal report not specified
GPT-5.4Effort: Medium91.1/100Epoch AI datasetOriginal report not specified
Gemini 3.1 Flash-LiteEffort: Minimal75.8/100Epoch AI datasetOriginal report not specified