BenchLeader

GPQA Diamond

Graduate-level science questions written to be Google-proof. Run by Epoch AI.

Published by
Epoch AI Benchmarking Hub
Category
Reasoning
Index weight
1.0
Models
272
Data as of
9 Sept 2026

CC BY 4.0 — Epoch AI, ‘AI Benchmarking Hub’, epoch.ai/benchmarks. Mirrored boards credit their original publishers.

272 of 272
#
1GPT-6 AstraOpenAI95.8%70.6
2Gemini 3.8 FlashGoogle95.4%60.1
3Gemini 3.7 FlashGoogle94.8%60.8
4GPT-5.4 ProOpenAI94.6%61.1
5Gemini 3.1 ProGoogle94.4%60.7
6Gemini 3.6 FlashGoogle94.1%58.6
7Gemini 3.1 ProGoogle94.1%63.9
8Grok 4.6xAI94.0%58.7
9GPT-5.5OpenAI94.0%
10GPT-5.5 ProOpenAI93.9%
11Claude Opus 5Anthropic93.9%66.8
12GPT-5.6 SolOpenAI93.5%65.5
13Grok 4.5xAI93.4%54.2
14GPT-5.6 TerraOpenAI93.3%58.0
15GPT-5.4OpenAI93.3%61.3
16Grok 4.6xAI93.2%62.3
17Kimi K3Moonshot AIopen93.1%62.7
18Claude Opus 5Anthropic92.9%70.0
19Gemini 3.5 FlashGoogle92.8%60.4
20Qwen3 8Alibaba92.7%58.0
21Gemini 3 ProGoogle92.6%61.6
22Kimi K3Moonshot AIopen91.9%
23GLM-5.2Zhipu AIopen91.9%57.6
24DeepSeek V4 ProDeepSeekopen91.7%max, 081356.1
25GPT-5.6 LunaOpenAI91.6%56.5
26GPT-5.2OpenAI91.4%57.3
27Claude Opus 4.8Anthropic91.0%59.4
28DeepSeek V4 FlashDeepSeekopen91.0%max, 073154.7
29Deepseek v4 ProDeepSeek90.9%60.3
30GLM-5.3Zhipu AIopen90.9%59.9
31Qwen3 7Alibaba90.9%58.9
32MiniMax-M3MiniMaxopen90.9%MiniMax-M356.9
33Kimi K2.6Moonshot AIopen90.8%kimi-k2.660.6
34GPT-5.5OpenAI90.7%62.3
35Claude Opus 4.6Anthropic90.5%63.1
36Claude Sonnet 5Anthropic90.5%57.3
37Claude Opus 4.7Anthropic90.2%57.2
38GLM-5.3-FlashZhipu AIopen90.2%55.6
39GPT-5.6 SolOpenAI89.9%64.6
40GLM-5.1Zhipu AIopen89.9%glm-5.160.1
41GPT-5.4OpenAI89.9%58.8
42Muse SparkMeta89.8%65.4
43Gemini 3 FlashGoogle89.4%58.5
44Grok 4.20xAI89.3%54.3
45GPT-5.4OpenAI88.9%56.0
46Gemini 3.5 FlashGoogle88.9%
47Grok 4.3xAI88.8%50.1
48Inkling-SmallThinking Machinesopen88.5%48.5
49Qwen3.6 PlusAlibabaopen88.4%59.0
50Claude Opus 4.6Anthropic88.4%54.1
51Claude Opus 4.8Anthropic88.4%
52GPT-5.2OpenAI88.2%55.5
53Claude Opus 5Anthropic87.9%61.7
54Qwen3.7 PlusAlibaba87.9%59.7
55GPT-5.2OpenAI87.9%58.5
56Kimi K2.7 CodeMoonshot AIopen87.9%56.2
57GLM-5.2Zhipu AIopen87.9%
58GLM-5Zhipu AIopen87.8%glm-559.0
59GPT-5.1OpenAI87.6%53.8
60Kimi K2.5Moonshot AIopen87.6%fireworks/kimi-k2p556.1