BenchLeader

SimpleBench

Trick questions where humans score ~84%: spatio-temporal reasoning and social intelligence.

Published by
SimpleBenchdata via Epoch AI Benchmarking Hub
Category
Reasoning
Index weight
1.0
Models
85
Data as of
9 Sept 2026

CC BY 4.0 — Epoch AI, ‘AI Benchmarking Hub’, epoch.ai/benchmarks. Mirrored boards credit their original publishers.

85 of 85
#
1Claude Fable 5Anthropic81.9%65.8
2Claude Opus 5Anthropic80.6%70.0
3Gemini 3.1 ProGoogle79.6%63.9
4GPT-5.5 ProOpenAI76.9%
5GPT-5.5 ProOpenAI76.9%
6Gemini 3.5 FlashGoogle76.7%60.7
7Gemini 3 ProGoogle76.4%61.6
8Grok 4.6xAI75.9%grok-4.6_unknown63.6
9Muse Spark 1.2Meta74.5%62.6
10GPT-5.4 ProOpenAI74.1%64.2
11GPT-5.6 SolOpenAI71.7%
12GPT-5.6 SolOpenAI71.7%
13Qwen3 7Alibaba70.4%58.9
14Grok 4.5xAI70.0%grok-4.5_unknown63.4
15GPT-5.5OpenAI69.0%gpt-5.5_unknown66.6
16Claude Opus 4.6Anthropic67.6%63.1
17GPT-5.6 SolOpenAI64.8%67.5
18GPT-5.6 SolOpenAI64.8%65.3
19Claude Opus 4.8Anthropic64.8%64.7
20Qwen3 6Alibaba63.0%59.5
21Gemini 2.5 ProGoogle62.4%54.1
22Claude Opus 4.5Anthropic62.0%58.0
23Claude Opus 4.7Anthropic61.7%65.5
24GPT-5 ProOpenAI61.6%60.7
25GPT-5 ProOpenAI61.6%
26DeepSeek V4 FlashDeepSeekopen61.1%073159.1
27Gemini 3 FlashGoogle61.1%56.6
28Kimi K3Moonshot AIopen60.7%62.7
29Claude Sonnet 5Anthropic60.6%61.2
30Grok 4xAI60.5%070957.2
31Claude Opus 4.1Anthropic60.0%52.6
32GLM-5.2Zhipu AIopen58.8%glm-5.2_unknown57.4
33Claude Opus 4Anthropic58.8%50.7
34Kimi K2.7 CodeMoonshot AIopen57.9%56.2
35GPT-5.2 ProOpenAI57.4%
36GPT-5OpenAI56.7%54.5
37Grok 4.1xAI56.0%55.9
38Grok 4.1xAI56.0%47.9
39GLM-5.1Zhipu AIopen55.1%glm-5.160.1
40Claude Sonnet 4.5Anthropic54.3%52.3
41GLM-5Zhipu AIopen53.2%glm-559.0
42GPT-5.1OpenAI53.2%53.8
43o3OpenAI53.1%52.9
44DeepSeek V3.2DeepSeekopen52.6%54.7
45GPT-5.6 TerraOpenAI48.9%64.2
46GPT-5.6 TerraOpenAI48.9%62.3
47GLM-4.7Zhipu AIopen47.7%54.9
48GPT-5.6 LunaOpenAI46.8%59.3
49GPT-5.6 LunaOpenAI46.8%56.6
50Kimi K2.5Moonshot AIopen46.8%kimi-k2.556.1
51Claude 3.7 SonnetAnthropic46.4%49.8
52GPT-5.2OpenAI45.8%61.5
53MiniMax-M3MiniMaxopen45.8%MiniMax-M356.9
54GPT-5.2OpenAI45.8%55.5
55Claude Sonnet 4Anthropic45.5%49.5
56o1OpenAI41.7%53.2
57Claude 3.5 SonnetAnthropic41.4%45.1
58Gemini 2.5 FlashGoogle41.2%48.8
59DeepSeek R1DeepSeekopen40.8%052848.9
60o1OpenAI40.1%44.3