BenchLeader

Humanity's Last Exam

2,500 expert-written questions across 100+ subjects (Scale AI / CAIS).

Published by
Scale AI / CAISdata via Epoch AI Benchmarking Hub
Category
Reasoning
Index weight
1.0
Models
44
Data as of
9 Sept 2026

CC BY 4.0 — Epoch AI, ‘AI Benchmarking Hub’, epoch.ai/benchmarks. Mirrored boards credit their original publishers.

44 of 44
#
1Claude Fable 5.1Anthropic46.5%70.3
2Gemini 3.1 ProGoogle46.4%63.9
3GPT-5.4 ProOpenAI44.3%64.2
4Muse SparkMeta40.6%65.4
5Gemini 3 ProGoogle37.5%61.6
6GPT-5.4OpenAI36.2%61.3
7Claude Opus 4.7Anthropic36.2%Claude Opus 4.765.5
8Claude Opus 4.6Anthropic34.4%54.1
9GPT-5 ProOpenAI31.6%60.7
10GPT-5.2OpenAI27.8%61.5
11GPT-5OpenAI25.3%59.5
12GPT-5OpenAI25.3%54.5
13Claude Opus 4.5Anthropic25.2%58.0
14Kimi K2.5Moonshot AIopen24.4%kimi-k2.556.1
15GPT-5.1OpenAI23.7%59.4
16Gemini 2.5 ProGoogle21.6%54.1
17o3OpenAI20.3%52.9
18GPT-5 miniOpenAI19.4%55.8
19o3OpenAI19.2%53.6
20Claude Opus 4.6Anthropic19.0%63.1
21o4-miniOpenAI18.1%48.0
22o4-miniOpenAI14.3%52.4
23Claude Sonnet 4.5Anthropic13.7%52.3
24Gemini 2.5 FlashGoogle12.1%48.8
25Claude Opus 4.1Anthropic11.5%52.6
26Claude Opus 4Anthropic10.7%50.7
27Gemini 3.1 Flash LiteGoogle8.6%54.3
28GLM-4.5Zhipu AIopen8.3%glm-4p550.2
29GLM-4.5-AirZhipu AIopen8.1%46.0
30o1-proOpenAI8.1%
31Claude 3.7 SonnetAnthropic8.0%49.8
32o1OpenAI8.0%53.2
33Claude Sonnet 4Anthropic7.8%49.5
34GPT-5.1OpenAI6.8%46.6
35Gemini 2.0 FlashGoogle6.6%45.1
36Llama 4 MaverickMetaopen5.7%Llama 4 Maverick42.6
37GPT-4.5OpenAI5.4%49.6
38GPT-4.1OpenAI5.4%47.3
39Gemini 1.5 Pro 002Google4.6%42.8
40Mistral Medium (latest)Mistral AI4.5%medium, 250545.8
41Nova ProAmazon4.4%41.0
42Claude 3.5 SonnetAnthropic4.1%Claude 3.5 Sonnet (October 2024)45.1
43Amazon Nova LiteAmazon3.6%39.4
44GPT-4oOpenAI2.7%42.3