BenchLeader

Humanity's Last Exam (AA)

Artificial Analysis' own HLE run. Shown for reference.

Published by
Artificial Analysis
Category
Reasoning
Index weight
Reference only
Models
524
Data as of
9 Sept 2026

Source: Artificial Analysis (artificialanalysis.ai). Data taken from the public leaderboard.

524 of 524
#
1Claude Fable 5.1Anthropic59.1%Claude Fable 5.1 (max with fallback)70.0
2Claude Fable 5.1Anthropic58.7%70.3
3Claude Fable 5.1Anthropic55.9%69.7
4Claude Fable 5Anthropic55.5%Claude Fable 5 (with fallback)70.4
5Claude Opus 5Anthropic54.9%Claude Opus 5 (max)70.0
6GPT-6 AstraOpenAI54.7%GPT-6 Astra (max)69.9
7GPT-6 AstraOpenAI54.6%68.6
8Claude Opus 5Anthropic54.4%66.3
9Claude Fable 5.1Anthropic53.8%68.0
10GPT-6 AstraOpenAI53.1%69.5
11Claude Opus 5Anthropic52.8%69.3
12GPT-6 AstraOpenAI52.7%67.4
13Claude Opus 5Anthropic51.3%63.1
14GPT-5.6 SolOpenAI49.5%GPT-5.6 Sol (max)65.3
15GPT-6 AstraOpenAI49.2%65.8
16Claude Fable 5.1Anthropic48.9%65.9
17Muse Spark 1.3Meta48.7%Muse Spark 1.3 (max)
18Claude Opus 4.8Anthropic48.7%Claude Opus 4.8 (max)64.7
19Gemini 3.7 FlashGoogle47.9%Gemini 3.7 Flash (high)61.7
20Gemini 3.8 FlashGoogle47.8%Gemini 3.8 Flash (high)62.4
21Muse Spark 1.3Meta47.5%63.9
22GPT-5.6 SolOpenAI47.3%67.5
23Gemini 3.1 ProGoogle47.0%63.9
24Kimi K3Moonshot AIopen46.9%Kimi K3 (max)66.5
25Muse Spark 1.1Meta46.2%Muse Spark 1.1 (xhigh)64.9
26GPT-5.6 SolOpenAI46.0%68.0
27GPT-5.5OpenAI45.8%GPT-5.5 (xhigh)66.6
28Muse Spark 1.2Meta45.5%Muse Spark 1.2 (xhigh)62.6
29GPT-5.5OpenAI45.0%66.3
30Grok 4.6xAI44.1%62.3
31GPT-5.4OpenAI43.7%GPT-5.4 (xhigh)63.4
32Claude Opus 5Anthropic43.4%61.7
33Qwen3 8Alibaba43.0%63.9
34Grok 4.6xAI42.9%Grok 4.6 (high)63.6
35GPT-5.6 TerraOpenAI42.9%GPT-5.6 Terra (max)62.3
36Grok 4.5xAI42.7%Grok 4.5 (high)63.4
37Gemini 3.5 FlashGoogle42.7%Gemini 3.5 Flash60.7
38GPT-5.3 CodexOpenAI42.5%GPT-5.3 Codex (xhigh)62.4
39Qwen3.8 2.4T A95BAlibabaopen42.5%
40GPT-5.5OpenAI42.4%64.9
41Claude Opus 4.7Anthropic42.3%Claude Opus 4.7 (max)65.5
42GLM-5.3Zhipu AIopen42.3%GLM-5.3 (max)
43GPT-5.6 SolOpenAI42.2%66.0
44Grok 4.6xAI42.1%63.8
45Gemini 3.8 FlashGoogle42.1%63.5
46GPT-5.6 TerraOpenAI41.9%64.2
47Gemini 3.5 FlashGoogle41.3%63.9
48Claude Sonnet 5Anthropic41.3%Claude Sonnet 5 (max)61.2
49GLM-5.2Zhipu AIopen41.1%GLM-5.2 (max)57.4
50DeepSeek V4 ProDeepSeekopen41.0%DeepSeek V4 Pro 0813 (max)59.7
51Gemini 3.6 FlashGoogle40.8%Gemini 3.6 Flash60.7
52Muse SparkMeta40.7%65.4
53Qwen3 7Alibaba40.5%58.9
54Motif 3 (Beta)Motif Technologies40.4%
55Claude Opus 4.6Anthropic39.9%63.1
56GLM-5.3-FlashZhipu AIopen39.9%61.0
57Gemini 3 ProGoogle39.7%Gemini 3 Pro Preview (high)61.6
58GPT-5.6 LunaOpenAI39.5%GPT-5.6 Luna (max)56.6
59GPT-5.6 SolOpenAI39.4%64.6
60Claude Sonnet 5Anthropic39.0%57.3