BenchLeader

AIME 2026

AIME I and II 2026, evaluated on release by MathArena.

Published by
MathArena
Category
Maths
Index weight
1.0
Models
31
Data as of
9 Sept 2026

MIT — eth-sri/matharena.

31 of 31
#
1GPT-5.5OpenAI100.0%63.7
2Claude Opus 4.8Anthropic100.0%59.4
3GPT-5.4OpenAI99.2%61.3
4Gemini 3.1 ProGoogle98.3%63.9
5GPT-5.2OpenAI98.3%55.5
6Claude Opus 4.6Anthropic96.7%61.3
7Gemini 3.6 FlashGoogle96.7%Gemini 3.6 Flash60.7
8GLM-5Zhipu AIopen96.7%GLM 559.0
9Gemini 3 FlashGoogle96.7%Gemini 3 Flash56.6
10DeepSeek V4 ProDeepSeekopen96.7%56.1
11Step 3.5 FlashStepFunopen96.7%Step 3.5 Flash54.9
12Kimi K3Moonshot AIopen96.7%
13GLM-5.1Zhipu AIopen95.8%GLM 5.160.1
14Claude Opus 4.7Anthropic95.8%57.2
15Kimi K2.5Moonshot AIopen95.8%55.3
16DeepSeek V4 FlashDeepSeekopen95.8%54.7
17Kimi K2.6Moonshot AIopen95.8%
18Gemini 3.5 FlashGoogle95.0%Gemini 3.5 Flash60.7
19Step 3.7 FlashStepFunopen95.0%Step 3.7 Flash54.6
20Qwen3.5 397B-A17BAlibabaopen94.2%58.6
21Grok 4.1xAI94.2%55.9
22Qwen3.5 35B-A3BAlibabaopen93.3%53.4
23Qwen3.5-9BAlibabaopen92.5%47.5
24Gemini 3 ProGoogle91.7%61.6
25Qwen3.5 27BAlibabaopen91.7%55.4
26Nemotron 3 SuperNVIDIA91.7%44.9
27GLM-5.2Zhipu AIopen90.0%GLM 5.257.4
28Qwen3.5-4BAlibaba89.7%47.1
29Qwen3 30B A3BAlibabaopen88.3%45.1
30qwen3-4b-instruct-2507Alibabaopen82.5%thinking, 250740.1
31Qed NanoLM-Provers82.5%