BenchLeader

MathArena Apex

The hardest problems from recent competitions. MathArena.

Published by
MathArena
Category
Maths
Index weight
0.5
Models
46
Data as of
9 Sept 2026

MIT — eth-sri/matharena.

46 of 46
#
1Claude Opus 4.8Anthropic81.3%59.4
2GPT-5.5OpenAI80.2%63.7
3GPT-5.4 ProOpenAI69.8%61.1
4Kimi K3Moonshot AIopen65.6%
5Gemini 3.1 ProGoogle60.9%63.9
6GPT-5.4OpenAI54.2%61.3
7Claude Opus 4.7Anthropic40.6%57.2
8Claude Opus 4.6Anthropic34.5%61.3
9Gemini 3.5 FlashGoogle32.3%Gemini 3.5 Flash60.7
10DeepSeek V4 ProDeepSeekopen28.1%56.1
11DeepSeek V4 FlashDeepSeekopen27.1%54.7
12Gemini 3.6 FlashGoogle26.0%Gemini 3.6 Flash60.7
13Kimi K2.6Moonshot AIopen24.0%
14Gemini 3 ProGoogle23.4%61.6
15GLM-5.2Zhipu AIopen19.8%GLM 5.257.4
16Gemini 3 FlashGoogle15.6%Gemini 3 Flash56.6
17Step 3.7 FlashStepFunopen14.6%Step 3.7 Flash54.6
18GPT-5.2OpenAI13.5%55.5
19Step 3.5 FlashStepFunopen13.5%Step 3.5 Flash54.9
20GLM-5.1Zhipu AIopen11.5%GLM 5.160.1
21GLM-5Zhipu AIopen10.9%GLM 559.0
22DeepSeek V3.2DeepSeekopen9.4%54.7
23Kimi K2.5Moonshot AIopen8.8%55.3
24Nemotron 3 SuperNVIDIA7.8%44.9
25Grok 4.1xAI5.2%55.9
26Qwen3 235B A22BAlibabaopen5.2%thinking, 250751.7
27Grok 4 Fast RxAI5.2%Grok 4 Fast R
28Qwen3.5 35B-A3BAlibabaopen4.2%53.4
29Grok 4xAI2.1%Grok 457.2
30Qwen3.5 27BAlibabaopen2.1%55.4
31qwen3-4b-instruct-2507Alibabaopen2.1%thinking, 250740.1
32GPT 5 AgentOpenAI2.1%
33Claude Sonnet 4.5Anthropic1.6%52.8
34Qed NanoLM-Provers1.6%
35GPT-5OpenAI1.0%54.5
36GPT-5.1OpenAI1.0%53.8
37GPT-5 miniOpenAI1.0%52.3
38gpt-oss-120bOpenAIopen1.0%50.5
39GLM-4.5Zhipu AIopen1.0%GLM 4.550.2
40DeepSeek R1DeepSeekopen1.0%052848.9
41DeepSeek V3.2DeepSeekopen0.5%55.9
42Gemini 2.5 ProGoogle0.5%Gemini 2.5 Pro54.1
43GLM-4.6Zhipu AIopen0.5%GLM 4.647.6
44Qwen3.5-9BAlibabaopen0.5%47.5
45Qwen3 30B A3BAlibabaopen0.5%45.1
46Kimi K2 ThinkingMoonshot AIopen0.0%52.8