BenchLeader

MATH Level 5

Hardest tier of the MATH dataset. Largely saturated, kept at half weight. Run by Epoch AI.

Published by
Epoch AI Benchmarking Hub
Category
Maths
Index weight
0.5
Models
90
Data as of
9 Sept 2026

CC BY 4.0 — Epoch AI, ‘AI Benchmarking Hub’, epoch.ai/benchmarks. Mirrored boards credit their original publishers.

Top 15
  1. 1GPT-598.1%
  2. 2GPT-597.9%
  3. 3GPT-5 mini97.8%
  4. 4o4-mini97.8%
  5. 5o397.8%
  6. 6Claude Sonnet 4.597.7%
  7. 7Qwen3 Max97.1%
  8. 8GPT-5 mini96.8%
  9. 9DeepSeek R196.6%
  10. 10o3-mini96.5%
  11. 11Claude Haiku 4.596.4%
  12. 12Gemini 2.5 Pro95.9%
  13. 13GPT-5 nano95.2%
  14. 14o3-mini95.2%
  15. 15GPT-5 nano94.9%
90 of 90
#
1GPT-5OpenAI98.1%54.5
2GPT-5OpenAI97.9%58.5
3GPT-5 miniOpenAI97.8%52.3
4o4-miniOpenAI97.8%48.0
5o3OpenAI97.8%52.9
6Claude Sonnet 4.5Anthropic97.7%52.3
7Qwen3 MaxAlibaba97.1%52.7
8GPT-5 miniOpenAI96.8%54.5
9DeepSeek R1DeepSeekopen96.6%052848.9
10o3-miniOpenAI96.5%47.8
11Claude Haiku 4.5Anthropic96.4%47.9
12Gemini 2.5 ProGoogle95.9%54.1
13GPT-5 nanoOpenAI95.2%46.5
14o3-miniOpenAI95.2%45.6
15GPT-5 nanoOpenAI94.9%45.9
16o1OpenAI94.7%44.3
17o1OpenAI94.4%48.3
18Claude 3.7 SonnetAnthropic91.2%49.8
19Grok 3 minixAI90.9%50.2
20DeepSeek-R1-Distill-Llama-70BDeepSeekopen89.9%42.2
21o1-miniOpenAI89.2%
22Grok 3xAI88.8%50.0
23Grok 3 minixAI88.1%53.3
24GPT-4.1 miniOpenAI87.3%44.5
25DeepSeek-R1-Distill-Qwen-14BDeepSeekopen87.1%41.4
26Claude Opus 4Anthropic85.0%50.7
27Claude Sonnet 4Anthropic84.4%49.5
28o1-miniOpenAI84.3%44.4
29Gemini 2.0 ProGoogle83.5%47.0
30GPT-4.1OpenAI83.0%47.3
31Gemini 2.0 FlashGoogle82.2%42.3
32o1OpenAI81.7%53.2
33Mistral Medium (latest)Mistral AI81.6%medium, 250545.8
34GPT-4.5OpenAI78.6%49.6
35Gemma 3 27BGoogleopen74.0%39.7
36Llama 4 MaverickMetaopen73.0%42.6
37Gemini 1.5 Pro 002Google70.4%42.8
38GPT-4.1 nanoOpenAI70.0%38.1
39Qwen3 235B A22BAlibabaopen68.9%48.7
40Qwen PlusAlibaba65.3%48.4
41Phi-4Microsoftopen64.9%phi-439.7
42DeepSeek V3DeepSeekopen64.8%DeepSeek-V343.8
43Grok 2xAI63.5%121241.6
44Qwen2.5 72BAlibabaopen63.2%42.1
45Llama 4 ScoutMetaopen62.3%39.7
46Gemini 1.5 Flash 002Google61.9%38.7
47Claude 3.5 SonnetAnthropic57.0%45.1
48Qwen TurboAlibaba56.2%
49Qwen2.5 32B InstructAlibabaopen56.1%
50GPT-4oOpenAI53.3%42.3
51GPT-4o miniOpenAI52.6%35.8
52Mistral Large 2Mistral AIopen50.3%241141.2
53Llama 3.1 405BMetaopen49.8%42.6
54Mistral Small (latest)Mistral AI46.8%250341.1
55GPT-4 TurboOpenAI46.7%41.0
56Claude 3.5 HaikuAnthropic46.4%39.8
57Llama 3.1 Tulu 3 70B DpoAllen Institute for AI42.7%
58Llama 3.3 70BMetaopen41.6%40.7
59Gemini 1.5 Pro 001Google40.8%44.3
60GPT-4OpenAI40.0%preview, 110641.8