MATH Level 5
Hardest tier of the MATH dataset. Largely saturated, kept at half weight. Run by Epoch AI.
- Published by
- Epoch AI Benchmarking Hub
- Category
- Maths
- Index weight
- 0.5
- Models
- 90
- Data as of
- 9 Sept 2026
CC BY 4.0 — Epoch AI, ‘AI Benchmarking Hub’, epoch.ai/benchmarks. Mirrored boards credit their original publishers.
- 1GPT-598.1%
- 2GPT-597.9%
- 3GPT-5 mini97.8%
- 4o4-mini97.8%
- 5o397.8%
- 6Claude Sonnet 4.597.7%
- 7Qwen3 Max97.1%
- 8GPT-5 mini96.8%
- 9DeepSeek R196.6%
- 10o3-mini96.5%
- 11Claude Haiku 4.596.4%
- 12Gemini 2.5 Pro95.9%
- 13GPT-5 nano95.2%
- 14o3-mini95.2%
- 15GPT-5 nano94.9%
90 of 90
| # | |||||
|---|---|---|---|---|---|
| 1 | 98.1% | – | 54.5 | – | |
| 2 | 97.9% | – | 58.5 | – | |
| 3 | 97.8% | – | 52.3 | – | |
| 4 | 97.8% | – | 48.0 | – | |
| 5 | 97.8% | – | 52.9 | – | |
| 6 | 97.7% | – | 52.3 | – | |
| 7 | 97.1% | – | 52.7 | – | |
| 8 | 96.8% | – | 54.5 | – | |
| 9 | 96.6% | 0528 | 48.9 | – | |
| 10 | 96.5% | – | 47.8 | – | |
| 11 | 96.4% | – | 47.9 | – | |
| 12 | 95.9% | – | 54.1 | – | |
| 13 | 95.2% | – | 46.5 | – | |
| 14 | 95.2% | – | 45.6 | – | |
| 15 | 94.9% | – | 45.9 | – | |
| 16 | 94.7% | – | 44.3 | – | |
| 17 | 94.4% | – | 48.3 | – | |
| 18 | 91.2% | – | 49.8 | – | |
| 19 | 90.9% | – | 50.2 | – | |
| 20 | 89.9% | – | 42.2 | – | |
| 21 | 89.2% | – | – | – | |
| 22 | 88.8% | – | 50.0 | – | |
| 23 | 88.1% | – | 53.3 | – | |
| 24 | 87.3% | – | 44.5 | – | |
| 25 | 87.1% | – | 41.4 | – | |
| 26 | 85.0% | – | 50.7 | – | |
| 27 | 84.4% | – | 49.5 | – | |
| 28 | 84.3% | – | 44.4 | – | |
| 29 | 83.5% | – | 47.0 | – | |
| 30 | 83.0% | – | 47.3 | – | |
| 31 | 82.2% | – | 42.3 | – | |
| 32 | 81.7% | – | 53.2 | – | |
| 33 | 81.6% | medium, 2505 | 45.8 | – | |
| 34 | 78.6% | – | 49.6 | – | |
| 35 | 74.0% | – | 39.7 | – | |
| 36 | 73.0% | – | 42.6 | – | |
| 37 | 70.4% | – | 42.8 | – | |
| 38 | 70.0% | – | 38.1 | – | |
| 39 | 68.9% | – | 48.7 | – | |
| 40 | 65.3% | – | 48.4 | – | |
| 41 | 64.9% | phi-4 | 39.7 | – | |
| 42 | 64.8% | DeepSeek-V3 | 43.8 | – | |
| 43 | 63.5% | 1212 | 41.6 | – | |
| 44 | 63.2% | – | 42.1 | – | |
| 45 | 62.3% | – | 39.7 | – | |
| 46 | 61.9% | – | 38.7 | – | |
| 47 | 57.0% | – | 45.1 | – | |
| 48 | 56.2% | – | – | – | |
| 49 | 56.1% | – | – | – | |
| 50 | 53.3% | – | 42.3 | – | |
| 51 | 52.6% | – | 35.8 | – | |
| 52 | 50.3% | 2411 | 41.2 | – | |
| 53 | 49.8% | – | 42.6 | – | |
| 54 | 46.8% | 2503 | 41.1 | – | |
| 55 | 46.7% | – | 41.0 | – | |
| 56 | 46.4% | – | 39.8 | – | |
| 57 | Llama 3.1 Tulu 3 70B DpoAllen Institute for AI | 42.7% | – | – | – |
| 58 | 41.6% | – | 40.7 | – | |
| 59 | 40.8% | – | 44.3 | – | |
| 60 | 40.0% | preview, 1106 | 41.8 | – |