APEX-Agents
Long-horizon professional agent tasks (Mercor).
- Published by
- Mercordata via Epoch AI Benchmarking Hub
- Category
- Agents & tools
- Index weight
- 0.5
- Models
- 63
- Data as of
- 9 Sept 2026
CC BY 4.0 — Epoch AI, ‘AI Benchmarking Hub’, epoch.ai/benchmarks. Mirrored boards credit their original publishers.
- 1Claude Fable 5.147.4%
- 2GPT-6 Astra46.7%
- 3Claude Fable 545.0%
- 4Claude Fable 5.144.4%
- 5Claude Opus 543.5%
- 6Claude Opus 4.842.5%
- 7Muse Spark 1.141.9%
- 8Grok 4.641.2%
- 9GPT-5.6 Sol40.0%
- 10GPT-5.6 Sol39.9%
- 11Kimi K339.3%
- 12GPT-5.538.5%
- 13GPT-5.538.5%
- 14GPT-5.6 Sol37.7%
- 15GPT-5.6 Sol37.7%
63 of 63
| # | |||||
|---|---|---|---|---|---|
| 1 | 47.4% | – | 70.0 | – | |
| 2 | 46.7% | GPT-6 Astra | 69.9 | – | |
| 3 | 45.0% | Fable 5 | 70.4 | – | |
| 4 | 44.4% | – | 69.7 | – | |
| 5 | 43.5% | – | 66.8 | – | |
| 6 | 42.5% | – | 59.4 | – | |
| 7 | 41.9% | Muse Spark 1.1 | 64.9 | – | |
| 8 | 41.2% | Grok 4.6 | 63.6 | – | |
| 9 | 40.0% | GPT 5.6 Sol (Max + Pro) | – | – | |
| 10 | 39.9% | – | 65.5 | – | |
| 11 | 39.3% | Kimi K3 | 66.5 | – | |
| 12 | 38.5% | GPT-5.5 | 66.6 | – | |
| 13 | 38.5% | – | 63.7 | – | |
| 14 | 37.7% | – | 67.5 | – | |
| 15 | 37.7% | GPT 5.6 Sol (xHigh) | 65.3 | – | |
| 16 | 36.0% | – | 61.3 | – | |
| 17 | 35.6% | GLM-5.2 | 57.4 | – | |
| 18 | 34.9% | – | 63.4 | – | |
| 19 | 34.4% | – | 57.3 | – | |
| 20 | 34.2% | Grok 4.5 | 63.4 | – | |
| 21 | 33.9% | – | 59.3 | – | |
| 22 | 33.5% | – | 63.9 | – | |
| 23 | 32.5% | Sonnet 5 | 61.2 | – | |
| 24 | 32.4% | Opus 4.6 (High) | 63.1 | – | |
| 25 | 32.1% | – | 54.1 | – | |
| 26 | 31.8% | GPT 5.3 Codex | 62.4 | – | |
| 27 | 31.5% | – | 61.6 | – | |
| 28 | 27.6% | GPT 5.2 Codex | 60.7 | – | |
| 29 | 27.6% | Kimi K2.7 Code | 56.2 | – | |
| 30 | 24.6% | – | 54.8 | – | |
| 31 | 24.0% | – | 56.6 | – | |
| 32 | 23.7% | – | 52.3 | – | |
| 33 | 23.0% | – | 61.5 | – | |
| 34 | 23.0% | – | 55.5 | – | |
| 35 | 20.7% | – | 58.0 | – | |
| 36 | 20.7% | GPT 5.1 Codex | 57.1 | – | |
| 37 | 20.1% | – | – | – | |
| 38 | 18.9% | Kimi K2.6 (Thinking) | 60.6 | – | |
| 39 | 18.3% | – | 59.5 | – | |
| 40 | 18.3% | – | 54.5 | – | |
| 41 | 17.5% | – | 59.4 | – | |
| 42 | 17.5% | – | 53.8 | – | |
| 43 | 17.2% | GLM 5 (Thinking) | 59.0 | – | |
| 44 | 17.2% | – | 52.9 | – | |
| 45 | 16.9% | – | 53.9 | – | |
| 46 | 15.2% | 0709 | 57.2 | – | |
| 47 | 14.4% | Kimi K2.5 | 56.1 | – | |
| 48 | 13.6% | Qwen 3.5 (Thinking) | – | – | |
| 49 | 13.0% | Gemini 3.1 Flash Lite | 54.3 | – | |
| 50 | 12.8% | Grok 4.1 | 48.8 | – | |
| 51 | 11.5% | Nemotron 3 Ultra (Thinking) | 48.2 | – | |
| 52 | 9.3% | – | 49.5 | – | |
| 53 | 8.9% | – | 47.9 | – | |
| 54 | 8.7% | GLM 4.7 | 54.9 | – | |
| 55 | 6.6% | Gemini 2.5 Pro (On) | 54.1 | – | |
| 56 | 6.2% | Minimax-2.5 | 53.5 | – | |
| 57 | 4.7% | GPT OSS 120B | 47.6 | – | |
| 58 | 4.1% | – | 52.8 | – | |
| 59 | 4.0% | GLM 4.6 | 47.6 | – | |
| 60 | 2.1% | Grok 3 | 50.0 | – |