BenchLeader

APEX-Agents

Long-horizon professional agent tasks (Mercor).

Published by
Mercordata via Epoch AI Benchmarking Hub
Category
Agents & tools
Index weight
0.5
Models
63
Data as of
9 Sept 2026

CC BY 4.0 — Epoch AI, ‘AI Benchmarking Hub’, epoch.ai/benchmarks. Mirrored boards credit their original publishers.

63 of 63
#
1Claude Fable 5.1Anthropic47.4%70.0
2GPT-6 AstraOpenAI46.7%GPT-6 Astra69.9
3Claude Fable 5Anthropic45.0%Fable 570.4
4Claude Fable 5.1Anthropic44.4%69.7
5Claude Opus 5Anthropic43.5%66.8
6Claude Opus 4.8Anthropic42.5%59.4
7Muse Spark 1.1Meta41.9%Muse Spark 1.164.9
8Grok 4.6xAI41.2%Grok 4.663.6
9GPT-5.6 SolOpenAI40.0%GPT 5.6 Sol (Max + Pro)
10GPT-5.6 SolOpenAI39.9%65.5
11Kimi K3Moonshot AIopen39.3%Kimi K366.5
12GPT-5.5OpenAI38.5%GPT-5.566.6
13GPT-5.5OpenAI38.5%63.7
14GPT-5.6 SolOpenAI37.7%67.5
15GPT-5.6 SolOpenAI37.7%GPT 5.6 Sol (xHigh)65.3
16GPT-5.4OpenAI36.0%61.3
17GLM-5.2Zhipu AIopen35.6%GLM-5.257.4
18GPT-5.4OpenAI34.9%63.4
19GPT-5.2OpenAI34.4%57.3
20Grok 4.5xAI34.2%Grok 4.563.4
21Claude Opus 4.7Anthropic33.9%59.3
22Gemini 3.1 ProGoogle33.5%63.9
23Claude Sonnet 5Anthropic32.5%Sonnet 561.2
24Claude Opus 4.6Anthropic32.4%Opus 4.6 (High)63.1
25Claude Opus 4.6Anthropic32.1%54.1
26GPT-5.3 CodexOpenAI31.8%GPT 5.3 Codex62.4
27Gemini 3 ProGoogle31.5%61.6
28GPT-5.2 CodexOpenAI27.6%GPT 5.2 Codex60.7
29Kimi K2.7 CodeMoonshot AIopen27.6%Kimi K2.7 Code56.2
30GPT-5.4 miniOpenAI24.6%54.8
31Gemini 3 FlashGoogle24.0%56.6
32Claude Sonnet 4.6Anthropic23.7%52.3
33GPT-5.2OpenAI23.0%61.5
34GPT-5.2OpenAI23.0%55.5
35Claude Opus 4.5Anthropic20.7%58.0
36GPT-5.1-CodexOpenAI20.7%GPT 5.1 Codex57.1
37GPT-5-CodexOpenAI20.1%
38Kimi K2.6Moonshot AIopen18.9%Kimi K2.6 (Thinking)60.6
39GPT-5OpenAI18.3%59.5
40GPT-5OpenAI18.3%54.5
41GPT-5.1OpenAI17.5%59.4
42GPT-5.1OpenAI17.5%53.8
43GLM-5Zhipu AIopen17.2%GLM 5 (Thinking)59.0
44o3OpenAI17.2%52.9
45GPT-5.4 nanoOpenAI16.9%53.9
46Grok 4xAI15.2%070957.2
47Kimi K2.5Moonshot AIopen14.4%Kimi K2.556.1
48Qwen3.5 PlusAlibaba13.6%Qwen 3.5 (Thinking)
49Gemini 3.1 Flash LiteGoogle13.0%Gemini 3.1 Flash Lite54.3
50Grok 4.1xAI12.8%Grok 4.148.8
51Nemotron 3 UltraNVIDIA11.5%Nemotron 3 Ultra (Thinking)48.2
52Claude Sonnet 4Anthropic9.3%49.5
53Claude Haiku 4.5Anthropic8.9%47.9
54GLM-4.7Zhipu AIopen8.7%GLM 4.754.9
55Gemini 2.5 ProGoogle6.6%Gemini 2.5 Pro (On)54.1
56MiniMax-M2.5MiniMaxopen6.2%Minimax-2.553.5
57gpt-oss-120bOpenAIopen4.7%GPT OSS 120B47.6
58Kimi K2 ThinkingMoonshot AIopen4.1%52.8
59GLM-4.6Zhipu AIopen4.0%GLM 4.647.6
60Grok 3xAI2.1%Grok 350.0