BenchLeader

FrontierCode

Hard real-world coding tasks run in agent harnesses (Cognition).

Published by
Cognitiondata via Epoch AI Benchmarking Hub
Category
Coding
Index weight
0.5
Models
29
Data as of
9 Sept 2026

CC BY 4.0 — Epoch AI, ‘AI Benchmarking Hub’, epoch.ai/benchmarks. Mirrored boards credit their original publishers.

29 of 29
#
1Claude Fable 5Anthropic53.5%70.4
2Claude Opus 5Anthropic53.4%66.8
3GPT-6 AstraOpenAI53.3%70.6
4Claude Fable 5.1Anthropic50.9%68.0
5Grok 4.6xAI48.0%63.6
6GPT-5.6 SolOpenAI47.5%65.3
7Claude Opus 4.8Anthropic46.5%64.7
8Kimi K3Moonshot AIopen44.2%66.5
9Gemini 3.7 FlashGoogle43.6%61.7
10GPT-5.5OpenAI43.0%66.6
11Claude Sonnet 5Anthropic42.7%61.2
12Grok 4.5xAI42.4%63.4
13SWE-1.7Cognition42.0%
14GPT-5.6 TerraOpenAI41.3%62.3
15GPT-5.6 LunaOpenAI39.8%56.6
16Claude Opus 4.7Anthropic38.5%65.5
17Gemini 3.6 FlashGoogle34.4%60.7
18Kimi K2.7 CodeMoonshot AIopen30.1%56.2
19GPT-5.4 miniOpenAI27.0%54.8
20Claude Opus 4.6Anthropic26.6%63.1
21Composer 2.5Cursor25.6%
22GLM-5.2Zhipu AIopen24.5%50.3
23Claude Sonnet 4.6Anthropic24.3%60.3
24DeepSeek V4 FlashDeepSeekopen18.8%0731, via chisel59.1
25DeepSeek V4 ProDeepSeekopen17.6%48.8
26MiniMax-M3MiniMaxopen14.7%56.9
27Qwen3.7 PlusAlibaba10.2%59.7
28SWE-1.6Cognition9.4%
29Mistral Medium (latest)Mistral AI8.0%medium, 2604, via chisel45.8