FrontierCode
Hard real-world coding tasks run in agent harnesses (Cognition).
- Published by
- Cognitiondata via Epoch AI Benchmarking Hub
- Category
- Coding
- Index weight
- 0.5
- Models
- 29
- Data as of
- 9 Sept 2026
CC BY 4.0 — Epoch AI, ‘AI Benchmarking Hub’, epoch.ai/benchmarks. Mirrored boards credit their original publishers.
- 1Claude Fable 553.5%
- 2Claude Opus 553.4%
- 3GPT-6 Astra53.3%
- 4Claude Fable 5.150.9%
- 5Grok 4.648.0%
- 6GPT-5.6 Sol47.5%
- 7Claude Opus 4.846.5%
- 8Kimi K344.2%
- 9Gemini 3.7 Flash43.6%
- 10GPT-5.543.0%
- 11Claude Sonnet 542.7%
- 12Grok 4.542.4%
- 13SWE-1.742.0%
- 14GPT-5.6 Terra41.3%
- 15GPT-5.6 Luna39.8%
29 of 29
| # | |||||
|---|---|---|---|---|---|
| 1 | 53.5% | – | 70.4 | – | |
| 2 | 53.4% | – | 66.8 | – | |
| 3 | 53.3% | – | 70.6 | – | |
| 4 | 50.9% | – | 68.0 | – | |
| 5 | 48.0% | – | 63.6 | – | |
| 6 | 47.5% | – | 65.3 | – | |
| 7 | 46.5% | – | 64.7 | – | |
| 8 | 44.2% | – | 66.5 | – | |
| 9 | 43.6% | – | 61.7 | – | |
| 10 | 43.0% | – | 66.6 | – | |
| 11 | 42.7% | – | 61.2 | – | |
| 12 | 42.4% | – | 63.4 | – | |
| 13 | SWE-1.7Cognition | 42.0% | – | – | – |
| 14 | 41.3% | – | 62.3 | – | |
| 15 | 39.8% | – | 56.6 | – | |
| 16 | 38.5% | – | 65.5 | – | |
| 17 | 34.4% | – | 60.7 | – | |
| 18 | 30.1% | – | 56.2 | – | |
| 19 | 27.0% | – | 54.8 | – | |
| 20 | 26.6% | – | 63.1 | – | |
| 21 | Composer 2.5Cursor | 25.6% | – | – | – |
| 22 | 24.5% | – | 50.3 | – | |
| 23 | 24.3% | – | 60.3 | – | |
| 24 | 18.8% | 0731, via chisel | 59.1 | – | |
| 25 | 17.6% | – | 48.8 | – | |
| 26 | 14.7% | – | 56.9 | – | |
| 27 | 10.2% | – | 59.7 | – | |
| 28 | SWE-1.6Cognition | 9.4% | – | – | – |
| 29 | 8.0% | medium, 2604, via chisel | 45.8 | – |