SWE-bench Verified (Epoch)
Epoch AI's own SWE-bench Verified runs with a constant scaffold.
- Published by
- Epoch AI Benchmarking Hub
- Category
- Coding
- Index weight
- 0.5
- Models
- 33
- Data as of
- 9 Sept 2026
CC BY 4.0 — Epoch AI, ‘AI Benchmarking Hub’, epoch.ai/benchmarks. Mirrored boards credit their original publishers.
- 1Claude Opus 4.783.5%
- 2GPT-5.580.6%
- 3Gemini 3.5 Flash79.3%
- 4Claude Opus 4.678.7%
- 5GLM-5.278.7%
- 6DeepSeek V4 Pro77.6%
- 7Qwen3 777.3%
- 8GPT-5.476.9%
- 9Kimi K2.676.7%
- 10Qwen3 676.7%
- 11Claude Opus 4.576.7%
- 12Gemini 3.1 Pro Customtools75.6%
- 13Gemini 3 Flash75.4%
- 14Claude Sonnet 4.675.2%
- 15GPT-5.3 Codex74.8%
33 of 33
| # | |||||
|---|---|---|---|---|---|
| 1 | 83.5% | – | 59.3 | – | |
| 2 | 80.6% | – | – | – | |
| 3 | 79.3% | – | 60.4 | – | |
| 4 | 78.7% | – | 63.1 | – | |
| 5 | 78.7% | – | 57.6 | – | |
| 6 | 77.6% | – | 56.1 | – | |
| 7 | 77.3% | – | 58.9 | – | |
| 8 | 76.9% | – | 58.8 | – | |
| 9 | 76.7% | kimi-k2.6 | 60.6 | – | |
| 10 | 76.7% | – | 59.5 | – | |
| 11 | 76.7% | – | 58.0 | – | |
| 12 | 75.6% | – | – | – | |
| 13 | 75.4% | – | 56.6 | – | |
| 14 | 75.2% | – | 60.3 | – | |
| 15 | 74.8% | – | – | – | |
| 16 | 74.2% | glm-5.1 | 60.1 | – | |
| 17 | 73.8% | kimi-k2.5 | 56.1 | – | |
| 18 | 73.8% | – | 55.5 | – | |
| 19 | 73.5% | – | 54.5 | – | |
| 20 | 73.3% | – | 52.6 | – | |
| 21 | 72.9% | – | 61.6 | – | |
| 22 | 72.1% | glm-5 | 59.0 | – | |
| 23 | 71.5% | – | 58.5 | – | |
| 24 | 71.3% | – | 52.3 | – | |
| 25 | 70.7% | – | 50.7 | – | |
| 26 | 68.0% | – | 53.8 | – | |
| 27 | 64.7% | – | 54.5 | – | |
| 28 | 62.3% | – | 53.6 | – | |
| 29 | 61.0% | – | 49.8 | – | |
| 30 | 57.9% | – | 59.0 | – | |
| 31 | 57.6% | – | 54.1 | – | |
| 32 | 48.5% | – | 47.3 | – | |
| 33 | 31.0% | – | 42.3 | – |