SWE-Bench Pro
Long-horizon software engineering tasks in public repositories. Scale AI.
- Published by
- Scale AI SEAL
- Category
- Coding
- Index weight
- 1.0
- Models
- 23
- Data as of
- 9 Sept 2026
Scale AI SEAL Leaderboards.
- 1Muse Spark 1.161.5%
- 2GPT-5.459.1%
- 3Muse Spark55.0%
- 4Claude Opus 4.651.9%
- 5Gemini 3.1 Pro46.1%
- 6Claude Opus 4.545.9%
- 7Claude Sonnet 4.543.6%
- 8Gemini 3 Pro43.3%
- 9Claude Sonnet 442.7%
- 10GPT-541.8%
- 11GPT-5.2 Codex41.0%
- 12Claude Haiku 4.539.5%
- 13Qwen3 Coder 480B38.7%
- 14Minimax 2.136.8%
- 15Gemini 3 Flash34.6%
23 of 23
| # | |||||
|---|---|---|---|---|---|
| 1 | 61.5% | Muse Spark 1.1* | 64.9 | – | |
| 2 | 59.1% | – | 61.3 | – | |
| 3 | 55.0% | – | 65.4 | – | |
| 4 | 51.9% | – | 62.3 | – | |
| 5 | 46.1% | – | – | – | |
| 6 | 45.9% | – | 58.0 | – | |
| 7 | 43.6% | – | 52.3 | – | |
| 8 | 43.3% | – | 61.6 | – | |
| 9 | 42.7% | – | 49.5 | – | |
| 10 | 41.8% | – | 54.5 | – | |
| 11 | 41.0% | – | 60.7 | – | |
| 12 | 39.5% | – | 47.9 | – | |
| 13 | 38.7% | – | 48.5 | – | |
| 14 | 36.8% | minimax-2.1 | – | – | |
| 15 | 34.6% | – | 56.6 | – | |
| 16 | 29.9% | gpt-5.2 | 61.5 | – | |
| 17 | 27.7% | – | 48.8 | – | |
| 18 | 21.4% | – | 48.7 | – | |
| 19 | 16.2% | – | 47.6 | – | |
| 20 | 11.4% | – | 39.7 | – | |
| 21 | 11.2% | – | 42.6 | – | |
| 22 | 9.7% | glm-4.6 | 47.6 | – | |
| 23 | 5.2% | – | – | – |