SWE-bench Verified (any scaffold)
Best official SWE-bench Verified result for the model with any agent scaffold. Shown for reference.
- Published by
- SWE-bench
- Category
- Coding
- Index weight
- Reference only
- Models
- 68
- Data as of
- 9 Sept 2026
SWE-bench (Jimenez et al. 2024), swebench.com.
- 1Claude Opus 4.579.2%
- 2Doubao-Seed-Code78.8%
- 3Gemini 3 Pro77.4%
- 4Claude Sonnet 476.8%
- 5Gemini 3 Flash75.8%
- 6MiniMax-M2.575.8%
- 7Claude Opus 4.675.6%
- 8GPT-575.6%
- 9Claude Sonnet 4.574.8%
- 10Claude Opus 473.2%
- 11GPT-5.2 Codex72.8%
- 12GPT-5.272.8%
- 13GLM-572.8%
- 14Kimi K271.2%
- 15Kimi K2.570.8%
68 of 68
| # | |||||
|---|---|---|---|---|---|
| 1 | 79.2% | – | 58.0 | – | |
| 2 | 78.8% | – | 52.3 | – | |
| 3 | 77.4% | – | 61.6 | – | |
| 4 | 76.8% | – | 49.5 | – | |
| 5 | 75.8% | – | 58.5 | – | |
| 6 | 75.8% | – | – | – | |
| 7 | 75.6% | – | 63.1 | – | |
| 8 | 75.6% | – | 59.5 | – | |
| 9 | 74.8% | – | 52.3 | – | |
| 10 | 73.2% | – | 50.7 | – | |
| 11 | 72.8% | – | 60.7 | – | |
| 12 | 72.8% | – | 55.5 | – | |
| 13 | 72.8% | – | – | – | |
| 14 | 71.2% | preview, via Lingxi v1.5 | 48.8 | – | |
| 15 | 70.8% | – | – | – | |
| 16 | 70.4% | – | 49.8 | – | |
| 17 | Qwen3-Coder-480B-A35B-InstructQwenopen | 69.6% | – | – | – |
| 18 | GLM-4.6Z.aiopen | 68.2% | – | – | – |
| 19 | 68.2% | – | – | – | |
| 20 | 66.6% | – | – | – | |
| 21 | 66.0% | – | 52.8 | – | |
| 22 | 66.0% | – | – | – | |
| 23 | 64.6% | via PatchPilot-v1.1 | 54.9 | – | |
| 24 | 64.6% | preview, via W&B Programmer O1 crosscheck5 | 53.2 | – | |
| 25 | GLM-4.5Z.aiopen | 64.2% | – | – | – |
| 26 | 63.4% | – | 52.8 | – | |
| 27 | 63.4% | – | 45.1 | – | |
| 28 | 61.0% | – | 55.1 | – | |
| 29 | 4x ScaledUnknown | 60.8% | – | – | – |
| 30 | 60.4% | via EntroPO + R2E | 44.4 | – | |
| 31 | 60.0% | – | – | – | |
| 32 | 59.8% | – | 54.5 | – | |
| 33 | 58.8% | – | – | – | |
| 34 | 58.4% | – | 60.3 | – | |
| 35 | 56.4% | – | 42.5 | – | |
| 36 | 55.4% | – | 48.5 | – | |
| 37 | 55.4% | – | 47.6 | – | |
| 38 | 54.2% | – | 50.2 | – | |
| 39 | 53.6% | – | 54.1 | – | |
| 40 | Frogboss 32B 2510Unknown | 53.6% | – | – | – |
| 41 | 52.2% | – | 42.3 | – | |
| 42 | Qwen3-Coder-30B-A3B-InstructQwenopen | 51.6% | – | – | – |
| 43 | 47.0% | – | 42.2 | – | |
| 44 | Co-PatcheRUnknownopen | 46.0% | – | – | – |
| 45 | Frogmini 14B 2510Unknown | 45.0% | – | – | – |
| 46 | 42.4% | – | 49.5 | – | |
| 47 | 42.4% | via Amazon Nova Premier 1.0 | 45.3 | – | |
| 48 | 41.2% | – | – | – | |
| 49 | 40.6% | – | 36.9 | – | |
| 50 | 40.6% | – | – | – | |
| 51 | 40.2% | – | – | – | |
| 52 | 39.6% | – | 47.3 | – | |
| 53 | 38.8% | – | 42.3 | – | |
| 54 | 34.8% | – | 46.5 | – | |
| 55 | 28.8% | v0925, via Lingma Agent | – | – | |
| 56 | 28.7% | – | 48.8 | – | |
| 57 | 26.0% | – | 47.6 | – | |
| 58 | 23.9% | – | 44.5 | – | |
| 59 | MCTS Refine 7BUnknownopen | 23.2% | – | – | – |
| 60 | 22.4% | – | 41.8 | – |