BenchLeader

SWE-bench Verified (any scaffold)

Best official SWE-bench Verified result for the model with any agent scaffold. Shown for reference.

Published by
SWE-bench
Category
Coding
Index weight
Reference only
Models
68
Data as of
9 Sept 2026

SWE-bench (Jimenez et al. 2024), swebench.com.

68 of 68
#
1Claude Opus 4.5Anthropic79.2%58.0
2Doubao-Seed-CodeByteDance78.8%52.3
3Gemini 3 ProGoogle77.4%61.6
4Claude Sonnet 4Anthropic76.8%49.5
5Gemini 3 FlashGoogle75.8%58.5
6MiniMax-M2.5MiniMaxopen75.8%
7Claude Opus 4.6Anthropic75.6%63.1
8GPT-5OpenAI75.6%59.5
9Claude Sonnet 4.5Anthropic74.8%52.3
10Claude Opus 4Anthropic73.2%50.7
11GPT-5.2 CodexOpenAI72.8%60.7
12GPT-5.2OpenAI72.8%55.5
13GLM-5Zhipu AIopen72.8%
14Kimi K2Moonshot AIopen71.2%preview, via Lingxi v1.548.8
15Kimi K2.5Moonshot AIopen70.8%
16Claude 3.7 SonnetAnthropic70.4%49.8
17Qwen3-Coder-480B-A35B-InstructQwenopen69.6%
18GLM-4.6Z.aiopen68.2%
19MultipleOpenAI68.2%
20Claude Haiku 4.5Anthropic66.6%
21GPT-5.1OpenAI66.0%52.8
22GPT-5.1-CodexOpenAI66.0%
23o4-miniOpenAI64.6%via PatchPilot-v1.154.9
24o1OpenAI64.6%preview, via W&B Programmer O1 crosscheck553.2
25GLM-4.5Z.aiopen64.2%
26Kimi K2 ThinkingMoonshot AIopen63.4%52.8
27Claude 3.5 SonnetAnthropic63.4%45.1
28MiniMax-M2MiniMaxopen61.0%55.1
294x ScaledUnknown60.8%
30Qwen3-Coder 30B-A3B InstructAlibabaopen60.4%via EntroPO + R2E44.4
31DeepSeek V3.2 Reasonerdeepseekopen60.0%
32GPT-5 miniOpenAI59.8%54.5
33TTS(Bo16)OpenAIopen58.8%
34o3OpenAI58.4%60.3
35Devstral SmallMistral AIopen56.4%42.5
36Qwen3 Coder 480BAlibabaopen55.4%48.5
37GLM-4.6Zhipu AIopen55.4%47.6
38GLM-4.5Zhipu AIopen54.2%50.2
39Gemini 2.5 ProGoogle53.6%54.1
40Frogboss 32B 2510Unknown53.6%
41Gemini 2.0 FlashGoogle52.2%42.3
42Qwen3-Coder-30B-A3B-InstructQwenopen51.6%
43Qwen2.5-Coder 32B InstructAlibabaopen47.0%42.2
44Co-PatcheRUnknownopen46.0%
45Frogmini 14B 2510Unknown45.0%
46o3-miniOpenAI42.4%49.5
47Nova PremierAmazon42.4%via Amazon Nova Premier 1.045.3
48Llama3-SWE-RL-70BMeta41.2%
49Claude 3 HaikuAnthropic40.6%36.9
50MultipleMeta40.6%
51Qwen2.5-MaxAlibaba40.2%
52GPT-4.1OpenAI39.6%47.3
53GPT-4oOpenAI38.8%42.3
54GPT-5 nanoOpenAI34.8%46.5
55Lingma SWE-GPT 72b (v0925)OpenAI28.8%v0925, via Lingma Agent
56Gemini 2.5 FlashGoogle28.7%48.8
57gpt-oss-120bOpenAIopen26.0%47.6
58GPT-4.1 miniOpenAI23.9%44.5
59MCTS Refine 7BUnknownopen23.2%
60GPT-4OpenAI22.4%41.8