BenchLeader

SWE-bench Verified (bash only)

Official SWE-bench Verified results from the minimal bash-only mini-SWE-agent harness.

Published by
SWE-bench
Category
Coding
Index weight
1.0
Models
44
Data as of
9 Sept 2026

SWE-bench (Jimenez et al. 2024), swebench.com.

44 of 44
#
1Claude Opus 4.5Anthropic76.8%56.6
2Gemini 3 FlashGoogle75.8%58.5
3MiniMax-M2.5MiniMaxopen75.8%
4Claude Opus 4.6Anthropic75.6%63.1
5Claude Opus 4.5Anthropic74.4%
6Gemini 3 ProGoogle74.2%61.6
7GPT-5.2 CodexOpenAI72.8%60.7
8GPT-5.2OpenAI72.8%55.5
9GLM-5Zhipu AIopen72.8%
10Claude Sonnet 4.5Anthropic71.4%57.8
11Kimi K2.5Moonshot AIopen70.8%
12Claude Sonnet 4.5Anthropic70.6%52.3
13Gemini 3 ProGoogle69.6%57.0
14GPT-5.2OpenAI69.0%61.5
15Claude Opus 4Anthropic67.6%50.7
16Claude Haiku 4.5Anthropic66.6%
17GPT-5.1OpenAI66.0%52.8
18GPT-5.1-CodexOpenAI66.0%
19GPT-5OpenAI65.0%58.5
20Claude Sonnet 4Anthropic64.9%49.5
21Kimi K2 ThinkingMoonshot AIopen63.4%52.8
22MiniMax-M2MiniMaxopen61.0%55.1
23DeepSeek V3.2 Reasonerdeepseekopen60.0%
24GPT-5 miniOpenAI59.8%54.5
25o3OpenAI58.4%60.3
26Devstral SmallMistral AIopen56.4%42.5
27GPT-5 miniOpenAI56.2%55.8
28Qwen3 Coder 480BAlibabaopen55.4%48.5
29GLM-4.6Zhipu AIopen55.4%47.6
30GLM-4.5Zhipu AIopen54.2%50.2
31Gemini 2.5 ProGoogle53.6%54.1
32Claude 3.7 SonnetAnthropic52.8%49.8
33o4-miniOpenAI45.0%54.9
34Kimi K2Moonshot AIopen43.8%48.8
35GPT-4.1OpenAI39.6%47.3
36GPT-5 nanoOpenAI34.8%46.5
37Gemini 2.5 FlashGoogle28.7%48.8
38gpt-oss-120bOpenAIopen26.0%47.6
39GPT-4.1 miniOpenAI23.9%44.5
40GPT-4oOpenAI21.6%42.3
41Llama 4 MaverickMetaopen21.0%42.6
42Gemini 2.0 FlashGoogle13.5%42.3
43Llama 4 ScoutMetaopen9.1%39.7
44Qwen2.5-Coder 32B InstructAlibabaopen9.0%42.2