BenchLeader

SWE-bench Verified (Epoch)

Epoch AI's own SWE-bench Verified runs with a constant scaffold.

Published by
Epoch AI Benchmarking Hub
Category
Coding
Index weight
0.5
Models
33
Data as of
9 Sept 2026

CC BY 4.0 — Epoch AI, ‘AI Benchmarking Hub’, epoch.ai/benchmarks. Mirrored boards credit their original publishers.

33 of 33
#
1Claude Opus 4.7Anthropic83.5%59.3
2GPT-5.5OpenAI80.6%
3Gemini 3.5 FlashGoogle79.3%60.4
4Claude Opus 4.6Anthropic78.7%63.1
5GLM-5.2Zhipu AIopen78.7%57.6
6DeepSeek V4 ProDeepSeekopen77.6%56.1
7Qwen3 7Alibaba77.3%58.9
8GPT-5.4OpenAI76.9%58.8
9Kimi K2.6Moonshot AIopen76.7%kimi-k2.660.6
10Qwen3 6Alibaba76.7%59.5
11Claude Opus 4.5Anthropic76.7%58.0
12Gemini 3.1 Pro CustomtoolsGoogle75.6%
13Gemini 3 FlashGoogle75.4%56.6
14Claude Sonnet 4.6Anthropic75.2%60.3
15GPT-5.3 CodexOpenAI74.8%
16GLM-5.1Zhipu AIopen74.2%glm-5.160.1
17Kimi K2.5Moonshot AIopen73.8%kimi-k2.556.1
18GPT-5.2OpenAI73.8%55.5
19GPT-5OpenAI73.5%54.5
20Claude Opus 4.1Anthropic73.3%52.6
21Gemini 3 ProGoogle72.9%61.6
22GLM-5Zhipu AIopen72.1%glm-559.0
23GPT-5OpenAI71.5%58.5
24Claude Sonnet 4.5Anthropic71.3%52.3
25Claude Opus 4Anthropic70.7%50.7
26GPT-5.1OpenAI68.0%53.8
27GPT-5 miniOpenAI64.7%54.5
28o3OpenAI62.3%53.6
29Claude 3.7 SonnetAnthropic61.0%49.8
30Qwen3.6 PlusAlibabaopen57.9%59.0
31Gemini 2.5 ProGoogle57.6%54.1
32GPT-4.1OpenAI48.5%47.3
33GPT-4oOpenAI31.0%42.3