BenchLeader

SWE-Bench Pro

Long-horizon software engineering tasks in public repositories. Scale AI.

Published by
Scale AI SEAL
Category
Coding
Index weight
1.0
Models
23
Data as of
9 Sept 2026

Scale AI SEAL Leaderboards.

23 of 23
#
1Muse Spark 1.1Meta61.5%Muse Spark 1.1*64.9
2GPT-5.4OpenAI59.1%61.3
3Muse SparkMeta55.0%65.4
4Claude Opus 4.6Anthropic51.9%62.3
5Gemini 3.1 ProGoogle46.1%
6Claude Opus 4.5Anthropic45.9%58.0
7Claude Sonnet 4.5Anthropic43.6%52.3
8Gemini 3 ProGoogle43.3%61.6
9Claude Sonnet 4Anthropic42.7%49.5
10GPT-5OpenAI41.8%54.5
11GPT-5.2 CodexOpenAI41.0%60.7
12Claude Haiku 4.5Anthropic39.5%47.9
13Qwen3 Coder 480BAlibabaopen38.7%48.5
14Minimax 2.1MiniMax36.8%minimax-2.1
15Gemini 3 FlashGoogle34.6%56.6
16GPT-5.2OpenAI29.9%gpt-5.261.5
17Kimi K2Moonshot AIopen27.7%48.8
18Qwen3 235B A22BAlibabaopen21.4%48.7
19gpt-oss-120bOpenAIopen16.2%47.6
20Gemma 3 27BGoogleopen11.4%39.7
21Llama 3.1 405BMetaopen11.2%42.6
22GLM-4.6Zhipu AIopen9.7%glm-4.647.6
23Llama 4 Maverick 17BMeta5.2%