BenchLeader

GSO-Bench

Software optimisation tasks measured against expert speed-ups.

Published by
GSO-Benchdata via Epoch AI Benchmarking Hub
Category
Coding
Index weight
0.5
Models
31
Data as of
9 Sept 2026

CC BY 4.0 — Epoch AI, ‘AI Benchmarking Hub’, epoch.ai/benchmarks. Mirrored boards credit their original publishers.

31 of 31
#
1Claude Opus 4.8Anthropic47.1%64.7
2Claude Opus 4.7Anthropic44.1%65.5
3Claude Opus 4.7Anthropic44.1%61.3
4Claude Opus 4.6Anthropic41.2%61.3
5GPT-5.5OpenAI40.2%63.7
6Claude Sonnet 5Anthropic37.3%61.2
7Claude Opus 4.6Anthropic33.3%63.1
8GPT-5.4OpenAI31.4%61.3
9GPT-5.2OpenAI27.4%55.5
10Claude Opus 4.5Anthropic26.5%58.0
11GPT-5.4OpenAI25.5%58.8
12Gemini 3.1 ProGoogle22.6%63.9
13Gemini 3 ProGoogle18.6%61.6
14Claude Sonnet 4.5Anthropic14.7%52.3
15GPT-5.1OpenAI13.7%59.4
16GPT-5.1OpenAI13.7%53.8
17Gemini 3 FlashGoogle9.8%56.6
18o3OpenAI8.8%52.9
19Claude Opus 4Anthropic6.9%50.7
20GPT-5OpenAI6.9%54.5
21Claude Sonnet 4Anthropic4.9%49.5
22Kimi K2Moonshot AIopen4.9%48.8
23Qwen3 Coder 480BAlibabaopen4.9%48.5
24Claude 3.5 SonnetAnthropic4.6%45.1
25Gemini 2.5 ProGoogle3.9%54.1
26Claude 3.7 SonnetAnthropic3.8%49.8
27o4-miniOpenAI3.6%48.0
28GLM-4.5-AirZhipu AIopen2.9%46.0
29o3-miniOpenAI1.3%47.8
30o3-miniOpenAI1.3%40.4
31GPT-4oOpenAI0.0%42.3