BenchLeader

LiveBench Agentic Coding

LiveBench agentic coding category.

Published by
LiveBench
Category
Agents & tools
Index weight
Reference only
Models
52
Data as of
9 Sept 2026

LiveBench (livebench.ai), White et al. 2024.

52 of 52
#
1Claude Fable 5.1Anthropic66.1%70.2
2Claude Opus 5Anthropic65.2%66.8
3Deepseek v4 Flash VisionDeepSeek65.1%57.4
4Qwen3 8Alibaba64.7%63.9
5Muse Spark 1.3Meta64.1%63.9
6Kimi K3Moonshot AIopen62.2%kimi-k366.5
7Claude Fable 5Anthropic62.2%65.8
8Qwen3.8-Flash-NextAlibabaopen61.6%59.3
9Qwen 3.8 27BAlibabaopen61.4%57.1
10Smaug FlashUnknown61.1%
11GLM-5.3Zhipu AIopen60.9%glm-5.3
12Smaug MiniUnknown60.8%
13Claude Sonnet 5Anthropic59.4%57.3
14Muse Spark 1.1Meta58.5%56.4
15Gemini 3.7 FlashGoogle58.3%60.8
16Muse Spark 1.2Meta57.6%61.3
17GPT-6 AstraOpenAI57.3%70.6
18Grok 4.6xAI57.0%grok-4.663.6
19GLM-5.3-FlashZhipu AIopen56.8%61.0
20Grok 4.5xAI56.5%grok-4.563.4
21GPT-5.6 SolOpenAI56.2%65.5
22DeepSeek V4 ProDeepSeekopen55.0%081359.7
23GPT-5.6 TerraOpenAI55.0%58.0
24Gemini 3.8 FlashGoogle54.2%60.1
25GPT-5.5OpenAI54.0%63.7
26GPT-5.4OpenAI53.8%61.3
27Ox AlphaUnknown52.6%
28GLM-5.2Zhipu AIopen51.8%glm-5.257.4
29Claude Opus 4.7Anthropic50.7%57.2
30Claude Opus 4.8Anthropic50.5%59.4
31GPT-5.2OpenAI50.3%55.5
32GPT-5.2 CodexOpenAI49.4%60.7
33Claude Opus 4.6Anthropic49.0%61.3
34Gemini 3.5 FlashGoogle49.0%60.4
35GPT-5.6 LunaOpenAI48.4%56.5
36Kimi K2.6Moonshot AIopen46.9%
37DeepSeek V4 FlashDeepSeekopen46.8%073159.1
38GPT-5.4 nanoOpenAI46.8%
39Grok Build 0.1xAI45.8%56.1
40Kimi K2.7 CodeMoonshot AIopen45.7%56.2
41Gemini 3.5 Flash LiteGoogle45.3%44.0
42Gemini 3.1 ProGoogle44.1%60.7
43Qwen3 7Alibaba43.6%58.9
44Gemini 3.6 FlashGoogle43.4%58.6
45Claude Sonnet 4.6Anthropic42.6%51.8
46GPT-5.4 miniOpenAI41.7%46.0
47Qwen3.6 PlusAlibabaopen41.4%59.0
48MiniMax-M3MiniMaxopen40.7%minimax-m356.9
49Claude Opus 4.5Anthropic39.7%56.6
50Qwen3.6 27BAlibabaopen39.3%53.2
51Nemotron 3 Ultra 550B A55BNVIDIAopen38.7%58.3
52Grok 4.3xAI18.5%grok-4.357.8