BenchLeader

LMArena Agent

Task-outcome score (0–100) from real agentic sessions judged by their users.

Published by
LMArena
Category
Agents & tools
Index weight
0.5
Models
40
Data as of
9 Sept 2026

CC BY 4.0 — lmarena-ai/leaderboard-dataset on Hugging Face.

40 of 40
#
1Claude Fable 5.1Anthropic14.570.2
2GPT-6 AstraOpenAI12.570.6
3Claude Opus 5Anthropic11.469.3
4Claude Opus 5Anthropic10.866.8
5Claude Fable 5Anthropic9.263.9
6GPT-5.6 SolOpenAI7.767.5
7Claude Opus 4.8Anthropic7.761.3
8Kimi K3Moonshot AIopen6.662.7
9Claude Sonnet 5Anthropic6.360.5
10GPT-5.5OpenAI5.363.7
11GLM-5.2Zhipu AIopen4.657.6
12DeepSeek V4 ProDeepSeekopen4.4high, 081360.0
13Gemini 3.8 FlashGoogle460.1
14Qwen3 8Alibaba3.963.9
15Grok 4.5xAI3.9Grok 4.563.4
16Grok 4.6xAI3.262.3
17GPT-5.5OpenAI3GPT 5.566.6
18GLM-5.3Zhipu AIopen2.659.9
19DeepSeek V4 FlashDeepSeekopen2.2high, 2026073159.3
20GLM-5.3-FlashZhipu AIopen2GLM 5.3 Flash61.0
21GPT-5.4OpenAI1.658.8
22GPT-5.6 TerraOpenAI1.564.2
23GPT-5.6 LunaOpenAI1.159.3
24Qwen3.8-Flash-NextAlibabaopen0.8Qwen3.8 Flash Next59.3
25Qwen 3.8 27BAlibabaopen0.1Qwen 3.8 27B57.1
26DeepSeek V4 ProDeepSeekopen-0.4DeepSeek V4 Pro59.7
27Claude Sonnet 4.6Anthropic-1Claude Sonnet 4.660.3
28Muse Spark 1.2Meta-1.661.3
29Muse Spark 1.1Meta-2.6Muse Spark 1.164.9
30Qwen3 7Alibaba-3.158.9
31MiMo-V2.5-ProXiaomiopen-5.1Mimo V2.5 Pro59.0
32Qwen3.7 PlusAlibaba-5.2Qwen3.7 Plus59.7
33Gemini 3.1 ProGoogle-5.363.9
34Gemini 3.6 FlashGoogle-5.358.6
35MiniMax-M3MiniMaxopen-5.3Minimax M356.9
36Inkling-SmallThinking Machinesopen-6.955.0
37Mistral Medium 3.5Mistral AI-9.3Mistral Medium 3.550.8
38Solar Pro 4Upstage-11.3Solar Pro 4
39MiniMax-M2.7MiniMaxopen-13Minimax M2.756.5
40Gemini 3.5 Flash LiteGoogle-13.4Gemini 3.5 Flash Lite53.5