BenchLeader

LiveBench

Average of LiveBench's category scores on the current question set.

Published by
LiveBench
Category
Composite
Index weight
1.0
Models
52
Data as of
9 Sept 2026

LiveBench (livebench.ai), White et al. 2024.

52 of 52
#
1Claude Fable 5.1Anthropic83.4%70.2
2Claude Fable 5Anthropic83.0%65.8
3GPT-6 AstraOpenAI82.2%70.6
4Muse Spark 1.3Meta81.6%63.9
5GPT-5.6 SolOpenAI81.0%65.5
6GPT-5.5OpenAI80.2%63.7
7Claude Opus 5Anthropic80.1%66.8
8Kimi K3Moonshot AIopen79.2%kimi-k366.5
9Gemini 3.7 FlashGoogle78.8%60.8
10Qwen3 8Alibaba78.5%63.9
11Grok 4.6xAI78.0%grok-4.663.6
12GPT-5.4OpenAI78.0%61.3
13Muse Spark 1.2Meta78.0%61.3
14GPT-5.6 TerraOpenAI77.9%58.0
15DeepSeek V4 ProDeepSeekopen77.4%081359.7
16Smaug FlashUnknown77.4%
17Gemini 3.1 ProGoogle77.0%60.7
18Smaug MiniUnknown76.9%
19Deepseek v4 Flash VisionDeepSeek76.8%57.4
20Claude Opus 4.7Anthropic76.5%57.2
21Claude Opus 4.8Anthropic76.2%59.4
22Qwen3.8-Flash-NextAlibabaopen76.2%59.3
23GLM-5.3Zhipu AIopen76.1%glm-5.3
24Claude Sonnet 5Anthropic76.0%57.3
25Gemini 3.8 FlashGoogle75.8%60.1
26Grok 4.5xAI75.8%grok-4.563.4
27Muse Spark 1.1Meta75.3%56.4
28Qwen 3.8 27BAlibabaopen75.3%57.1
29Gemini 3.5 FlashGoogle74.6%60.4
30GPT-5.2OpenAI74.6%55.5
31Claude Opus 4.6Anthropic74.5%61.3
32DeepSeek V4 FlashDeepSeekopen74.2%073159.1
33GPT-5.2 CodexOpenAI74.0%60.7
34Gemini 3.6 FlashGoogle73.6%58.6
35GPT-5.6 LunaOpenAI73.6%56.5
36GLM-5.2Zhipu AIopen73.2%glm-5.257.4
37Qwen3 7Alibaba73.1%58.9
38Claude Sonnet 4.6Anthropic73.0%51.8
39Claude Opus 4.5Anthropic72.6%56.6
40GLM-5.3-FlashZhipu AIopen71.6%61.0
41Kimi K2.6Moonshot AIopen70.5%
42GPT-5.4 nanoOpenAI69.6%
43Ox AlphaUnknown69.2%
44Qwen3.6 PlusAlibabaopen68.9%59.0
45Kimi K2.7 CodeMoonshot AIopen68.4%56.2
46Grok Build 0.1xAI67.8%56.1
47Nemotron 3 Ultra 550B A55BNVIDIAopen67.4%58.3
48MiniMax-M3MiniMaxopen67.3%minimax-m356.9
49GPT-5.4 miniOpenAI66.4%46.0
50Qwen3.6 27BAlibabaopen64.0%53.2
51Gemini 3.5 Flash LiteGoogle63.9%44.0
52Grok 4.3xAI62.3%grok-4.357.8