BenchLeader

LiveBench Reasoning

LiveBench reasoning category.

Published by
LiveBench
Category
Reasoning
Index weight
Reference only
Models
52
Data as of
9 Sept 2026

LiveBench (livebench.ai), White et al. 2024.

52 of 52
#
1GPT-6 AstraOpenAI92.7%70.6
2Claude Fable 5.1Anthropic91.7%70.2
3GPT-5.6 SolOpenAI91.7%65.5
4Claude Opus 5Anthropic91.2%66.8
5Kimi K3Moonshot AIopen90.7%kimi-k366.5
6GPT-5.6 TerraOpenAI90.6%58.0
7Grok 4.6xAI90.5%grok-4.663.6
8Muse Spark 1.2Meta90.0%61.3
9Claude Fable 5Anthropic89.7%65.8
10Muse Spark 1.3Meta89.7%63.9
11GPT-5.5OpenAI89.7%63.7
12Gemini 3.8 FlashGoogle89.3%60.1
13Claude Opus 4.8Anthropic89.2%59.4
14Claude Sonnet 5Anthropic88.7%57.3
15Claude Opus 4.6Anthropic88.7%61.3
16Qwen3 8Alibaba88.2%63.9
17GPT-5.4OpenAI88.1%61.3
18Gemini 3.7 FlashGoogle87.8%60.8
19Muse Spark 1.1Meta87.7%56.4
20Qwen3.8-Flash-NextAlibabaopen87.4%59.3
21Claude Opus 4.7Anthropic87.2%57.2
22Grok 4.5xAI87.2%grok-4.563.4
23DeepSeek V4 FlashDeepSeekopen86.6%073159.1
24Smaug FlashUnknown86.2%
25DeepSeek V4 ProDeepSeekopen85.8%081359.7
26GLM-5.3Zhipu AIopen85.8%glm-5.3
27GPT-5.6 LunaOpenAI85.6%56.5
28Deepseek v4 Flash VisionDeepSeek85.4%57.4
29Gemini 3.6 FlashGoogle85.2%58.6
30Claude Sonnet 4.6Anthropic84.8%51.8
31Gemini 3.1 ProGoogle84.0%60.7
32Qwen3 7Alibaba83.3%58.9
33GPT-5.2OpenAI83.2%55.5
34Kimi K2.7 CodeMoonshot AIopen82.8%56.2
35Smaug MiniUnknown82.8%
36Gemini 3.5 FlashGoogle82.0%60.4
37GPT-5.4 nanoOpenAI81.1%
38Claude Opus 4.5Anthropic80.1%56.6
39Qwen 3.8 27BAlibabaopen80.0%57.1
40Kimi K2.6Moonshot AIopen79.4%
41GLM-5.2Zhipu AIopen78.6%glm-5.257.4
42GPT-5.2 CodexOpenAI77.7%60.7
43GLM-5.3-FlashZhipu AIopen77.6%61.0
44Ox AlphaUnknown76.6%
45Grok Build 0.1xAI76.4%56.1
46Qwen3.6 PlusAlibabaopen75.8%59.0
47Nemotron 3 Ultra 550B A55BNVIDIAopen74.7%58.3
48MiniMax-M3MiniMaxopen74.5%minimax-m356.9
49GPT-5.4 miniOpenAI71.3%46.0
50Grok 4.3xAI70.8%grok-4.357.8
51Qwen3.6 27BAlibabaopen70.3%53.2
52Gemini 3.5 Flash LiteGoogle60.2%44.0