BenchLeader

LiveBench Language

LiveBench language category.

Published by
LiveBench
Category
Instruction following
Index weight
Reference only
Models
52
Data as of
9 Sept 2026

LiveBench (livebench.ai), White et al. 2024.

52 of 52
#
1Claude Fable 5Anthropic90.7%65.8
2Claude Fable 5.1Anthropic89.5%70.2
3GPT-6 AstraOpenAI89.4%70.6
4Claude Opus 5Anthropic88.7%66.8
5Gemini 3.8 FlashGoogle87.8%60.1
6GPT-5.6 SolOpenAI87.7%65.5
7GPT-5.5OpenAI87.4%63.7
8Kimi K3Moonshot AIopen85.5%kimi-k366.5
9Gemini 3.7 FlashGoogle85.5%60.8
10Gemini 3.1 ProGoogle85.4%60.7
11Gemini 3.5 FlashGoogle84.6%60.4
12Gemini 3.6 FlashGoogle83.9%58.6
13Grok 4.6xAI83.7%grok-4.663.6
14Claude Opus 4.6Anthropic83.3%61.3
15GPT-5.6 TerraOpenAI82.9%58.0
16Grok 4.5xAI82.8%grok-4.563.4
17Muse Spark 1.3Meta82.8%63.9
18GPT-5.4OpenAI82.6%61.3
19DeepSeek V4 ProDeepSeekopen82.1%081359.7
20Claude Opus 4.5Anthropic81.3%56.6
21Deepseek v4 Flash VisionDeepSeek80.4%57.4
22GLM-5.3Zhipu AIopen79.9%glm-5.3
23GPT-5.2OpenAI79.8%55.5
24Qwen3 7Alibaba79.7%58.9
25Qwen3 8Alibaba79.7%63.9
26Claude Opus 4.8Anthropic79.7%59.4
27Smaug FlashUnknown79.2%
28DeepSeek V4 FlashDeepSeekopen79.2%073159.1
29Muse Spark 1.2Meta78.6%61.3
30Claude Opus 4.7Anthropic77.9%57.2
31Kimi K2.7 CodeMoonshot AIopen77.9%56.2
32GLM-5.3-FlashZhipu AIopen77.3%61.0
33Smaug MiniUnknown77.0%
34MiniMax-M3MiniMaxopen76.8%minimax-m356.9
35GLM-5.2Zhipu AIopen76.2%glm-5.257.4
36Claude Sonnet 4.6Anthropic76.1%51.8
37Kimi K2.6Moonshot AIopen75.1%
38Qwen3.6 PlusAlibabaopen75.0%59.0
39Claude Sonnet 5Anthropic75.0%57.3
40Qwen3.8-Flash-NextAlibabaopen74.6%59.3
41Qwen 3.8 27BAlibabaopen74.3%57.1
42Muse Spark 1.1Meta74.3%56.4
43GPT-5.2 CodexOpenAI73.7%60.7
44Grok 4.3xAI73.6%grok-4.357.8
45GPT-5.6 LunaOpenAI72.6%56.5
46Grok Build 0.1xAI72.5%56.1
47Gemini 3.5 Flash LiteGoogle71.8%44.0
48GPT-5.4 miniOpenAI71.0%46.0
49Nemotron 3 Ultra 550B A55BNVIDIAopen70.8%58.3
50Ox AlphaUnknown66.1%
51Qwen3.6 27BAlibabaopen63.3%53.2
52GPT-5.4 nanoOpenAI62.5%