BenchLeader

LiveBench Mathematics

LiveBench mathematics category.

Published by
LiveBench
Category
Maths
Index weight
Reference only
Models
52
Data as of
9 Sept 2026

LiveBench (livebench.ai), White et al. 2024.

52 of 52
#
1Claude Fable 5.1Anthropic97.0%70.2
2GPT-6 AstraOpenAI96.8%70.6
3GPT-5.6 SolOpenAI96.2%65.5
4Claude Fable 5Anthropic96.0%65.8
5Muse Spark 1.3Meta96.0%63.9
6GPT-5.5OpenAI95.9%63.7
7Claude Opus 5Anthropic95.7%66.8
8DeepSeek V4 ProDeepSeekopen95.1%081359.7
9GPT-5.6 TerraOpenAI94.9%58.0
10Claude Opus 4.8Anthropic94.3%59.4
11GPT-5.4OpenAI94.2%61.3
12Gemini 3.7 FlashGoogle93.5%60.8
13GPT-5.2OpenAI93.2%55.5
14Claude Sonnet 5Anthropic92.9%57.3
15Claude Opus 4.7Anthropic92.8%57.2
16Grok 4.6xAI92.6%grok-4.663.6
17Gemini 3.8 FlashGoogle91.6%60.1
18Qwen3 8Alibaba91.3%63.9
19Muse Spark 1.2Meta91.2%61.3
20Gemini 3.1 ProGoogle91.0%60.7
21GPT-5.4 nanoOpenAI91.0%
22Grok 4.5xAI90.8%grok-4.563.4
23Claude Opus 4.5Anthropic90.4%56.6
24Smaug FlashUnknown90.1%
25GLM-5.2Zhipu AIopen89.8%glm-5.257.4
26Smaug MiniUnknown89.7%
27Claude Opus 4.6Anthropic89.3%61.3
28GPT-5.2 CodexOpenAI88.8%60.7
29Nemotron 3 Ultra 550B A55BNVIDIAopen88.7%58.3
30Gemini 3.5 FlashGoogle88.2%60.4
31GLM-5.3Zhipu AIopen87.9%glm-5.3
32Deepseek v4 Flash VisionDeepSeek87.8%57.4
33GPT-5.6 LunaOpenAI87.2%56.5
34Muse Spark 1.1Meta87.1%56.4
35Claude Sonnet 4.6Anthropic87.0%51.8
36DeepSeek V4 FlashDeepSeekopen86.8%073159.1
37Gemini 3.6 FlashGoogle86.4%58.6
38Qwen 3.8 27BAlibabaopen86.2%57.1
39Qwen3.8-Flash-NextAlibabaopen85.8%59.3
40Qwen3 7Alibaba85.3%58.9
41Kimi K3Moonshot AIopen84.4%kimi-k366.5
42Grok 4.3xAI84.3%grok-4.357.8
43Kimi K2.6Moonshot AIopen84.3%
44Qwen3.6 PlusAlibabaopen83.7%59.0
45GLM-5.3-FlashZhipu AIopen81.2%61.0
46Qwen3.6 27BAlibabaopen79.9%53.2
47Kimi K2.7 CodeMoonshot AIopen79.6%56.2
48GPT-5.4 miniOpenAI78.5%46.0
49Grok Build 0.1xAI78.4%56.1
50Ox AlphaUnknown77.5%
51MiniMax-M3MiniMaxopen77.0%minimax-m356.9
52Gemini 3.5 Flash LiteGoogle73.7%44.0