BenchLeader

ProofBench

Full written proofs graded for rigour (Vals AI).

Published by
Vals AIdata via Epoch AI Benchmarking Hub
Category
Maths
Index weight
0.5
Models
61
Data as of
9 Sept 2026

CC BY 4.0 — Epoch AI, ‘AI Benchmarking Hub’, epoch.ai/benchmarks. Mirrored boards credit their original publishers.

61 of 61
#
1Claude Fable 5.1Anthropic100.0%70.2
2GPT-6 AstraOpenAI99.0%69.9
3Claude Opus 5Anthropic99.0%66.8
4Claude Fable 5Anthropic95.0%65.8
5Kimi K3Moonshot AIopen87.0%kimi/kimi-k366.5
6GPT-5.6 SolOpenAI83.0%65.5
7Claude Sonnet 5Anthropic77.0%50.7
8GPT-5.6 TerraOpenAI74.0%64.2
9Claude Opus 4.8Anthropic69.0%59.4
10GPT-5.6 LunaOpenAI60.0%56.5
11Gemini 3.7 FlashGoogle58.0%61.7
12Qwen3 8Alibaba58.0%
13GPT-5.4OpenAI56.0%61.3
14DeepSeek V4 FlashDeepSeekopen56.0%073159.1
15Claude Opus 4.7Anthropic54.0%59.3
16Grok 4.6xAI51.0%grok/grok-4.663.6
17GPT-5.5OpenAI50.0%63.7
18DeepSeek V4 ProDeepSeekopen50.0%081359.7
19Claude Opus 4.6Anthropic50.0%54.1
20GLM-5.3Zhipu AIopen49.0%59.9
21Gemini 3.8 FlashGoogle48.0%62.4
22Claude Sonnet 4.6Anthropic45.0%49.7
23Muse Spark 1.2Meta43.0%meta/muse_spark_1_262.6
24Muse Spark 1.1Meta39.0%meta/muse_spark_1_164.9
25Gemini 3.6 FlashGoogle36.0%60.7
26Claude Opus 4.5Anthropic36.0%58.0
27GLM-5.2Zhipu AIopen35.0%57.6
28Gemini 3.5 FlashGoogle31.0%60.4
29Grok 4.5xAI31.0%54.2
30Gemini 3.1 ProGoogle26.0%63.9
31Qwen3 7Alibaba26.0%58.9
32GLM-5.1Zhipu AIopen22.2%zai/glm-5.160.1
33MiMo-V2.5-ProXiaomiopen22.0%59.0
34GLM-5.3-FlashZhipu AIopen21.0%55.6
35GPT-5.4 miniOpenAI21.0%46.0
36Gemini 3 ProGoogle20.0%61.6
37Claude Sonnet 4.5Anthropic19.0%52.3
38MiniMax-M3MiniMaxopen18.0%minimax/MiniMax-M356.9
39GPT-5OpenAI18.0%54.5
40Muse SparkMeta17.0%65.4
41Kimi K2.6Moonshot AIopen16.0%kimi/kimi-k2.660.6
42Qwen 3.8 27BAlibabaopen16.0%57.1
43DeepSeek V4 ProDeepSeekopen16.0%56.1
44GPT-5.2OpenAI15.0%57.3
45Gemini 3 FlashGoogle15.0%56.6
46Grok 4.20xAI14.0%54.3
47Gemini 3.5 Flash LiteGoogle13.0%53.5
48GPT-5 nanoOpenAI12.0%45.9
49Grok 4.3xAI11.0%50.1
50GPT-5 miniOpenAI9.0%52.3
51Mistral Medium (latest)Mistral AI9.0%medium, 260445.8
52GPT-5.1-Codex-MaxOpenAI9.0%
53Inkling-SmallThinking Machinesopen6.0%55.0
54GLM-4.7Zhipu AIopen6.0%zai/glm-4.754.9
55GPT-5.4 nanoOpenAI5.0%48.3
56Grok 4.1xAI4.0%55.9
57MiniMax-M2.5MiniMaxopen4.0%minimax/MiniMax-M2.553.5
58MiniMax-M2.7MiniMaxopen3.0%minimax/MiniMax-M2.756.5
59Nemotron 3 UltraNVIDIA2.0%48.2
60Laguna M.1Poolsideopen0.0%poolside/laguna-m.137.5