BenchLeader

MMMU (validation)

Official MMMU validation-set leaderboard.

Published by
MMMU
Category
Multimodal
Index weight
0.5
Models
46
Data as of
9 Sept 2026

MMMU (Yue et al.).

46 of 46
#
1GPT-5.1OpenAI85.4%GPT-5.159.4
2Gemini 2.5 Deep ThinkGoogle84.0%
3o3OpenAI82.9%o360.3
4o4-miniOpenAI81.6%54.9
5Claude Opus 4.5Anthropic80.7%Claude Opus 4.558.0
6Gemini 2.5 FlashGoogle79.7%48.8
7Gemini 2.5 ProGoogle79.6%54.1
8Qwen3-VL 235B-A22BAlibabaopen78.7%49.6
9o1OpenAI78.2%o153.2
10Grok 3xAI78.0%50.0
11Claude Sonnet 4.5Anthropic77.8%Claude Sonnet 4.552.3
12Claude Opus 4.1Anthropic77.1%Claude Opus 4.152.6
13Claude Opus 4Anthropic76.5%Claude Opus 450.7
14Claude 3.7 SonnetAnthropic75.0%Claude 3.7 Sonnet49.8
15Seed 1.6ByteDance74.8%
16GPT-4.5OpenAI74.4%GPT‑4.549.6
17Claude Sonnet 4Anthropic74.4%Claude Sonnet 449.5
18Llama 4 MaverickMetaopen73.4%Llama 4 Maverick42.6
19Gemini 2.0 ProGoogle72.7%Gemini 2.0 Pro47.0
20Gemini 2.0 FlashGoogle71.7%Gemini 2.0 Flash42.3
21GPT-4oOpenAI70.7%112042.3
22Llama 4 ScoutMetaopen69.4%Llama 4 Scout39.7
23Claude 3.5 SonnetAnthropic68.3%Claude 3.5 Sonnet45.1
24Gemini 2.0 Flash-LiteGoogle68.0%47.0
25Nova PremierAmazon68.0%45.3
26Gemini 1.5 ProGoogle65.8%080142.9
27Gemma 3 27BGoogleopen64.9%39.7
28Qwen2 Vl 72BAlibaba64.5%
29Qwen2.5-VL 72B InstructAlibabaopen64.5%
30Nova ProAmazon62.0%41.0
31Llama 3.2 90BMeta60.3%Llama 3.2 90B
32Gemma 3 12B ITNVIDIAopen59.6%37.2
33Claude 3 OpusAnthropic59.4%Claude 3 Opus38.9
34GPT-4o miniOpenAI59.4%GPT-4o mini35.8
35Qwen2.5-VL 7B InstructAlibabaopen58.6%
36Reka CoreReka56.3%
37Gemini 1.5 FlashGoogle56.1%Gemini 1.5 Flash
38Reka FlashReka53.3%43.1
39Claude 3 SonnetAnthropic53.1%Claude 3 Sonnet37.9
40Qwen VlAlibaba51.4%
41Claude 3 HaikuAnthropic50.2%Claude 3 Haiku36.9
42Minicpm V 2.6OpenBMB / LLaVA49.8%MiniCPM-V 2.6
43Gemma 3 4B ITNVIDIAopen48.8%34.5
44Gemini 1.0 ProGoogle47.9%Gemini 1.0 Pro
45Qwen-VL PlusAlibaba45.2%
46Phi 3.5 VisionMicrosoft43.0%