BenchLeader

MedQA

US medical licensing exam questions. Run by Vals AI.

Published by
Vals AI
Category
Knowledge
Index weight
0.5
Models
90
Data as of
9 Sept 2026

Vals AI (vals.ai).

Top 15
  1. 1o196.5%
  2. 2GPT-5.196.4%
  3. 3Gemini 3.1 Pro96.4%
  4. 4GPT-596.3%
  5. 5GPT-5.496.1%
  6. 6o396.1%
  7. 7GPT-5 mini96.1%
  8. 8Gemini 3 Pro96.0%
  9. 9o4-mini96.0%
  10. 10Claude Opus 4.595.9%
  11. 11Gemini 3 Flash95.8%
  12. 12Claude Opus 4.695.4%
  13. 13Qwen3.5 Plus95.2%
  14. 14o3-mini94.8%
  15. 15Claude Sonnet 4.594.7%
90 of 90
#
1o1OpenAI96.5%44.3
2GPT-5.1OpenAI96.4%53.8
3Gemini 3.1 ProGoogle96.4%60.7
4GPT-5OpenAI96.3%54.5
5GPT-5.4OpenAI96.1%61.3
6o3OpenAI96.1%52.9
7GPT-5 miniOpenAI96.1%52.3
8Gemini 3 ProGoogle96.0%57.0
9o4-miniOpenAI96.0%48.0
10Claude Opus 4.5Anthropic95.9%60.6
11Gemini 3 FlashGoogle95.8%58.5
12Claude Opus 4.6Anthropic95.4%62.3
13Qwen3.5 PlusAlibaba95.2%57.2
14o3-miniOpenAI94.8%47.8
15Claude Sonnet 4.5Anthropic94.7%52.8
16Grok 4.20xAI94.5%54.3
17Kimi K2.5Moonshot AIopen94.4%55.3
18GLM-5Zhipu AIopen94.3%57.0
19GPT-5.2OpenAI94.1%57.3
20DeepSeek V3.2DeepSeekopen93.9%50.1
21GLM-4.7Zhipu AIopen93.7%zai/glm-4.754.9
22Claude Opus 4.1Anthropic93.6%58.1
23GPT-5 nanoOpenAI93.3%45.9
24Claude Opus 4.5Anthropic93.2%58.0
25Gemini 2.5 ProGoogle93.1%54.1
26Claude Opus 4Anthropic92.9%50.7
27Claude Sonnet 4Anthropic92.7%54.0
28Kimi K2 ThinkingMoonshot AIopen92.6%52.8
29MiniMax-M2.5MiniMaxopen92.5%minimax/MiniMax-M2.553.5
30Claude Opus 4.1Anthropic92.5%52.6
31Grok 4xAI92.5%070957.2
32Grok 2xAI92.3%121241.6
33GLM-4.6Zhipu AIopen92.2%zai/glm-4.647.6
34Grok 4.1xAI92.1%55.9
35Grok 4 FastxAI92.1%53.0
36Claude Sonnet 4.6Anthropic92.1%60.3
37Gemini 2.5 Flash 09Google91.4%preview, 202550.7
38gpt-oss-120bOpenAIopen91.4%47.6
39GPT-4.1OpenAI91.2%46.2
40Gemini 2.5 Flash 09Google91.2%thinking, preview, 202552.5
41MiniMax-M2MiniMaxopen91.2%minimax/MiniMax-M2.155.1
42Gemini 2.5 FlashGoogle91.0%48.1
43DeepSeek R1DeepSeekopen90.8%fireworks/deepseek-r148.9
44Qwen3 235B A22BAlibabaopen90.6%48.7
45Claude Sonnet 4Anthropic90.3%49.5
46Claude 3.7 SonnetAnthropic90.2%52.1
47o1-miniOpenAI90.2%
48Grok 3 Mini FastxAI90.1%53.5
49GLM-4.5Zhipu AIopen90.0%zai/glm-4.550.2
50Magistral MediumMistral AIopen89.5%medium, 250944.1
51Gemini 2.5 Flash Lite 09Google88.9%48.8
52Grok 3 Mini FastxAI88.7%50.3
53Llama Meta Llama 3.1 405B TurboMeta88.2%
54GPT-4oOpenAI88.2%41.1
55Qwen3 MaxAlibaba87.4%51.8
56Qwen3 MaxAlibaba87.4%52.7
57Gemini 2.5 FlashGoogle86.7%48.8
58Llama Meta Llama 3.1 70B TurboMeta84.8%
59GPT-4.1 miniOpenAI84.6%45.9
60Kimi K2Moonshot AIopen84.0%48.8