BenchLeader

PRBench Legal

Professional reasoning in legal practice, graded by practitioners. Scale AI.

Published by
Scale AI SEAL
Category
Knowledge
Index weight
0.5
Models
33
Data as of
9 Sept 2026

Scale AI SEAL Leaderboards.

33 of 33
#
1Muse Spark 1.1Meta57.0%Muse Spark 1.164.9
2Claude Fable 5Anthropic52.6%claude-fable 570.4
3Muse SparkMeta52.3%65.4
4Claude Opus 4.6Anthropic52.3%55.3
5Claude Fable 5.1Anthropic51.6%Fable 5.170.0
6GPT-5.6 SolOpenAI50.5%65.5
7GPT-5 ProOpenAI49.9%60.7
8o3-proOpenAI49.7%54.1
9GPT-5.1OpenAI49.3%55.2
10GPT-5OpenAI49.0%gpt-559.5
11Gemini 3.8 FlashGoogle48.9%Gemini 3.8 Flash62.4
12o3OpenAI48.6%o360.3
13GPT-6 AstraOpenAI48.4%GPT 6 Astra69.9
14GPT-5.2 ProOpenAI45.4%
15GPT-5.4OpenAI44.4%58.8
16Claude Opus 4.5Anthropic44.2%60.6
17Gemini 3.1 ProGoogle44.0%63.9
18Kimi K2.5Moonshot AIopen43.8%kimi-k2.556.1
19Gemini 2.5 ProGoogle41.4%54.1
20Gemini 2.5 FlashGoogle41.0%48.8
21Kimi K2 ThinkingMoonshot AIopen40.9%52.8
22Claude Sonnet 4.5Anthropic40.8%52.3
23Gemini 3 ProGoogle40.6%61.6
24gpt-oss-120bOpenAIopen40.2%47.6
25Mistral Medium (latest)Mistral AI39.5%
26Qwen Qwen3 235B A22bAlibabaopen38.3%2507
27o4-miniOpenAI38.1%54.9
28DeepSeek R1DeepSeekopen36.6%052848.9
29GPT-4.1OpenAI36.5%gpt-4.147.3
30Kimi K2Moonshot AIopen36.4%48.8
31Claude Opus 4.1Anthropic34.0%52.6
32GPT-4.1 miniOpenAI30.4%44.5
33Llama 4 Maverick BasicMeta24.8%38.8