PRBench Legal
Professional reasoning in legal practice, graded by practitioners. Scale AI.
- Published by
- Scale AI SEAL
- Category
- Knowledge
- Index weight
- 0.5
- Models
- 33
- Data as of
- 9 Sept 2026
Scale AI SEAL Leaderboards.
- 1Muse Spark 1.157.0%
- 2Claude Fable 552.6%
- 3Muse Spark52.3%
- 4Claude Opus 4.652.3%
- 5Claude Fable 5.151.6%
- 6GPT-5.6 Sol50.5%
- 7GPT-5 Pro49.9%
- 8o3-pro49.7%
- 9GPT-5.149.3%
- 10GPT-549.0%
- 11Gemini 3.8 Flash48.9%
- 12o348.6%
- 13GPT-6 Astra48.4%
- 14GPT-5.2 Pro45.4%
- 15GPT-5.444.4%
33 of 33
| # | |||||
|---|---|---|---|---|---|
| 1 | 57.0% | Muse Spark 1.1 | 64.9 | – | |
| 2 | 52.6% | claude-fable 5 | 70.4 | – | |
| 3 | 52.3% | – | 65.4 | – | |
| 4 | 52.3% | – | 55.3 | – | |
| 5 | 51.6% | Fable 5.1 | 70.0 | – | |
| 6 | 50.5% | – | 65.5 | – | |
| 7 | 49.9% | – | 60.7 | – | |
| 8 | 49.7% | – | 54.1 | – | |
| 9 | 49.3% | – | 55.2 | – | |
| 10 | 49.0% | gpt-5 | 59.5 | – | |
| 11 | 48.9% | Gemini 3.8 Flash | 62.4 | – | |
| 12 | 48.6% | o3 | 60.3 | – | |
| 13 | 48.4% | GPT 6 Astra | 69.9 | – | |
| 14 | 45.4% | – | – | – | |
| 15 | 44.4% | – | 58.8 | – | |
| 16 | 44.2% | – | 60.6 | – | |
| 17 | 44.0% | – | 63.9 | – | |
| 18 | 43.8% | kimi-k2.5 | 56.1 | – | |
| 19 | 41.4% | – | 54.1 | – | |
| 20 | 41.0% | – | 48.8 | – | |
| 21 | 40.9% | – | 52.8 | – | |
| 22 | 40.8% | – | 52.3 | – | |
| 23 | 40.6% | – | 61.6 | – | |
| 24 | 40.2% | – | 47.6 | – | |
| 25 | 39.5% | – | – | – | |
| 26 | 38.3% | 2507 | – | – | |
| 27 | 38.1% | – | 54.9 | – | |
| 28 | 36.6% | 0528 | 48.9 | – | |
| 29 | 36.5% | gpt-4.1 | 47.3 | – | |
| 30 | 36.4% | – | 48.8 | – | |
| 31 | 34.0% | – | 52.6 | – | |
| 32 | 30.4% | – | 44.5 | – | |
| 33 | 24.8% | – | 38.8 | – |