BenchLeader

PRBench Finance

Professional reasoning in finance, graded by practitioners. Scale AI.

Published by
Scale AI SEAL
Category
Knowledge
Index weight
0.5
Models
33
Data as of
9 Sept 2026

Scale AI SEAL Leaderboards.

33 of 33
#
1Muse Spark 1.1Meta55.0%Muse Spark 1.164.9
2Claude Fable 5Anthropic53.9%claude-fable 570.4
3Claude Opus 4.6Anthropic53.3%55.3
4Muse SparkMeta52.4%65.4
5GPT-5OpenAI51.3%gpt-559.5
6GPT-5 ProOpenAI51.1%60.7
7Claude Fable 5.1Anthropic50.8%Fable 5.170.0
8GPT-5.6 SolOpenAI50.5%65.5
9Gemini 3.8 FlashGoogle49.5%Gemini 3.8 Flash62.4
10o3-proOpenAI49.1%54.1
11GPT-5.1OpenAI48.0%55.2
12o3OpenAI47.7%o360.3
13GPT-6 AstraOpenAI47.5%GPT 6 Astra69.9
14Kimi K2.5Moonshot AIopen46.5%kimi-k2.556.1
15GPT-5.2 ProOpenAI46.3%
16Claude Opus 4.5Anthropic46.2%60.6
17GPT-5.4OpenAI45.6%58.8
18gpt-oss-120bOpenAIopen43.8%47.6
19Claude Sonnet 4.5Anthropic43.8%52.3
20Kimi K2 ThinkingMoonshot AIopen43.4%52.8
21Gemini 3.1 ProGoogle41.9%63.9
22Mistral Medium (latest)Mistral AI39.4%
23o4-miniOpenAI39.2%54.9
24Gemini 3 ProGoogle39.2%61.6
25Qwen Qwen3 235B A22bAlibabaopen39.1%2507
26Gemini 2.5 ProGoogle38.9%54.1
27Gemini 2.5 FlashGoogle38.4%48.8
28Kimi K2Moonshot AIopen38.3%48.8
29Claude Opus 4.1Anthropic35.1%52.6
30GPT-4.1OpenAI34.3%gpt-4.147.3
31DeepSeek R1DeepSeekopen32.7%052848.9
32GPT-4.1 miniOpenAI30.4%44.5
33Llama 4 Maverick BasicMeta22.4%38.8