BenchLeader

MultiNRC

Native multilingual reasoning across languages. Scale AI.

Published by
Scale AI SEAL
Category
Knowledge
Index weight
0.5
Models
42
Data as of
9 Sept 2026

Scale AI SEAL Leaderboards.

42 of 42
#
1Muse Spark 1.1Meta65.6%Muse Spark 1.164.9
2GPT-5 ProOpenAI65.2%60.7
3Gemini 3.1 ProGoogle64.7%63.9
4GPT-5.4 ProOpenAI62.3%64.2
5Muse SparkMeta59.0%65.4
6Gemini 3 ProGoogle59.0%61.6
7GPT-5.4OpenAI58.3%
8Claude Opus 4.6Anthropic57.1%54.1
9GPT-5OpenAI52.1%59.5
10GPT-5.1OpenAI49.0%55.2
11o3-proOpenAI49.0%54.4
12Claude Opus 4.5Anthropic48.6%60.6
13Claude Opus 4.6Anthropic48.3%55.3
14o3OpenAI45.5%52.9
15Gemini 2.5 ProGoogle45.1%54.1
16o3OpenAI44.5%53.6
17GPT-5.2OpenAI42.2%61.5
18Claude Opus 4.5Anthropic41.2%58.0
19Claude Opus 4.1Anthropic38.4%58.1
20Claude Sonnet 4.5Anthropic35.8%52.8
21Kimi K2.5Moonshot AIopen35.2%kimi-k2.556.1
22Claude Opus 4Anthropic33.9%54.4
23Claude Opus 4.1Anthropic29.7%52.6
24Claude Opus 4Anthropic29.0%50.7
25Claude Sonnet 4.5Anthropic28.1%52.3
26Claude 3.7 SonnetAnthropic27.8%52.1
27DeepSeek R1DeepSeekopen27.6%052848.9
28Qwen3 235B A22BAlibabaopen27.1%thinking, 250751.7
29Gemini 3.1 Flash LiteGoogle25.0%54.3
30GPT-5 miniOpenAI23.9%55.8
31o4-miniOpenAI22.2%48.0
32GPT-4.1OpenAI21.2%GPT-4.147.3
33Kimi K2Moonshot AIopen18.5%48.8
34Claude Sonnet 4Anthropic18.4%49.5
35GPT 5.1 InstantOpenAI18.3%
36Qwen3 235B A22BAlibabaopen17.6%48.7
37GLM-4.5Zhipu AIopen17.4%glm-4p550.2
38gpt-oss-120bOpenAIopen15.2%47.6
39GPT-4oOpenAI12.4%GPT-4o42.3
40gpt-oss-20bOpenAIopen10.4%47.1
41GLM-4.5-AirZhipu AIopen10.4%46.0
42Llama 4 MaverickMetaopen8.4%42.6