BenchLeader

MultiChallenge

Multi-turn instruction following under realistic conversation constraints. Scale AI.

Published by
Scale AI SEAL
Category
Instruction following
Index weight
1.0
Models
29
Data as of
9 Sept 2026

Scale AI SEAL Leaderboards.

29 of 29
#
1Muse SparkMeta75.5%65.4
2Muse Spark 1.1Meta75.3%Muse Spark 1.164.9
3Gemini 3.1 ProGoogle71.4%63.9
4GPT-5.4 ProOpenAI69.2%64.2
5Gemini 3 ProGoogle65.7%61.6
6GPT-5.1OpenAI63.4%55.2
7GPT-5OpenAI63.2%
8o3-proOpenAI62.4%54.4
9Kimi K2.5Moonshot AIopen61.4%kimi-k2.556.1
10Gemini 3.1 Flash LiteGoogle60.6%54.3
11GPT-5 miniOpenAI59.0%
12Claude Opus 4.5Anthropic59.0%60.6
13Claude Opus 4Anthropic58.6%54.4
14Claude Opus 4.1Anthropic57.2%58.1
15Claude Sonnet 4Anthropic57.1%54.0
16o3OpenAI56.6%52.9
17Claude Opus 4.6Anthropic56.0%55.3
18Kimi K2 ThinkingMoonshot AIopen55.4%52.8
19Claude Sonnet 4.5Anthropic55.3%52.8
20Gemini 2.5 ProGoogle53.6%54.1
21Claude 3.7 SonnetAnthropic51.6%52.1
22GPT 5.1 InstantOpenAI51.2%
23Claude Haiku 4.5Anthropic50.5%48.0
24gpt-oss-120bOpenAIopen45.3%47.6
25o4-miniOpenAI44.9%48.0
26Qwen3 235B A22BAlibabaopen41.2%48.7
27GPT-4.1OpenAI39.4%gpt-4.147.3
28Claude Opus 4.6Anthropic37.1%54.1
29Gemini 2.0 FlashGoogle36.4%42.3