BenchLeader

HiL-Bench

Whether agents notice information gaps and ask clarifying questions. Scale AI.

Published by
Scale AI SEAL
Category
Agents & tools
Index weight
0.5
Models
17
Data as of
9 Sept 2026

Scale AI SEAL Leaderboards.

17 of 17
#
1Claude Fable 5.1Anthropic61.5%Claude Fable 5.170.0
2Claude Opus 5Anthropic57.0%Claude Opus 570.0
3Claude Fable 5Anthropic56.3%Claude Fable 570.4
4GLM-5.2Zhipu AIopen43.7%GLM 5.257.4
5Claude Opus 4.7Anthropic41.7%Claude Opus 4.765.5
6Gemini 3.8 FlashGoogle41.5%Gemini 3.8 Flash62.4
7GPT-5.5OpenAI39.7%GPT-5.566.6
8Claude Opus 4.6Anthropic38.3%Claude Opus 4.663.1
9Claude Opus 4.8Anthropic35.3%Claude Opus 4.864.7
10Gemini 3.1 ProGoogle35.3%Gemini 3.1 Pro63.9
11GPT-5.6 SolOpenAI32.3%GPT 5.6 Sol65.3
12Gemini 3.5 FlashGoogle27.7%Gemini 3.5 Flash60.7
13Grok 4.20xAI20.0%Grok-4.2057.9
14Kimi K2.6Moonshot AIopen18.7%Kimi-k2.660.6
15GPT-5.4OpenAI9.7%GPT-5.463.4
16MiniMax-M2.5MiniMaxopen6.3%Minimax-M2.553.5
17GPT-5.3 CodexOpenAI4.3%62.4