BenchLeader

MCP Atlas

Real-world tool use through the Model Context Protocol. Scale AI.

Published by
Scale AI SEAL
Category
Agents & tools
Index weight
1.0
Models
30
Data as of
9 Sept 2026

Scale AI SEAL Leaderboards.

30 of 30
#
1Muse Spark 1.1Meta88.1%Muse Spark 1.164.9
2Claude Fable 5.1Anthropic87.2%70.0
3Claude Opus 5Anthropic85.8%66.3
4Gemini 3.5 FlashGoogle83.6%60.4
5Claude Fable 5Anthropic83.3%Claude Fable 570.4
6Kimi K3Moonshot AIopen82.3%62.7
7Muse SparkMeta82.2%65.4
8Claude Opus 4.8Anthropic82.2%59.4
9GPT-5.6OpenAI81.8%
10Inkling-SmallThinking Machinesopen79.2%55.0
11Claude Opus 4.7Anthropic79.1%59.3
12Gemini 3.1 ProGoogle78.2%60.7
13GLM-5.2Zhipu AIopen77.8%glm-5p257.4
14Claude Opus 4.6Anthropic76.8%54.1
15GLM-5.1Zhipu AIopen75.6%glm-5p160.1
16GPT-5.5OpenAI75.3%63.7
17GPT-5.4OpenAI70.6%61.3
18Gemini 3 ProGoogle70.3%61.6
19Claude Opus 4.5Anthropic69.8%56.6
20Claude Sonnet 4.6Anthropic69.5%60.3
21GPT-5.2OpenAI67.6%57.3
22Kimi K2.5Moonshot AIopen64.4%kimi-k2p556.1
23Gemini 3 FlashGoogle62.0%56.6
24Claude Sonnet 4.5Anthropic59.5%52.8
25GLM-4.7Zhipu AIopen58.1%glm-4p754.9
26Gemini 3.1 Flash LiteGoogle57.1%49.1
27GPT-5.4 miniOpenAI56.7%46.0
28GPT-5.1OpenAI50.1%53.8
29o3-proOpenAI44.5%54.1
30Claude Haiku 4.5Anthropic40.2%47.9