BenchLeader

TutorBench

Tutoring tasks for high-school and AP subjects. Scale AI.

Published by
Scale AI SEAL
Category
Instruction following
Index weight
0.5
Models
27
Data as of
9 Sept 2026

Scale AI SEAL Leaderboards.

Top 15
  1. 1Muse Spark68.5%
  2. 2GPT-5.4 Pro56.6%
  3. 3Gemini 2.5 Pro55.6%
  4. 4GPT-555.3%
  5. 5o3-pro54.6%
  6. 6Kimi K2.554.6%
  7. 7GPT-5.154.1%
  8. 8Claude Opus 4.653.7%
  9. 9Gemini 3 Pro53.7%
  10. 10Claude Opus 4.653.5%
  11. 11GPT-5.253.5%
  12. 12Gemini 3.1 Pro53.0%
  13. 13o352.8%
  14. 14o352.1%
  15. 15Gemini 3.1 Flash Lite51.5%
27 of 27
#
1Muse SparkMeta68.5%65.4
2GPT-5.4 ProOpenAI56.6%64.2
3Gemini 2.5 ProGoogle55.6%54.1
4GPT-5OpenAI55.3%59.5
5o3-proOpenAI54.6%54.1
6Kimi K2.5Moonshot AIopen54.6%kimi-k2.556.1
7GPT-5.1OpenAI54.1%55.2
8Claude Opus 4.6Anthropic53.7%54.1
9Gemini 3 ProGoogle53.7%61.6
10Claude Opus 4.6Anthropic53.5%55.3
11GPT-5.2OpenAI53.5%61.5
12Gemini 3.1 ProGoogle53.0%63.9
13o3OpenAI52.8%53.6
14o3OpenAI52.1%52.9
15Gemini 3.1 Flash LiteGoogle51.5%54.3
16Claude Opus 4.5Anthropic51.2%60.6
17Claude Opus 4.1Anthropic50.8%58.1
18Claude Opus 4.5Anthropic49.8%58.0
19Claude Opus 4Anthropic49.7%54.4
20GPT 5.1 InstantOpenAI49.1%
21Claude Sonnet 4.5Anthropic49.0%52.8
22Claude Opus 4.1 AnthropicAnthropic47.4%
23Claude 37 SonnetAnthropic46.5%
24Claude Sonnet 4.5Anthropic45.7%52.3
25Claude Opus 4Anthropic45.5%50.7
26Llama 4 MaverickMetaopen40.2%42.6
27GPT-4oOpenAI36.1%gpt-4o42.3