MultiChallenge
Multi-turn instruction following under realistic conversation constraints. Scale AI.
- Published by
- Scale AI SEAL
- Category
- Instruction following
- Index weight
- 1.0
- Models
- 29
- Data as of
- 9 Sept 2026
Scale AI SEAL Leaderboards.
- 1Muse Spark75.5%
- 2Muse Spark 1.175.3%
- 3Gemini 3.1 Pro71.4%
- 4GPT-5.4 Pro69.2%
- 5Gemini 3 Pro65.7%
- 6GPT-5.163.4%
- 7GPT-563.2%
- 8o3-pro62.4%
- 9Kimi K2.561.4%
- 10Gemini 3.1 Flash Lite60.6%
- 11GPT-5 mini59.0%
- 12Claude Opus 4.559.0%
- 13Claude Opus 458.6%
- 14Claude Opus 4.157.2%
- 15Claude Sonnet 457.1%
29 of 29
| # | |||||
|---|---|---|---|---|---|
| 1 | 75.5% | – | 65.4 | – | |
| 2 | 75.3% | Muse Spark 1.1 | 64.9 | – | |
| 3 | 71.4% | – | 63.9 | – | |
| 4 | 69.2% | – | 64.2 | – | |
| 5 | 65.7% | – | 61.6 | – | |
| 6 | 63.4% | – | 55.2 | – | |
| 7 | 63.2% | – | – | – | |
| 8 | 62.4% | – | 54.4 | – | |
| 9 | 61.4% | kimi-k2.5 | 56.1 | – | |
| 10 | 60.6% | – | 54.3 | – | |
| 11 | 59.0% | – | – | – | |
| 12 | 59.0% | – | 60.6 | – | |
| 13 | 58.6% | – | 54.4 | – | |
| 14 | 57.2% | – | 58.1 | – | |
| 15 | 57.1% | – | 54.0 | – | |
| 16 | 56.6% | – | 52.9 | – | |
| 17 | 56.0% | – | 55.3 | – | |
| 18 | 55.4% | – | 52.8 | – | |
| 19 | 55.3% | – | 52.8 | – | |
| 20 | 53.6% | – | 54.1 | – | |
| 21 | 51.6% | – | 52.1 | – | |
| 22 | 51.2% | – | – | – | |
| 23 | 50.5% | – | 48.0 | – | |
| 24 | 45.3% | – | 47.6 | – | |
| 25 | 44.9% | – | 48.0 | – | |
| 26 | 41.2% | – | 48.7 | – | |
| 27 | 39.4% | gpt-4.1 | 47.3 | – | |
| 28 | 37.1% | – | 54.1 | – | |
| 29 | 36.4% | – | 42.3 | – |