BenchLeader

Terminal-Bench 2.1 (Vals)

Terminal-Bench 2.1 in Vals AI's fixed harness.

Published by
Vals AI
Category
Agents & tools
Index weight
0.5
Models
61
Data as of
9 Sept 2026

Vals AI (vals.ai).

61 of 61
#
1GPT-6 AstraOpenAI87.3%70.6
2GPT-5.6 SolOpenAI85.8%65.5
3Claude Fable 5.1Anthropic85.0%70.0
4Claude Opus 5Anthropic84.6%70.0
5Gemini 3.8 FlashGoogle81.3%60.1
6Kimi K3Moonshot AIopen80.9%kimi/kimi-k366.5
7Claude Fable 5Anthropic80.5%70.4
8GPT-5.6 LunaOpenAI79.0%56.5
9Muse Spark 1.3Meta79.0%
10Grok 4.6xAI78.3%58.7
11Gemini 3.7 FlashGoogle77.5%60.8
12GPT-5.6 TerraOpenAI77.5%58.0
13GPT-5.5OpenAI76.4%66.3
14Claude Sonnet 5Anthropic74.5%61.2
15Gemini 3.5 FlashGoogle74.2%60.4
16Gemini 3.6 FlashGoogle73.8%58.6
17Muse Spark 1.3Meta72.3%63.9
18Claude Opus 4.8Anthropic71.9%64.7
19GLM-5.3Zhipu AIopen71.5%59.9
20Gemini 3.1 ProGoogle70.8%60.7
21Muse Spark 1.2Meta69.7%61.3
22Claude Opus 4.8 Claude CodeAnthropic69.7%
23Muse Spark 1.1Meta69.3%56.4
24Claude Opus 4.7Anthropic68.5%65.5
25GLM-5.2Zhipu AIopen67.8%57.6
26Grok 4.5xAI67.8%54.2
27Qwen3 8Alibaba67.4%63.9
28DeepSeek V4 FlashDeepSeekopen67.0%073159.1
29Kimi K2.7 CodeMoonshot AIopen67.0%56.2
30GLM-5.3-FlashZhipu AIopen62.9%55.6
31Qwen3 7Alibaba61.0%58.9
32Qwen 3.8 27BAlibabaopen58.4%52.0
33Composer 2.5Cursor58.4%cursor/composer-2.5
34Claude Sonnet 4.6Anthropic57.3%60.3
35MiMo-V2.5-ProXiaomiopen57.3%59.0
36GPT 5.5 CodexOpenAI57.3%
37GPT 5.5 FactoryOpenAI57.3%
38GLM-5.1Zhipu AIopen56.9%zai/glm-5.160.1
39Inkling-SmallThinking Machinesopen55.1%55.0
40DeepSeek V4 ProDeepSeekopen54.7%max, 081356.1
41GPT-5.4 miniOpenAI54.7%52.9
42Gemini 3 FlashGoogle53.9%58.5
43Kimi K2.6Moonshot AIopen53.6%kimi/kimi-k2.660.6
44MiniMax-M3MiniMaxopen53.6%minimax/MiniMax-M356.9
45Qwen3.6 PlusAlibabaopen53.2%59.0
46Qwen3.7 PlusAlibaba52.8%59.7
47Nemotron 3 Ultra 550B A55BNVIDIAopen50.9%58.3
48DeepSeek V4 ProDeepSeekopen50.2%59.7
49Ling 3.0 FlashInclusionAIopen50.2%260754.0
50Gemini 3.5 Flash LiteGoogle50.2%44.0
51MiniMax-M2.7MiniMaxopen48.7%minimax/MiniMax-M2.756.5
52Grok 4.20xAI44.2%54.3
53Claude Haiku 4.5Anthropic43.8%48.0
54Kimi K2.5Moonshot AIopen42.0%55.3
55Grok 4.3xAI42.0%50.1
56GPT-5.4 nanoOpenAI41.6%48.3
57Mistral Medium 3.5Mistral AI39.0%
58Gemini 3.1 Flash LiteGoogle34.1%49.1
59Laguna M.1Poolsideopen34.1%poolside/laguna-m.137.5
60Laguna XS.2Poolside25.8%poolside/laguna-xs.236.3