BenchLeader

Terminal-Bench Hard

Hard subset of Terminal-Bench in a fixed harness. Run by Artificial Analysis.

Published by
Artificial Analysis
Category
Agents & tools
Index weight
0.5
Models
387
Data as of
9 Sept 2026

Source: Artificial Analysis (artificialanalysis.ai). Data taken from the public leaderboard.

387 of 387
#
1GPT-5.6 SolOpenAI65.9%GPT-5.6 Sol (max)65.3
2Claude Fable 5Anthropic62.9%Claude Fable 5 (with fallback)70.4
3GPT-5.6 SolOpenAI62.9%66.0
4GPT-5.6 TerraOpenAI62.9%64.2
5GPT-5.6 SolOpenAI62.1%68.0
6GPT-5.6 SolOpenAI61.4%67.5
7GPT-5.5OpenAI60.6%GPT-5.5 (xhigh)66.6
8GPT-5.6 SolOpenAI60.6%64.6
9GPT-5.5OpenAI59.9%66.3
10Claude Opus 4.8Anthropic58.3%Claude Opus 4.8 (max)64.7
11GPT-5.5OpenAI57.6%64.9
12GPT-5.4OpenAI57.6%GPT-5.4 (xhigh)63.4
13GPT-5.6 TerraOpenAI57.6%63.1
14GPT-5.6 TerraOpenAI57.6%GPT-5.6 Terra (max)62.3
15Claude Opus 4.7Anthropic54.5%60.1
16Gemini 3.1 ProGoogle53.8%63.9
17GPT-5.3 CodexOpenAI53.0%GPT-5.3 Codex (xhigh)62.4
18Claude Sonnet 4.6Anthropic53.0%60.3
19GPT-5.5OpenAI52.3%62.3
20GPT-5.4 miniOpenAI52.3%GPT-5.4 mini (xhigh)54.8
21Claude Opus 4.7Anthropic51.5%Claude Opus 4.7 (max)65.5
22Qwen3 7Alibaba50.8%58.9
23GLM-5.2Zhipu AIopen50.8%GLM-5.2 (max)57.4
24KAT-Coder-Pro V2KwaiKAT49.2%58.1
25GPT-5.5OpenAI49.2%56.2
26Claude Opus 4.6Anthropic48.5%63.1
27GPT-5.2OpenAI47.0%GPT-5.2 (xhigh)61.5
28Claude Opus 4.5Anthropic47.0%60.6
29Qwen3.7 PlusAlibaba47.0%Qwen3.7 Plus59.7
30DeepSeek V4 ProDeepSeekopen46.2%042459.7
31Gemini 3.5 FlashGoogle46.2%57.3
32Muse SparkMeta45.5%65.4
33GPT-5.1OpenAI45.5%GPT-5.1 (high)59.4
34Kimi K2.7 CodeMoonshot AIopen44.7%Kimi K2.7 Code56.2
35Qwen3 6Alibaba43.9%62.0
36Kimi K2.6Moonshot AIopen43.9%Kimi K2.660.6
37Qwen3.6 PlusAlibabaopen43.9%Qwen3.6 Plus59.0
38GPT-5.6 TerraOpenAI43.9%58.8
39GPT-5.4OpenAI43.2%60.4
40GLM-5.1Zhipu AIopen43.2%GLM-5.160.1
41GLM-5Zhipu AIopen43.2%GLM-559.0
42MiMo-V2.5-ProXiaomiopen43.2%59.0
43GPT-5.2OpenAI43.2%58.5
44GPT-5.5 InstantOpenAI42.4%60.4
45MiniMax-M3MiniMaxopen42.4%MiniMax-M356.9
46Claude Sonnet 4.6Anthropic42.4%55.6
47GPT-5.4 nanoOpenAI42.4%GPT-5.4 nano (xhigh)53.9
48Gemini 3 ProGoogle41.7%Gemini 3 Pro Preview (high)61.6
49DeepSeek V4 ProDeepSeekopen41.7%high, 042460.0
50MiMo-V2.5Xiaomiopen41.7%042458.3
51Gemini 3.5 FlashGoogle40.9%Gemini 3.5 Flash60.7
52Mimo v2 ProXiaomi40.9%60.5
53Qwen3.5 397B-A17BAlibabaopen40.9%Qwen3.5 397B A17B58.6
54Claude Opus 4.5Anthropic40.9%58.0
55Grok 4.20xAI40.9%030957.9
56Gemini 3.5 FlashGoogle39.4%63.9
57MiniMax-M2.7MiniMaxopen39.4%MiniMax-M2.756.5
58GLM-5Zhipu AIopen39.4%54.5
59Gemini 3 FlashGoogle38.6%61.5
60DeepSeek V4 FlashDeepSeekopen38.6%high, 042059.3