BenchLeader

Terminal-Bench 4.0 (AA)

Real command-line tasks in a sandboxed terminal, version 4.0. Run by Artificial Analysis; the Terminal-Bench team's own run is the one in the index.

As of 22 Sept 2026, Claude Opus 5.5 leads Terminal-Bench 4.0 (AA) on BenchLeader with 59.6%, ahead of GPT-6 Astra at 59.6%, across 167 model configurations with a published result.

Published by
Artificial Analysis
Category
Coding
Index weight
Reference only
Models
167
Data as of
22 Sept 2026

Source: Artificial Analysis (artificialanalysis.ai). Data taken from the public leaderboard.

167 of 167
#
1NewClaude Opus 5.5thinkingAnthropic59.6%70.7
2GPT-6 AstraxhighOpenAI59.6%70.5
3NewClaude Opus 5.5xhighAnthropic59.6%70.3
4GPT-6 AstramaxOpenAI59.1%71.7
5NewClaude Opus 5.5highAnthropic56.6%69.9
6Claude Fable 5.1xhighAnthropic55.0%71.1
7GPT-6 AstrahighOpenAI54.0%71.3
8NewClaude Opus 5.5mediumAnthropic52.5%69.3
9Claude Fable 5.1highAnthropic52.0%71.0
10Claude Fable 5.1thinkingAnthropic52.0%71.0
11GPT-6 AstramediumOpenAI49.5%69.2
12Claude Opus 5maxAnthropic49.0%69.5
13Claude Opus 5xhighAnthropic46.5%69.3
14Claude Opus 5highAnthropic46.0%69.8
15Claude Fable 5.1mediumAnthropic45.0%69.1
16Claude Fable 5thinkingAnthropic42.4%70.3
17GPT-6 AstralowOpenAI41.9%67.6
18GLM 5.3maxZhipu AIopen ↗41.9%65.4
19Claude Fable 5.1lowAnthropic40.4%66.7
20GPT-5.6 SolmaxOpenAI39.9%68.5
21Qwen3.8 Max (0902)maxAlibaba38.9%66.2
22GPT-5.6 TerramaxOpenAI35.4%64.8
23NewMiMo-V2.6-ProXiaomiopen34.9%
24Claude Opus 5mediumAnthropic34.3%66.4
25Muse Spark 1.3maxMeta33.3%69.2
26NewStep 5 PreviewStepFun33.3%64.8
27GLM 5.3 FlashZhipu AIopen ↗32.8%63.6
28NewClaude Opus 5.5lowAnthropic31.3%65.2
29DeepSeek V4.1 FlashmaxDeepSeekopen ↗26.8%61.4
30Claude Opus 5lowAnthropic26.3%62.8
31NewGrok 4.7xhighSpaceXAI25.8%61.9
32Qwen3.8-Flash-NextAlibabaopen ↗25.3%61.2
33GPT-5.6 SolxhighOpenAI24.8%67.9
34NewGrok 4.7highSpaceXAI24.8%
35Claude Opus 4.8maxAnthropic21.7%63.5
36Grok 4.6highSpaceXAI21.2%64.2
37GPT-5.6 SolhighOpenAI20.7%67.4
38Gemini 3.8 FlashmediumGoogle19.7%64.6
39Gemini 3.8 FlashhighGoogle19.7%64.3
40Grok 4.6xhighSpaceXAI17.2%64.1
41Muse Spark 1.3xhighMeta16.7%67.9
42GPT-5.5xhighOpenAI14.7%67.2
43GPT-5.6 SolmediumOpenAI14.7%65.5
44DeepSeek V4 PromaxDeepSeekopen ↗14.7%63.7
45Claude Sonnet 5maxAnthropic14.1%60.0
46Gemini 3.7 FlashhighGoogle13.6%64.3
47Grok 4.6mediumSpaceXAI13.1%65.5
48Kimi K3maxMoonshot AIopen ↗12.6%66.7
49Kimi K3lowMoonshot AIopen ↗12.6%59.7
50GPT-5.5 InstantOpenAI12.6%58.8
51DeepSeek V4 FlashmaxDeepSeekopen ↗12.1%61.6
52Deepseek v4 Flash VisionmaxDeepSeek12.1%59.3
53GPT-5.6 LunamaxOpenAI11.6%59.9
54Qwen3.8 2.4T A95BAlibabaopen ↗11.1%64.5
55Grok 4.5highSpaceXAI10.6%60.6
56GPT-5.6 TerraxhighOpenAI10.1%63.9
57Gemini 3.8 FlashlowGoogle10.1%60.2
58GPT-5.5highOpenAI9.1%66.6
59Muse Spark 1.2xhighMeta7.1%63.7
60Agnes 3.0 FlashSapiens AI7.1%61.7

Cite as: BenchLeader, “Terminal-Bench 4.0 (AA) leaderboard”, https://www.benchleader.com/benchmarks/aa_terminalbench_40, data as of 22 Sept 2026.

Terminal-Bench 4.0 (AA): questions

What does Terminal-Bench 4.0 (AA) measure?
Real command-line tasks in a sandboxed terminal, version 4.0. Run by Artificial Analysis; the Terminal-Bench team's own run is the one in the index. Scores are reported in percent of tasks solved; higher is better.
Which AI model leads Terminal-Bench 4.0 (AA)?
Claude Opus 5.5 leads Terminal-Bench 4.0 (AA) with 59.6% as of 22 Sept 2026, ahead of GPT-6 Astra at 59.6%.
How many models have Terminal-Bench 4.0 (AA) results?
167 model configurations have a Terminal-Bench 4.0 (AA) result on BenchLeader, all taken from Artificial Analysis.
Who runs Terminal-Bench 4.0 (AA) and how often is it updated?
Terminal-Bench 4.0 (AA) is published by Artificial Analysis. BenchLeader re-reads the published results every morning and records the date each result was published.
Does Terminal-Bench 4.0 (AA) count toward the BenchLeader Index?
No. Terminal-Bench 4.0 (AA) is shown for reference but left out of the composite index.