BenchLeader

Terminal-Bench 2.1 (AA)

The previous Terminal-Bench release, kept because far more models have been run on it than on 4.0.

As of 22 Sept 2026, Claude Fable 5.1 leads Terminal-Bench 2.1 (AA) on BenchLeader with 91.4%, ahead of Claude Fable 5.1 at 91.0%, across 236 model configurations with a published result.

Published by
Artificial Analysis
Category
Coding
Index weight
Reference only
Models
236
Data as of
22 Sept 2026

Source: Artificial Analysis (artificialanalysis.ai). Data taken from the public leaderboard.

236 of 236
#
1Claude Fable 5.1thinkingAnthropic91.4%71.0
2Claude Fable 5.1xhighAnthropic91.0%71.1
3GPT-6 AstrahighOpenAI89.9%71.3
4Claude Fable 5.1highAnthropic89.9%71.0
5GPT-6 AstramediumOpenAI89.5%69.2
6GPT-5.6 SolxhighOpenAI89.5%67.9
7GPT-6 AstraxhighOpenAI89.1%70.5
8Claude Opus 5maxAnthropic89.1%69.5
9Qwen3.8 Max (0902)maxAlibaba88.8%66.2
10GPT-6 AstramaxOpenAI88.4%71.7
11Grok 4.6highSpaceXAI88.4%64.2
12Claude Opus 5xhighAnthropic88.0%69.3
13Claude Fable 5.1mediumAnthropic88.0%69.1
14GPT-5.6 SolmaxOpenAI88.0%68.5
15GPT-6 AstralowOpenAI88.0%67.6
16GPT-5.6 TerramaxOpenAI88.0%64.8
17Grok 4.6xhighSpaceXAI88.0%64.1
18Claude Opus 5highAnthropic87.6%69.8
19Gemini 3.8 FlashhighGoogle87.6%64.3
20GPT-5.6 SolhighOpenAI87.3%67.4
21Claude Opus 5mediumAnthropic86.1%66.4
22GPT-5.6 SolmediumOpenAI86.1%65.5
23Qwen3.8-Flash-NextAlibabaopen ↗86.1%61.2
24Gemini 3.7 FlashhighGoogle85.8%64.3
25Muse Spark 1.3xhighMeta85.4%67.9
26Kimi K3maxMoonshot AIopen ↗85.0%66.7
27Claude Fable 5.1lowAnthropic85.0%66.7
28Claude Fable 5thinkingAnthropic84.6%70.3
29Claude Opus 4.8maxAnthropic84.6%63.5
30Muse Spark 1.3maxMeta84.3%69.2
31GPT-5.5xhighOpenAI84.3%67.2
32Grok 4.6mediumSpaceXAI84.3%65.5
33GLM 5.3 FlashZhipu AIopen ↗84.3%63.6
34GLM 5.3maxZhipu AIopen ↗83.9%65.4
35Gemini 3.8 FlashmediumGoogle83.9%64.6
36Claude Opus 4.7maxAnthropic83.2%63.7
37Gemini 3.8 FlashlowGoogle83.2%60.2
38Kimi K3lowMoonshot AIopen ↗82.4%59.7
39Qwen3.8 2.4T A95BAlibabaopen ↗82.0%64.5
40Agnes 3.0 FlashSapiens AI82.0%61.7
41Grok 4.5highSpaceXAI81.7%60.6
42GPT-5.6 LunamaxOpenAI80.9%59.9
43GPT-5.5mediumOpenAI80.5%64.0
44Claude Sonnet 5maxAnthropic80.5%60.0
45GPT-5.6 TerraxhighOpenAI80.2%63.9
46Muse Spark 1.2xhighMeta80.2%63.7
47Gemini 3.7 FlashlowGoogle79.8%61.6
48Qwen3.8 27BxhighAlibabaopen ↗79.8%58.9
49GPT-5.5highOpenAI79.4%66.6
50DeepSeek V4 PromaxDeepSeekopen ↗78.7%63.7
51Gemini 3.5 FlashhighGoogle78.7%63.4
52DeepSeek V4 FlashmaxDeepSeekopen ↗78.7%61.6
53GPT-5.4xhighOpenAI78.3%65.1
54Gemini 3.7 FlashmediumGoogle78.3%64.4
55GLM 5.2maxZhipu AIopen ↗77.9%63.6
56Muse Spark 1.1xhighMeta77.9%61.4
57GPT-5.6 LunaxhighOpenAI77.9%60.8
58Gemini 3.6 FlashhighGoogle77.5%61.5
59GPT-5.6 SollowOpenAI76.8%63.2
60Claude Opus 5lowAnthropic76.4%62.8

Cite as: BenchLeader, “Terminal-Bench 2.1 (AA) leaderboard”, https://www.benchleader.com/benchmarks/aa_terminalbench_21, data as of 22 Sept 2026.

Terminal-Bench 2.1 (AA): questions

What does Terminal-Bench 2.1 (AA) measure?
The previous Terminal-Bench release, kept because far more models have been run on it than on 4.0. Scores are reported in percent of tasks solved; higher is better.
Which AI model leads Terminal-Bench 2.1 (AA)?
Claude Fable 5.1 leads Terminal-Bench 2.1 (AA) with 91.4% as of 22 Sept 2026, ahead of Claude Fable 5.1 at 91.0%.
How many models have Terminal-Bench 2.1 (AA) results?
236 model configurations have a Terminal-Bench 2.1 (AA) result on BenchLeader, all taken from Artificial Analysis.
Who runs Terminal-Bench 2.1 (AA) and how often is it updated?
Terminal-Bench 2.1 (AA) is published by Artificial Analysis. BenchLeader re-reads the published results every morning and records the date each result was published.
Does Terminal-Bench 2.1 (AA) count toward the BenchLeader Index?
No. Terminal-Bench 2.1 (AA) is shown for reference but left out of the composite index.