Terminal-Bench
Command-line agent tasks; best result per model across harnesses.
- Published by
- Terminal-Benchdata via Epoch AI Benchmarking Hub
- Category
- Agents & tools
- Index weight
- 1.0
- Models
- 66
- Data as of
- 9 Sept 2026
CC BY 4.0 — Epoch AI, ‘AI Benchmarking Hub’, epoch.ai/benchmarks. Mirrored boards credit their original publishers.
- 1GPT-5.584.7%
- 2GPT-5.481.8%
- 3Claude Opus 4.780.2%
- 4Gemini 3.1 Pro80.2%
- 5Claude Opus 4.679.8%
- 6GPT-5.3 Codex78.4%
- 7Gemini 3 Pro69.4%
- 8GPT-5.2 Codex66.5%
- 9GPT-5.264.9%
- 10GPT-5.264.9%
- 11Gemini 3 Flash64.3%
- 12Claude Opus 4.563.1%
- 13GPT-5.1-Codex-mini61.6%
- 14GPT-5.1-Codex-Max60.4%
- 15GPT-6 Astra58.2%
66 of 66
| # | |||||
|---|---|---|---|---|---|
| 1 | 84.7% | – | 66.6 | – | |
| 2 | 81.8% | – | 63.4 | – | |
| 3 | 80.2% | – | 65.5 | – | |
| 4 | 80.2% | – | 63.9 | – | |
| 5 | 79.8% | – | 63.1 | – | |
| 6 | 78.4% | – | 62.4 | – | |
| 7 | 69.4% | – | 61.6 | – | |
| 8 | 66.5% | – | 60.7 | – | |
| 9 | 64.9% | – | 61.5 | – | |
| 10 | 64.9% | – | 58.5 | – | |
| 11 | 64.3% | – | 56.6 | – | |
| 12 | 63.1% | – | 58.0 | – | |
| 13 | 61.6% | – | 53.4 | – | |
| 14 | 60.4% | – | – | – | |
| 15 | 58.2% | – | 70.6 | – | |
| 16 | 57.9% | – | 70.2 | – | |
| 17 | 57.9% | – | 69.5 | – | |
| 18 | 57.9% | – | 68.6 | – | |
| 19 | 57.8% | – | 57.1 | – | |
| 20 | 57.3% | – | 57.9 | – | |
| 21 | 54.2% | – | 67.4 | – | |
| 22 | 53.4% | – | 60.3 | – | |
| 23 | 52.4% | via Terminus 2 | 59.0 | – | |
| 24 | 51.8% | – | 66.8 | – | |
| 25 | 50.6% | – | 65.8 | – | |
| 26 | 49.6% | – | 59.5 | – | |
| 27 | 49.6% | – | 58.5 | – | |
| 28 | 47.6% | dated, via Terminus 2 | 59.4 | – | |
| 29 | 47.6% | dated, medium, via Terminus 2 | 52.8 | – | |
| 30 | 46.5% | – | 52.3 | – | |
| 31 | 45.1% | – | 56.5 | – | |
| 32 | 44.5% | – | 65.8 | – | |
| 33 | 44.3% | – | 58.1 | – | |
| 34 | 43.2% | via Terminus 2 | 56.1 | – | |
| 35 | 42.7% | – | 53.5 | – | |
| 36 | 41.8% | – | 59.9 | – | |
| 37 | 38.0% | via Terminus 2 | 52.6 | – | |
| 38 | 37.3% | – | 65.5 | – | |
| 39 | 36.6% | – | 55.1 | – | |
| 40 | 35.7% | thinking, via Terminus 2 | 52.8 | – | |
| 41 | 35.5% | – | 47.9 | – | |
| 42 | 34.8% | – | 55.8 | – | |
| 43 | 33.4% | via Terminus 2 | 54.9 | – | |
| 44 | 32.6% | via Terminus 2 | 54.1 | – | |
| 45 | 31.9% | – | 54.5 | – | |
| 46 | 27.8% | via Terminus 2 | 48.8 | – | |
| 47 | 27.2% | 0709, via OpenHands | 57.2 | – | |
| 48 | 27.2% | – | 48.5 | – | |
| 49 | 25.8% | – | 45.9 | – | |
| 50 | 24.5% | via Terminus 2 | 47.6 | – | |
| 51 | 23.6% | – | 59.4 | – | |
| 52 | 23.0% | – | 53.2 | – | |
| 53 | 21.8% | – | 51.1 | – | |
| 54 | 21.5% | – | 58.0 | – | |
| 55 | 20.3% | – | 58.7 | – | |
| 56 | 19.1% | – | 60.1 | – | |
| 57 | 18.7% | via Terminus 2 | 47.6 | – | |
| 58 | 17.3% | – | 56.5 | – | |
| 59 | 17.1% | – | 50.7 | – | |
| 60 | 17.1% | – | 48.8 | – |