BenchLeader

OSWorld-Verified 2.0

Computer-use tasks in a real desktop environment.

Published by
OSWorlddata via Epoch AI Benchmarking Hub
Category
Agents & tools
Index weight
0.5
Models
14
Data as of
9 Sept 2026

CC BY 4.0 — Epoch AI, ‘AI Benchmarking Hub’, epoch.ai/benchmarks. Mirrored boards credit their original publishers.

14 of 14
#
1Claude Opus 5Anthropic31.4%66.8
2Claude Opus 5Anthropic30.2%66.3
3Claude Opus 5Anthropic29.0%69.3
4GPT-5.6 SolOpenAI27.3%65.5
5Claude Opus 5Anthropic25.3%63.1
6Claude Opus 5Anthropic22.3%61.7
7Claude Opus 4.8Anthropic20.6%59.4
8Claude Opus 4.7Anthropic18.2%59.3
9GPT-5.5OpenAI13.0%63.7
10Claude Sonnet 4.6Anthropic9.3%51.8
11Claude Sonnet 4.6Anthropic8.3%49.7
12Kimi K2.6Moonshot AIopen4.6%Kimi 2.6 (enabled)60.6
13MiniMax-M3MiniMaxopen4.6%MiniMax M3 (enabled)56.9
14Qwen3.7 PlusAlibaba2.8%59.7