BenchLeader

DeepResearch Bench

Long-form research reports judged for depth and accuracy.

As of 19 Sept 2026, Claude Opus 4.6 leads DeepResearch Bench on BenchLeader with 55.3%, ahead of Claude Sonnet 4.6 at 54.9%, across 40 model configurations with a published result.

Published by
DeepResearch Benchdata via Epoch AI Benchmarking Hub
Category
Agents & tools
Index weight
Reference only
Models
40
Data as of
19 Sept 2026

CC BY 4.0 — Epoch AI, ‘AI Benchmarking Hub’, epoch.ai/benchmarks. Mirrored boards credit their original publishers.

What the test looks like

Research questions that require gathering sources and writing a report, judged by rubric.

How it is scored

Average rubric score, as published by DeepResearch Bench.

What to keep in mind

Rubric-graded reports; harness and search tools matter.

40 of 40
#
1Claude Opus 4.6highAnthropic55.3%61.32026-02-05
2Claude Sonnet 4.6highAnthropic54.9%54.92026-02-17
3Claude Opus 4.5highAnthropic54.8%57.72025-11-24
4GPT-5.5highOpenAI54.0%67.02026-04-23
5Claude Opus 4.5lowAnthropic53.7%2025-11-24
6Claude Opus 4.6mediumAnthropic53.2%2026-02-05
7Claude Sonnet 4.5Anthropic52.6%54.32025-09-29
8Claude Opus 4.6lowAnthropic51.4%2026-02-05
9Claude Sonnet 4.6lowAnthropic50.4%54.52026-02-17
10Claude Opus 4.8highAnthropic50.2%62.22026-05-28
11Gemini 3 FlashlowGoogle49.8%2025-12-17
12GPT-5.5mediumOpenAI49.6%64.62026-04-23
13GPT-5lowOpenAI49.6%53.52025-08-07
14Claude Opus 4.8lowAnthropic49.3%2026-05-28
15Gemini 3 FlashminimalGoogle49.0%54.92025-12-17
16GPT-5minimalOpenAI48.9%46.02025-08-07
17GPT-5.5lowOpenAI48.7%61.22026-04-23
18GPT-5mediumOpenAI48.6%58.52025-08-07
19Claude Opus 4.1Anthropic48.3%51.92025-08-05
20GPT-5highOpenAI48.1%58.62025-08-07
21Gemini 3 FlashhighGoogle47.9%58.72025-12-17
22Gemini 3.1 ProhighGoogle47.8%60.72026-02-19
23Claude Sonnet 4.5lowAnthropic47.5%2025-09-29
24Claude Opus 4.8mediumAnthropic47.4%2026-05-28
25Grok 4xAI47.3%58.52025-07-09
26Claude Opus 4Anthropic46.8%52.92025-05-22
27Claude Sonnet 4Anthropic46.6%49.72025-05-22
28Gemini 3 ProlowGoogle46.3%54.72025-11-18
29Claude Haiku 4.5lowAnthropic45.5%2025-10-15
30o3mediumOpenAI45.2%53.72025-04-16
31Gemini 3.1 ProlowGoogle44.5%2026-02-19
32Claude 3.7 SonnetAnthropic43.6%50.22025-02-24
33Gemini 2.5 ProGoogle42.8%54.52025-06-05
34GPT-5.1lowOpenAI42.8%2025-11-13
35GPT-5.2lowOpenAI41.1%50.32025-12-11
36Gemini 3.1 Flash LitelowGoogle37.3%2026-03-03
37Gemini 3.1 Flash LiteGoogle36.4%54.52026-03-03
38GPT-5.4 minilowOpenAI36.3%2026-03-17
39GPT-5.4lowOpenAI35.1%60.82026-03-05
40DeepSeek R1 0528DeepSeekopen35.1%50.22025-05-28

Cite as: BenchLeader, “DeepResearch Bench leaderboard”, https://www.benchleader.com/benchmarks/deepresearch_bench, data as of 19 Sept 2026.

DeepResearch Bench: questions

What does DeepResearch Bench measure?
Research questions that require gathering sources and writing a report, judged by rubric. Scores are reported in percent of tasks solved; higher is better.
Which AI model leads DeepResearch Bench?
Claude Opus 4.6 leads DeepResearch Bench with 55.3% as of 19 Sept 2026, ahead of Claude Sonnet 4.6 at 54.9%.
How many models have DeepResearch Bench results?
40 model configurations have a DeepResearch Bench result on BenchLeader, all taken from DeepResearch Bench via Epoch AI Benchmarking Hub.
Who runs DeepResearch Bench and how often is it updated?
DeepResearch Bench is published by DeepResearch Bench. BenchLeader re-reads the published results every morning and records the date each result was published.
Does DeepResearch Bench count toward the BenchLeader Index?
No. DeepResearch Bench is shown for reference but left out of the composite index.