BenchLeader

Fiction.LiveBench 120k

Long-context comprehension of fiction at 120k tokens.

Published by
Fiction.livedata via Epoch AI Benchmarking Hub
Category
Long context
Index weight
1.0
Models
35
Data as of
9 Sept 2026

CC BY 4.0 — Epoch AI, ‘AI Benchmarking Hub’, epoch.ai/benchmarks. Mirrored boards credit their original publishers.

Top 15
  1. 1o3100.0%
  2. 2GPT-596.9%
  3. 3Grok 496.9%
  4. 4Gemini 2.5 Pro90.6%
  5. 5o3-pro88.9%
  6. 6Kimi K2.578.1%
  7. 7Grok 4 Fast75.0%
  8. 8Qwen3 235B A22B68.8%
  9. 9Gemini 2.5 Flash68.8%
  10. 10Chatgpt 4o 01.2965.6%
  11. 11Grok 3 mini65.6%
  12. 12GPT-4.563.9%
  13. 13GPT-5 mini62.5%
  14. 14o4-mini62.5%
  15. 15Qwen3-Next 80B A3B62.5%
35 of 35
#
1o3OpenAI100.0%53.6
2GPT-5OpenAI96.9%58.5
3Grok 4xAI96.9%070957.2
4Gemini 2.5 ProGoogle90.6%54.1
5o3-proOpenAI88.9%
6Kimi K2.5Moonshot AIopen78.1%kimi-k2.556.1
7Grok 4 FastxAI75.0%46.5
8Qwen3 235B A22BAlibabaopen68.8%thinking, 250751.7
9Gemini 2.5 FlashGoogle68.8%48.8
10Chatgpt 4o 01.29OpenAI65.6%2025
11Grok 3 minixAI65.6%
12GPT-4.5OpenAI63.9%49.6
13GPT-5 miniOpenAI62.5%54.5
14o4-miniOpenAI62.5%52.4
15Qwen3-Next 80B A3BAlibabaopen62.5%48.4
16GPT-4.1OpenAI62.5%47.3
17Gemini 2.0 FlashGoogle62.5%42.3
18MiniMax-M1MiniMaxopen59.4%48.2
19Grok 3xAI58.3%50.0
20Claude 3.7 SonnetAnthropic53.1%49.8
21o1OpenAI53.1%48.3
22GPT-4.1 miniOpenAI46.9%44.5
23Parasail Qwen3 235B A22bAlibaba44.4%2507
24o3-miniOpenAI43.8%45.6
25Kimi K2Moonshot AIopen40.6%090548.8
26Claude Opus 4Anthropic37.5%50.7
27Gemini 2.0 ProGoogle37.5%47.0
28Gemini 2.0 FlashGoogle37.5%45.1
29Claude Sonnet 4Anthropic36.4%49.5
30Llama 4 MaverickMetaopen36.4%42.6
31DeepSeek R1DeepSeekopen33.3%DeepSeek-R148.9
32Llama 4 ScoutMetaopen27.3%39.7
33Gemini 2.5 Flash-LiteGoogle21.9%46.7
34GPT-5 nanoOpenAI21.9%46.5
35GPT-4.1 nanoOpenAI18.8%38.1