Fiction.LiveBench 120k
Long-context comprehension of fiction at 120k tokens.
- Published by
- Fiction.livedata via Epoch AI Benchmarking Hub
- Category
- Long context
- Index weight
- 1.0
- Models
- 35
- Data as of
- 9 Sept 2026
CC BY 4.0 — Epoch AI, ‘AI Benchmarking Hub’, epoch.ai/benchmarks. Mirrored boards credit their original publishers.
- 1o3100.0%
- 2GPT-596.9%
- 3Grok 496.9%
- 4Gemini 2.5 Pro90.6%
- 5o3-pro88.9%
- 6Kimi K2.578.1%
- 7Grok 4 Fast75.0%
- 8Qwen3 235B A22B68.8%
- 9Gemini 2.5 Flash68.8%
- 10Chatgpt 4o 01.2965.6%
- 11Grok 3 mini65.6%
- 12GPT-4.563.9%
- 13GPT-5 mini62.5%
- 14o4-mini62.5%
- 15Qwen3-Next 80B A3B62.5%
35 of 35
| # | |||||
|---|---|---|---|---|---|
| 1 | 100.0% | – | 53.6 | – | |
| 2 | 96.9% | – | 58.5 | – | |
| 3 | 96.9% | 0709 | 57.2 | – | |
| 4 | 90.6% | – | 54.1 | – | |
| 5 | 88.9% | – | – | – | |
| 6 | 78.1% | kimi-k2.5 | 56.1 | – | |
| 7 | 75.0% | – | 46.5 | – | |
| 8 | 68.8% | thinking, 2507 | 51.7 | – | |
| 9 | 68.8% | – | 48.8 | – | |
| 10 | 65.6% | 2025 | – | – | |
| 11 | 65.6% | – | – | – | |
| 12 | 63.9% | – | 49.6 | – | |
| 13 | 62.5% | – | 54.5 | – | |
| 14 | 62.5% | – | 52.4 | – | |
| 15 | 62.5% | – | 48.4 | – | |
| 16 | 62.5% | – | 47.3 | – | |
| 17 | 62.5% | – | 42.3 | – | |
| 18 | 59.4% | – | 48.2 | – | |
| 19 | 58.3% | – | 50.0 | – | |
| 20 | 53.1% | – | 49.8 | – | |
| 21 | 53.1% | – | 48.3 | – | |
| 22 | 46.9% | – | 44.5 | – | |
| 23 | 44.4% | 2507 | – | – | |
| 24 | 43.8% | – | 45.6 | – | |
| 25 | 40.6% | 0905 | 48.8 | – | |
| 26 | 37.5% | – | 50.7 | – | |
| 27 | 37.5% | – | 47.0 | – | |
| 28 | 37.5% | – | 45.1 | – | |
| 29 | 36.4% | – | 49.5 | – | |
| 30 | 36.4% | – | 42.6 | – | |
| 31 | 33.3% | DeepSeek-R1 | 48.9 | – | |
| 32 | 27.3% | – | 39.7 | – | |
| 33 | 21.9% | – | 46.7 | – | |
| 34 | 21.9% | – | 46.5 | – | |
| 35 | 18.8% | – | 38.1 | – |