Fiction.liveBench tests long-context comprehension of fiction while varying the amount of intervening context. DataLearner uses the 16k-token score as the canonical comparison metric.
Browse the latest scores, model modes, release dates, and parameter sizes for Fiction.liveBench.
Data sourced primarily from official releases (GitHub, Hugging Face, papers), then benchmark leaderboards, then third-party evaluators. Learn about our data methodology
| Rank | Model | License | |||
|---|---|---|---|---|---|
![]() o3-pro Thinking Level · Medium | 97.20 | 2025-06-10 | Unknown | Closed | |
![]() GPT-5 Thinking Level · Medium | 97.20 | 2025-08-07 | Unknown | Closed | |
Grok 4 Standard Mode | 94.40 | 2025-07-10 | Unknown | Closed | |
4 | Grok 4 Fast Standard Mode | 94.40 | 2025-09-19 | Unknown | Closed |
5 | ![]() Gemini 2.5-Pro Standard Mode | 91.70 | 2025-06-05 | Unknown | Closed |
6 | ![]() OpenAI o3 Thinking Level · Medium | 88.90 | 2025-04-16 | Unknown | Closed |
7 | ![]() Kimi K2.5 Standard Mode | 86.10 | 2026-01-27 | 1000B | Free Commercial |
8 | ![]() OpenAI o1 Thinking Level · Medium | 83.30 | 2024-12-05 | Unknown | Closed |
9 | ![]() Gemini 2.5 Flash Standard Mode | 77.80 | 2025-04-17 | Unknown | Closed |
10 | ![]() OpenAI o4 - mini Thinking Level · Medium | 77.80 | 2025-04-16 | Unknown | Closed |
11 | ![]() DeepSeek-R1 Standard Mode | 69.40 | 2025-01-20 | 671B | Free Commercial |
12 | ![]() GPT-5-mini Thinking Level · Medium | 69.40 | 2025-08-07 | Unknown | Closed |
13 | ![]() Gemini 2.5 Pro Experimental 03-25 Standard Mode | 66.70 | 2025-03-25 | Unknown | Closed |
14 | ![]() Gemini-2.5-Pro-Preview-05-06 Standard Mode | 66.70 | 2025-05-06 | Unknown | Closed |
15 | ![]() GPT-4.1 Standard Mode | 63.90 | 2025-04-14 | Unknown | Closed |
16 | ![]() Claude Sonnet 3.7 Standard Mode | 50.00 | 2025-02-25 | Unknown | Closed |
In the snapshot observed on 2026-08-12, GPT-5 (medium) and o3-pro (medium) both scored 97.2% at 16k tokens.