METR Time Horizons v1.1 estimates the human-expert task duration at which an AI agent succeeds 50% of the time on software, ML, and cybersecurity tasks. DataLearner stores minutes; this is not agent runtime, and METR cautions that estimates above 16 hours are unreliable with the current suite.
Browse the latest scores, model modes, release dates, and parameter sizes for METR Time Horizons v1.1.
Data sourced primarily from official releases (GitHub, Hugging Face, papers), then benchmark leaderboards, then third-party evaluators. Learn about our data methodology
| Rank | Model | License | |||
|---|---|---|---|---|---|
![]() Claude Mythos Preview Standard ModeTools | 1044.78 | 2026-04-07 | Unknown | Closed | |
![]() Gemini 3.1 Pro Preview Standard ModeTools | 384.15 | 2026-02-20 | Unknown | Closed | |
![]() GPT-5.2 Thinking Level · HighTools | 352.25 | 2025-12-11 | Unknown | Closed | |
4 | ![]() GPT-5.3 Codex Standard ModeTools | 349.53 | 2026-02-05 | Unknown | Closed |
5 | ![]() GPT-5.4 Thinking Level · Extra HighTools | 341.74 | 2026-03-05 | Unknown | Closed |
6 | ![]() Opus 4.5 Standard ModeTools | 293.00 | 2025-11-25 | Unknown | Closed |
7 | ![]() Opus 4.5 16KTools | 288.90 | 2025-11-25 | Unknown | Closed |
8 | ![]() Gemini 3 Pro Standard ModeTools | 224.33 | 2026-02-01 | Unknown | Closed |
9 | ![]() GPT-5 Thinking Level · HighTools | 203.01 | 2025-08-07 | Unknown | Closed |
10 | ![]() GPT-5.1-Codex-Max Standard ModeTools | 161.75 | 2025-11-19 | Unknown | Closed |
11 | ![]() GPT-5 Thinking Level · MediumTools | 137.32 | 2025-08-07 | Unknown | Closed |
12 | ![]() Claude Sonnet 4.5 16KTools | 121.95 | 2025-09-30 | Unknown | Closed |
13 | Grok 4 Standard ModeTools | 110.08 | 2025-07-10 | Unknown | Closed |
14 | ![]() OpenAI o3 Thinking Level · MediumTools | 91.27 | 2025-04-16 | Unknown | Closed |
15 | ![]() OpenAI o4 - mini Thinking Level · MediumTools | 76.51 | 2025-04-16 | Unknown | Closed |
16 | ![]() Claude Sonnet 3.7 Standard ModeTools | 60.39 | 2025-02-25 | Unknown | Closed |
17 | ![]() Claude Sonnet 3.7 16KTools | 56.09 | 2025-02-25 | Unknown | Closed |
18 | ![]() OpenAI o1 Thinking Level · MediumTools | 39.21 | 2024-12-05 | Unknown | Closed |
19 | ![]() Gemini 2.5-Pro Standard ModeTools | 38.73 | 2025-06-05 | Unknown | Closed |
20 | ![]() Claude 3.5 Sonnet New Standard ModeTools | 29.58 | 2024-10-22 | Unknown | Closed |
21 | ![]() DeepSeek-R1 Standard ModeTools | 26.93 | 2025-01-20 | 671B | Free Commercial |
22 | ![]() GPT-4o(2024-11-20) Standard ModeTools | 9.17 | 2024-11-20 | Unknown | Closed |
In METR's official v1.1 data observed on 2026-08-12, Claude Mythos Preview (early) had a 50% time horizon of 1044.78 minutes; METR cautions that measurements above 16 hours are unreliable.