WeirdML v2 evaluates end-to-end machine-learning problem solving on 17 unusual tasks. Models iteratively write code, inspect results, and improve predictions; the headline metric macro-averages each task's best test accuracy.
Browse the latest scores, model modes, release dates, and parameter sizes for WeirdML v2.
Data sourced primarily from official releases (GitHub, Hugging Face, papers), then benchmark leaderboards, then third-party evaluators. Learn about our data methodology
| Rank | Model | License | |||
|---|---|---|---|---|---|
![]() Claude Opus 5 Thinking Level · HighTools | 91.59 | 2026-07-24 | Unknown | Closed | |
![]() GPT-5.6 Sol Thinking Level · HighTools | 88.76 | 2026-06-26 | Unknown | Closed | |
![]() Claude Fable 5 Thinking Level · HighTools | 87.85 | 2026-06-09 | Unknown | Closed | |
4 | ![]() Claude Opus 5 Standard ModeTools | 86.34 | 2026-07-24 | Unknown | Closed |
5 | ![]() GPT-5.5 Thinking Level · Extra HighTools | 84.91 | 2026-04-23 | Unknown | Closed |
6 | ![]() GPT-5.5 Thinking Level · HighTools | 83.90 | 2026-04-23 | Unknown | Closed |
7 | ![]() Claude Opus 4.8 Thinking Level · Extra HighTools | 82.89 | 2026-05-28 | Unknown | Closed |
8 | ![]() GPT-5.3 Codex Thinking Level · Extra HighTools | 79.30 | 2026-02-05 | Unknown | Closed |
9 | ![]() GPT-5.3 Codex Standard ModeTools | 79.30 | 2026-02-05 | Unknown | Closed |
10 | ![]() GPT-5.6 Terra Thinking Level · HighTools | 78.27 | 2026-06-26 | Unknown | Closed |
11 | ![]() Claude Opus 4.6 Thinking Level · HighTools | 77.95 | 2026-02-05 | Unknown | Closed |
12 | ![]() GPT-5.4 Thinking Level · Extra HighTools | 77.70 | 2026-03-05 | Unknown | Closed |
13 | ![]() Opus 4.7 Thinking Level · HighTools | 76.40 | 2026-04-16 | Unknown | Closed |
14 | ![]() Opus 4.7 Standard ModeTools | 76.40 | 2026-04-16 | Unknown | Closed |
15 | ![]() Claude Opus 4.8 Thinking Level · MediumTools | 76.04 | 2026-05-28 | Unknown | Closed |
16 | ![]() GPT-5.2 Thinking Level · Extra HighTools | 72.20 | 2025-12-11 | Unknown | Closed |
17 | ![]() Gemini 3.1 Pro Preview Standard ModeTools | 72.10 | 2026-02-20 | Unknown | Closed |
18 | ![]() Claude Opus 4.8 Standard ModeTools | 70.45 | 2026-05-28 | Unknown | Closed |
19 | ![]() Gemini 3 Pro Standard ModeTools | 69.93 | 2026-02-01 | Unknown | Closed |
20 | ![]() Claude Sonnet 5 Thinking Level · HighTools | 68.78 | 2026-06-30 | Unknown | Closed |
21 | ![]() GLM-5.2 Thinking Level · HighTools | 67.31 | 2026-06-13 | 753.3B | Free Commercial |
22 | ![]() GPT-5.5 Standard ModeTools | 67.15 | 2026-04-23 | Unknown | Closed |
23 | ![]() Claude Opus 4.6 Standard ModeTools | 65.90 | 2026-02-05 | Unknown | Closed |
24 | ![]() Opus 4.5 16KTools | 63.70 | 2025-11-25 | Unknown | Closed |
25 | ![]() GPT-5.2 Thinking Level · MediumTools | 63.40 | 2025-12-11 | Unknown | Closed |
26 | ![]() Gemini 3.0 Flash Standard ModeTools | 61.60 | 2025-12-17 | Unknown | Closed |
27 | ![]() GPT-5.6 Luna Thinking Level · HighTools | 60.86 | 2026-06-26 | Unknown | Closed |
28 | ![]() GPT-5.1 Thinking Level · HighTools | 60.77 | 2025-11-12 | Unknown | Closed |
29 | ![]() GPT-5 Thinking Level · HighTools | 60.70 | 2025-08-07 | Unknown | Closed |
30 | ![]() o3-pro Thinking Level · HighTools | 58.21 | 2025-06-10 | Unknown | Closed |
In the official leaderboard snapshot observed on 2026-08-12, Claude Fable 5 at max effort scored 91.94% average accuracy.