SimpleBench is an English multiple-choice commonsense reasoning benchmark with more than 200 questions spanning spatio-temporal reasoning, social intelligence, and linguistic adversarial robustness. Its official non-specialist human baseline is 83.7.
Browse the latest scores, model modes, release dates, and parameter sizes for SimpleBench.
Data sourced primarily from official releases (GitHub, Hugging Face, papers), then benchmark leaderboards, then third-party evaluators. Learn about our data methodology
| Rank | Model | License | |||
|---|---|---|---|---|---|
![]() Claude Fable 5 Standard Mode | 81.90 | 2026-06-09 | Unknown | Closed | |
![]() Gemini 3.1 Pro Preview Standard Mode | 79.60 | 2026-02-20 | Unknown | Closed | |
![]() GPT-5.5 Pro Standard Mode | 76.90 | 2026-04-23 | Unknown | Closed | |
4 | ![]() Gemini 3.5 Flash Standard Mode | 76.70 | 2026-06-20 | Unknown | Closed |
5 | ![]() Gemini 3.0 Pro (Preview 11-2025) Thinking Enabled | 76.40 | 2025-11-18 | Unknown | Closed |
6 | ![]() GPT-5.4 Pro Thinking Level · High | 74.10 | 2026-03-05 | Unknown | Closed |
7 | ![]() Qwen3.7 Max Standard Mode | 70.40 | 2026-05-20 | Unknown | Closed |
8 | ![]() GPT-5.5 Standard Mode | 69.00 | 2026-04-23 | Unknown | Closed |
9 | ![]() Claude Opus 4.6 Standard Mode | 67.60 | 2026-02-05 | Unknown | Closed |
10 | ![]() Claude Opus 4.8 Standard Mode | 64.80 | 2026-05-28 | Unknown | Closed |
11 | ![]() Qwen3.6-Max-Preview Standard Mode | 63.00 | 2026-04-18 | Unknown | Closed |
12 | ![]() Opus 4.7 Standard Mode | 62.90 | 2026-04-16 | Unknown | Closed |
13 | ![]() Gemini 2.5-Pro Thinking Enabled | 62.40 | 2025-06-05 | Unknown | Closed |
14 | ![]() Opus 4.5 Extended Thinking | 62.00 | 2025-11-25 | Unknown | Closed |
15 | ![]() GPT-5-Pro Thinking Enabled | 61.60 | 2025-08-07 | Unknown | Closed |
16 | ![]() DeepSeek-V4-Pro Standard Mode | 61.20 | 2026-08-13 | 1600B | Free Commercial |
17 | ![]() Gemini 3.0 Flash Standard Mode | 61.10 | 2025-12-17 | Unknown | Closed |
18 | Grok 4 Thinking Enabled | 60.50 | 2025-07-10 | Unknown | Closed |
19 | ![]() Opus 4.1 Extended Thinking | 60.00 | 2025-08-06 | Unknown | Closed |
20 | ![]() Claude Opus 4 Thinking Enabled | 58.80 | 2025-05-23 | Unknown | Closed |
21 | ![]() GLM-5.2 Standard Mode | 58.80 | 2026-06-13 | 753.3B | Free Commercial |
22 | ![]() GLM 5.1 Standard Mode | 58.70 | 2026-03-27 | 75.4B | Free Commercial |
23 | ![]() Claude Sonnet 5 Standard Mode | 57.90 | 2026-06-30 | Unknown | Closed |
24 | ![]() GPT-5.2 Pro Thinking Level · Extra High | 57.40 | 2025-12-11 | Unknown | Closed |
25 | ![]() GPT-5 Thinking Level · High | 56.70 | 2025-08-07 | Unknown | Closed |
26 | Grok 4.1 Fast Standard Mode | 56.00 | 2025-11-19 | Unknown | Closed |
27 | ![]() Claude Sonnet 4.5 Standard Mode | 54.30 | 2025-09-30 | Unknown | Closed |
28 | ![]() GPT-5.1 Thinking Level · High | 53.20 | 2025-11-12 | Unknown | Closed |
29 | ![]() GLM-5 Standard Mode | 53.20 | 2026-02-11 | 744B | Free Commercial |
30 | ![]() OpenAI o3 Thinking Level · High | 53.10 | 2025-04-16 | Unknown | Closed |
As of July 1, 2026, Claude Fable 5 leads at 81.9, still below the 83.7 non-specialist human baseline. Gemini 3.1 Pro Preview follows at 79.6 and GPT-5.5 Pro at 76.9.