CursorBench is Cursor's internal coding-agent evaluation built from ambiguous, multi-file tasks drawn from real Cursor sessions. Version 4.0 adds long-horizon tasks for editing, refactoring, investigation, intent understanding, job management, and design adherence. Scores reflect a model, its reasoning setting, and Cursor's tool environment; Cursor notes that small score differences may not be statistically meaningful.
Browse the latest scores, model modes, release dates, and parameter sizes for CursorBench 4.0.
Data sourced primarily from official releases (GitHub, Hugging Face, papers), then benchmark leaderboards, then third-party evaluators. Learn about our data methodology
| Rank | Model | License | |||
|---|---|---|---|---|---|
— | ![]() Claude Fable 5.1 Thinking Level · MaxTools | 51.80 | 2026-09-01 | Unknown | Closed |
— | ![]() Claude Fable 5.1 Thinking Level · Extra HighTools | 51.60 | 2026-09-01 | Unknown | Closed |
— | ![]() Claude Fable 5.1 Thinking Level · HighTools | 49.20 | 2026-09-01 | Unknown | Closed |
— | ![]() Claude Fable 5.1 Thinking Level · MediumTools | 46.80 | 2026-09-01 | Unknown | Closed |
— | ![]() Claude Opus 5 Thinking Level · MaxTools | 46.60 | 2026-07-24 | Unknown | Closed |
— | ![]() Claude Opus 5 Thinking Level · Extra HighTools | 46.10 | 2026-07-24 | Unknown | Closed |
— | ![]() Claude Fable 5.1 Thinking Level · LowTools | 45.10 | 2026-09-01 | Unknown | Closed |
— | ![]() Claude Opus 5 Thinking Level · HighTools | 44.70 | 2026-07-24 | Unknown | Closed |
— | ![]() Claude Opus 5 Thinking Level · MediumTools | 43.30 | 2026-07-24 | Unknown | Closed |
— | ![]() GPT-5.6 Sol Thinking Level · MaxTools | 41.70 | 2026-06-26 | Unknown | Closed |
— | ![]() Muse Spark 1.3 Thinking Level · MaxTools | 41.60 | 2026-09-02 | Unknown | Closed |
— | Grok 4.6 Thinking Level · Extra HighTools | 41.40 | 2026-08-12 | Unknown | Closed |
— | ![]() Claude Opus 5 Thinking Level · LowTools | 40.70 | 2026-07-24 | Unknown | Closed |
— | Grok 4.6 Thinking Level · HighTools | 40.40 | 2026-08-12 | Unknown | Closed |
— | ![]() Gemini 3.8 Flash Thinking Level · HighTools | 39.60 | 2026-09-02 | Unknown | Closed |
— | ![]() GPT-5.6 Sol Thinking Level · Extra HighTools | 37.70 | 2026-06-26 | Unknown | Closed |
— | ![]() Muse Spark 1.3 Thinking Level · Extra HighTools | 37.50 | 2026-09-02 | Unknown | Closed |
— | ![]() Gemini 3.8 Flash Thinking Level · MediumTools | 37.30 | 2026-09-02 | Unknown | Closed |
— | Grok 4.6 Thinking Level · MediumTools | 36.10 | 2026-08-12 | Unknown | Closed |
— | ![]() GPT-5.6 Sol Thinking Level · HighTools | 35.70 | 2026-06-26 | Unknown | Closed |
— | ![]() Claude Sonnet 5 Thinking Level · MaxTools | 34.10 | 2026-06-30 | Unknown | Closed |
— | Grok 4.6 Thinking Level · LowTools | 33.40 | 2026-08-12 | Unknown | Closed |
— | ![]() Muse Spark 1.3 Thinking Level · HighTools | 33.40 | 2026-09-02 | Unknown | Closed |
— | ![]() Muse Spark 1.3 Thinking Level · MediumTools | 32.60 | 2026-09-02 | Unknown | Closed |
— | ![]() Claude Sonnet 5 Thinking Level · Extra HighTools | 32.00 | 2026-06-30 | Unknown | Closed |
— | ![]() GPT-5.6 Sol Thinking Level · MediumTools | 31.10 | 2026-06-26 | Unknown | Closed |
— | ![]() Claude Sonnet 5 Thinking Level · HighTools | 30.80 | 2026-06-30 | Unknown | Closed |
— | ![]() Muse Spark 1.3 Thinking Level · LowTools | 29.30 | 2026-09-02 | Unknown | Closed |
— | ![]() Claude Sonnet 5 Thinking Level · MediumTools | 28.00 | 2026-06-30 | Unknown | Closed |
— | ![]() GPT-5.6 Sol Thinking Level · LowTools | 24.60 | 2026-06-26 | Unknown | Closed |
Cursor's September 10, 2026 leaderboard reports 51.8% for Claude Fable 5.1 Max, 46.6% for Claude Opus 5 Max, 41.7% for GPT-5.6 Sol Max, 41.6% for Muse Spark 1.3 Max, 41.4% for Grok 4.6 Extra High, 39.6% for Gemini 3.8 Flash High, and 34.1% for Claude Sonnet 5 Max.