A commercial benchmark dataset for evaluating whether models can solve realistic, complex software-engineering tasks.
Browse the latest scores, model modes, release dates, and parameter sizes for SWE-Bench Pro - Commercial.
Data sourced primarily from official releases (GitHub, Hugging Face, papers), then benchmark leaderboards, then third-party evaluators. Learn about our data methodology
| Rank | Model | License | |||
|---|---|---|---|---|---|
![]() Claude Opus 4.6 Thinking EnabledTools | 47.10 | 2026-02-05 | Unknown | Closed | |
![]() GPT-5.4 Thinking Level · Extra HighTools | 43.40 | 2026-03-05 | Unknown | Closed | |
![]() Gemini 3.1 Pro Preview Thinking EnabledTools | 32.20 | 2026-02-20 | Unknown | Closed |