Scale AI 于 2025 年 9 月 21 日发布了 SWE-Bench Pro,这是一个针对 AI 代理在软件工程任务上的评估基准。该基准包含 1,865 个问题,来源于 41 个活跃维护的代码仓库,聚焦企业级复杂任务。现有模型在该基准上的表现显示出显著差距,顶级模型的通过率低于 25%,而最近的榜单更新显示部分模型已超过 40%。这一发布旨在推动 AI 在长时程软件开发中的应用研究。
SWE-Bench Pro 商业私有集由 18 个合作方的专有代码库构成,共 276 个真实软件工程任务,用于检验编码智能体在训练数据不可见、工业级代码库中的泛化能力。官方主指标为 Resolve Rate,补丁必须同时通过问题修复测试且不引入回归。
查看 SWE-Bench Pro - Commercial 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
![]() Claude Opus 4.6 开启思考工具 | 47.10 | 2026-02-05 | 未知 | 闭源 | |
![]() GPT-5.4 思考水平·极高工具 | 43.40 | 2026-03-05 | 未知 | 闭源 | |
![]() Gemini 3.1 Pro Preview 开启思考工具 | 32.20 | 2026-02-20 | 未知 | 闭源 |
截至 2026-08-12,官方私有集排行榜中 Muse Spark 1.1 的 Resolve Rate 为 51.50%;带明确模型、思考档位与 mini-swe-agent 配置的可映射成绩包括 Claude Opus 4.6 (thinking) 47.10%、GPT-5.4 (xHigh) 43.40%、Gemini 3.1 Pro (thinking) 32.20%。