查看 SWE-Bench Pro V2 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
— | ![]() Claude Opus 5 思考水平·极高工具 | 99.40 | 2026-07-24 | 未知 | 闭源 |
— | ![]() Claude Fable 5.1 思考水平·高工具 | 99.10 | 2026-09-01 | 未知 | 闭源 |
— | ![]() Kimi K3 思考水平·Max工具 | 97.70 | 2026-07-16 | 28000亿 | 有条件商用 |
— | ![]() GPT-6 Astra 思考水平·高工具 | 96.90 | 2026-09-03 | 未知 | 闭源 |
— | ![]() GLM-5.3 思考水平·Max工具 | 95.60 | 2026-08-14 | 7440亿 | 有条件商用 |
— | ![]() GPT-5.6 Sol 思考水平·极高工具 | 95.50 | 2026-06-26 | 未知 | 闭源 |
— | ![]() Gemini 3.8 Flash 思考水平·高工具 | 94.86 | 2026-09-02 | 未知 | 闭源 |
— | ![]() Claude Sonnet 5 思考水平·极高工具 | 93.15 | 2026-06-30 | 未知 | 闭源 |
— | ![]() GPT-5.6 Terra 思考水平·极高工具 | 92.37 | 2026-06-26 | 未知 | 闭源 |
— | Inkling 思考水平·极高工具 | 89.88 | 2026-07-15 | 9750亿 | 免费商用 |
官方指标为一次运行的 Resolve Rate(百分比);代理阶段仅能访问模型端点,提交补丁在干净环境重新评分。公开题库及修复提交可能已进入模型训练数据,因此公开集成绩不等同于未见过代码的泛化能力。不同智能体框架见官方榜单。 来源:https://labs.scale.com/leaderboard/swe_bench_pro_public_v2