SWE-2
编程大模型SWE-2
Cognition 在 Kimi K3 基础上强化学习后训练的编程模型,支持 Medium/High/Max 三档推理强度,专为 Devin 智能体编码工作流优化,仅通过 Devin 订阅提供,无独立 API。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
模型基本信息
开源和体验地址
官方介绍与博客
API接口信息
评测结果
SWE-2 当前已收录的代表性评测结果包括 Terminal-Bench 2.1(1 / 193,得分 92.80)、Terminal-Bench 4.0(20 / 87,得分 27.30)、FrontierCode 1.1 Main(4 / 5,得分 50)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
发布机构
模型解读
模型定位与发布
SWE-2 由 Cognition(Devin 背后的公司)于 2026 年 9 月 10 日发布,是其编程模型 SWE 系列的最新一代,已在 Devin Desktop、CLI 上线,并逐步推广到 Devin Web 与 Fusion。这是 Cognition 首个带有分档推理强度(reasoning effort)的模型,Medium/High/Max 三档在同一次强化学习训练中联合优化,训练时对每一档都施加了计算成本惩罚。
架构与训练
SWE-2 基于 Moonshot AI 的开源模型 Kimi K3(2.8 万亿参数)强化学习后训练而成,同时针对编码准确率与任务完成的计算成本进行联合优化。Cognition 未单独披露 SWE-2 自身的参数规模、上下文窗口或知识截止日期。
访问方式与许可
SWE-2 没有独立对外的 API,权重也未公开,只能通过 Devin 桌面版/CLI/Web/Fusion 使用;官方将其计入 Devin Pro(每月 20 美元)订阅额度,博客发布时称至 2026 年 10 月 10 日前 SWE-2 用量免费开放。
官方评测
官方博客给出的成绩表注明“每个模型取其跨推理档位(reasoning-effort settings)的最高分”,未逐条标注具体档位:FrontierCode 1.1 Main 50.0%(与 Claude Fable 5.1 的 50.9% 接近,但成本低 64%);Terminal-Bench 2.1 92.8%;Terminal-Bench 4 27.3%。同表还给出 DeepSWE 1.1 上 73.0% 的成绩,但该基准版本在站内暂无法与现有条目对应,未收录。官方称相比前代 SWE-1.7,在同一基准上平均减少 58% 的对话轮次、降低 81% 的成本。
官方来源
DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
