DataLearner 标志
SW

SWE-2

编程大模型

SWE-2

发布时间: 2026-09-10浏览量: 0
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
暂无数据
多语言支持
暂无数据
推理能力
暂无数据

Cognition 在 Kimi K3 基础上强化学习后训练的编程模型,支持 Medium/High/Max 三档推理强度,专为 Devin 智能体编码工作流优化,仅通过 Devin 订阅提供,无独立 API。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

SWE-2

模型基本信息

推理过程
支持
思考模式
思考水平 · 高 (High) (默认)思考水平 · 中 (Medium)思考水平 · 最高 (Max)
上下文长度
暂无数据
最大输出长度
暂无数据
模型类型
编程大模型
输入/输出模态
文本 → 文本
发布时间
2026-09-10
模型文件大小
暂无数据
MoE架构
总参数 / 激活参数
暂无数据 / 不适用
知识截止
暂无数据
SWE-2

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
SWE-2

官方介绍与博客

DataLearnerAI博客
暂无
SWE-2

API接口信息

接口速度
暂无数据
暂无公开的 API 定价信息。
SWE-2

评测结果

SWE-2 当前已收录的代表性评测结果包括 Terminal-Bench 2.1(1 / 193,得分 92.80)、Terminal-Bench 4.0(20 / 87,得分 27.30)、FrontierCode 1.1 Main(4 / 5,得分 50)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式

AI Agent - 工具使用

共 2 项评测
评测名称 / 模式
得分
排名/总数
92.80
1 / 193
27.30
20 / 87

编程与软件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
50
4 / 5
SWE-2

发布机构

SWE-2

模型解读

模型定位与发布

SWE-2 由 Cognition(Devin 背后的公司)于 2026 年 9 月 10 日发布,是其编程模型 SWE 系列的最新一代,已在 Devin Desktop、CLI 上线,并逐步推广到 Devin Web 与 Fusion。这是 Cognition 首个带有分档推理强度(reasoning effort)的模型,Medium/High/Max 三档在同一次强化学习训练中联合优化,训练时对每一档都施加了计算成本惩罚。

架构与训练

SWE-2 基于 Moonshot AI 的开源模型 Kimi K3(2.8 万亿参数)强化学习后训练而成,同时针对编码准确率与任务完成的计算成本进行联合优化。Cognition 未单独披露 SWE-2 自身的参数规模、上下文窗口或知识截止日期。

访问方式与许可

SWE-2 没有独立对外的 API,权重也未公开,只能通过 Devin 桌面版/CLI/Web/Fusion 使用;官方将其计入 Devin Pro(每月 20 美元)订阅额度,博客发布时称至 2026 年 10 月 10 日前 SWE-2 用量免费开放。

官方评测

官方博客给出的成绩表注明“每个模型取其跨推理档位(reasoning-effort settings)的最高分”,未逐条标注具体档位:FrontierCode 1.1 Main 50.0%(与 Claude Fable 5.1 的 50.9% 接近,但成本低 64%);Terminal-Bench 2.1 92.8%;Terminal-Bench 4 27.3%。同表还给出 DeepSWE 1.1 上 73.0% 的成绩,但该基准版本在站内暂无法与现有条目对应,未收录。官方称相比前代 SWE-1.7,在同一基准上平均减少 58% 的对话轮次、降低 81% 的成本。

官方来源

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码