Muse Spark 1.2
推理大模型编程大模型Muse Spark 1.2 by Meta Superintelligence Labs
Muse Spark 1.2 是 Meta 于 2026 年 8 月 5 日发布的 Muse Spark 系列编程向升级版本,与终端编程智能体 Muse Code 同期推出;模型保持 1M token 上下文与多模态输入,官方重点强化长程编程、复杂调试与工具调用可靠性,通过 Meta Model API 提供,输入 / 输出价格为 1.25 / 4.25 美元每百万 token。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
模型基本信息
开源和体验地址
官方介绍与博客
API接口信息
评测结果
Muse Spark 1.2 当前已收录的代表性评测结果包括 MCP-Atlas(1 / 39,得分 90.30)、Terminal-Bench 2.1(16 / 45,得分 82.90)、DeepSWE(12 / 28,得分 59.30)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
和其他模型对比
暂时没有为该模型整理的相关对比页面。
想自定义其他组合?打开对比工具
发布机构
模型解读
2026 年 8 月 5 日,Meta Superintelligence Labs 发布 Muse Spark 1.2,同时推出面向终端的编程智能体 Muse Code。官方将 1.2 定位为 Muse Spark 1.1 的编程向更新,称其在代码生成、复杂调试、代码库理解和端到端开发工作流上均有提升。DataLearner 当前机构目录仍使用“Facebook AI研究实验室”作为 Meta/FAIR 相关模型的归档机构,本条目按该目录收录。
相较前代的变化
Meta 表示,Muse Spark 1.2 相对 Muse Spark 1.1 显著扩大了编程任务上的训练算力投入,并扩展了训练环境的多样性。官方描述模型在长程编程任务上做了针对性训练,覆盖整仓库级生成、大型端到端项目和自动化研究类任务;为支撑这类长任务,模型使用规划来编排工作顺序、通过目标条件化保持方向,并对上下文进行压缩。官方给出的一个案例是:模型在一项 GPU kernel 优化任务上持续迭代,跨越 1000 次以上工具调用、最长约 24 小时,相对给定基线实现取得了明显改进。
上下文、模态与接口能力
Muse Spark 1.2 的上下文窗口为 1,048,576 tokens(1M),官方称长任务可在一个会话内从头跑到尾。输入支持文本、图像、视频、音频和 PDF 文档,输出为文本。接口层面支持结构化输出和并行函数调用,可使用 tools / tool_choice 参数以及基于 JSON Schema 的响应格式约束。推理强度方面,官方评测方法学文档说明 Muse Spark 1.2 的最高可用档位为 xhigh reasoning effort。Meta 未公开该模型的参数规模、最大输出长度和知识截止时间,相关字段暂留空。
官方评测成绩
Meta 在发布材料与《Muse Spark 1.2 & Muse Code Evaluation Methodology》中给出了下列成绩(Muse Spark 1.2 均使用 xhigh reasoning effort,经 Meta Model API 提供服务):
- Terminal-Bench 2.1:82.9%。使用 Muse Code 作为智能体产品,覆盖官方 2.1 版全部 89 个任务,在隔离的 Daytona 沙箱中运行,报告 5 次尝试的平均任务成功率(pass@1)。
- DeepSWE v1.1:59.3%。同样以 Muse Code 运行,采用 Harbor 格式数据集、尽量对齐官方 runner Pier v0.3.0;评测期间禁用外部网络,仅保留模型端点可达,任务需同时通过功能校验器与回归检查才算通过,报告 5 次尝试的平均 pass@1。
- MCP-Atlas:90.3%。该成绩由 Scale AI 使用基准自带的智能体 harness 与评分流水线产出,任务在覆盖率不低于 0.75 时判定通过。
- GDPval-AA v2:1631 Elo。成绩由 Artificial Analysis 在其 Stirrup 智能体 harness 中产出,覆盖 220 项真实职业任务,指标为盲对比得出的 Elo(人类基线锚定为 1000)。
- Meta Internal Coding Bench:70.6%。基于 Meta 内部代码库的 440 个任务,使用内部 harness 与专用评分容器,每任务两次尝试。该基准不对外开放,DataLearner 未单独收录。
需要注意口径差异:Terminal-Bench 2.1 与 DeepSWE v1.1 的官方公开榜单使用统一 harness(DeepSWE 官方榜单为 mini-swe-agent),而 Meta 的评测让每个模型搭配各自的智能体产品,因此与公开榜单并非同一 harness;Meta 也说明其评测设置未针对第三方专有模型调优。截至 2026 年 8 月 7 日,Terminal-Bench 2.1 官方公开榜单尚未收录 Muse Spark 1.2 的核验条目,上述成绩应视为厂商自报结果。
访问方式、价格与许可
Muse Spark 1.2 通过 Meta Model API 提供,也可在 Muse Code 中调用。官方公布的价格为输入 1.25 美元 / 百万 tokens、输出 4.25 美元 / 百万 tokens,缓存读取 0.15 美元 / 百万 tokens,联网搜索按 2.50 美元 / 1000 次调用计费。
许可方面,Muse Spark 1.2 在 8 月 5 日发布时为闭源托管模型,未公开权重。2026 年 8 月 10 日,Mark Zuckerberg 宣布 Meta 将在“未来几周”开放 Muse Spark 1.2 的权重,这是 Meta 自 2026 年 4 月推出 Muse Spark 并停止 Llama 系列以来对闭源路线的一次调整;同日 Meta 以 Apache 2.0 许可发布了 300 亿参数的开放权重模型 Muse Glimmer。截至本条目更新时,Muse Spark 1.2 的权重尚未实际放出,因此仍按闭源收录,后续如权重与许可正式发布可按更新流程修正。
DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
