DataLearner 标志
MU

Muse Spark 1.2

推理大模型编程大模型

Muse Spark 1.2 by Meta Superintelligence Labs

发布时间: 2026-08-05更新于: 2026-08-24 11:44:12.1950
在线体验GitHubHugging FaceCompare
模型参数
未披露
上下文长度
1M
中文支持
不支持
推理能力

Muse Spark 1.2 是 Meta 于 2026 年 8 月 5 日发布的 Muse Spark 系列编程向升级版本,与终端编程智能体 Muse Code 同期推出;模型保持 1M token 上下文与多模态输入,官方重点强化长程编程、复杂调试与工具调用可靠性,通过 Meta Model API 提供,输入 / 输出价格为 1.25 / 4.25 美元每百万 token。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Muse Spark 1.2

模型基本信息

推理过程
支持
思考模式
思考水平 · 极高 (Extra-High)
上下文长度
1M tokens
最大输出长度
暂无数据
模型类型
推理大模型
输入/输出模态
文本、图像、音频、视频、pdf → 文本
发布时间
2026-08-05
模型文件大小
暂无数据
MoE架构
总参数 / 激活参数
暂无数据 / 不涉及
知识截止
暂无数据
Muse Spark 1.2

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无GitHub开源地址
Hugging Face
暂无开源HuggingFace地址
Muse Spark 1.2

官方介绍与博客

DataLearnerAI博客
暂无介绍博客
Muse Spark 1.2

API接口信息

接口速度
4/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$1.25/ 1M$4.25/ 1M
缓存定价Prompt缓存
类型有效期写入读取
文本--$0.150/ 1M
Muse Spark 1.2

评测结果

Muse Spark 1.2 当前已收录的代表性评测结果包括 MCP-Atlas(1 / 39,得分 90.30)、Terminal-Bench 2.1(16 / 45,得分 82.90)、DeepSWE(12 / 28,得分 59.30)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式

AI Agent - 工具使用

共 2 项评测
评测名称 / 模式
得分
排名/总数
MCP-Atlas
思考模式工具
90.30
1 / 39
Terminal-Bench 2.1
极高工具
82.90
16 / 45

编程与软件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
DeepSWE
极高工具
59.30
12 / 28

生产力知识

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA v2
思考模式工具
1631
7 / 14

和其他模型对比

暂时没有为该模型整理的相关对比页面。

想自定义其他组合?打开对比工具

Muse Spark 1.2

发布机构

Facebook AI研究实验室
Facebook AI研究实验室
查看发布机构详情
Muse Spark 1.2 by Meta Superintelligence Labs

模型解读

2026 年 8 月 5 日,Meta Superintelligence Labs 发布 Muse Spark 1.2,同时推出面向终端的编程智能体 Muse Code。官方将 1.2 定位为 Muse Spark 1.1 的编程向更新,称其在代码生成、复杂调试、代码库理解和端到端开发工作流上均有提升。DataLearner 当前机构目录仍使用“Facebook AI研究实验室”作为 Meta/FAIR 相关模型的归档机构,本条目按该目录收录。


相较前代的变化

Meta 表示,Muse Spark 1.2 相对 Muse Spark 1.1 显著扩大了编程任务上的训练算力投入,并扩展了训练环境的多样性。官方描述模型在长程编程任务上做了针对性训练,覆盖整仓库级生成、大型端到端项目和自动化研究类任务;为支撑这类长任务,模型使用规划来编排工作顺序、通过目标条件化保持方向,并对上下文进行压缩。官方给出的一个案例是:模型在一项 GPU kernel 优化任务上持续迭代,跨越 1000 次以上工具调用、最长约 24 小时,相对给定基线实现取得了明显改进。


上下文、模态与接口能力

Muse Spark 1.2 的上下文窗口为 1,048,576 tokens(1M),官方称长任务可在一个会话内从头跑到尾。输入支持文本、图像、视频、音频和 PDF 文档,输出为文本。接口层面支持结构化输出和并行函数调用,可使用 tools / tool_choice 参数以及基于 JSON Schema 的响应格式约束。推理强度方面,官方评测方法学文档说明 Muse Spark 1.2 的最高可用档位为 xhigh reasoning effort。Meta 未公开该模型的参数规模、最大输出长度和知识截止时间,相关字段暂留空。


官方评测成绩

Meta 在发布材料与《Muse Spark 1.2 & Muse Code Evaluation Methodology》中给出了下列成绩(Muse Spark 1.2 均使用 xhigh reasoning effort,经 Meta Model API 提供服务):

  • Terminal-Bench 2.1:82.9%。使用 Muse Code 作为智能体产品,覆盖官方 2.1 版全部 89 个任务,在隔离的 Daytona 沙箱中运行,报告 5 次尝试的平均任务成功率(pass@1)。
  • DeepSWE v1.1:59.3%。同样以 Muse Code 运行,采用 Harbor 格式数据集、尽量对齐官方 runner Pier v0.3.0;评测期间禁用外部网络,仅保留模型端点可达,任务需同时通过功能校验器与回归检查才算通过,报告 5 次尝试的平均 pass@1。
  • MCP-Atlas:90.3%。该成绩由 Scale AI 使用基准自带的智能体 harness 与评分流水线产出,任务在覆盖率不低于 0.75 时判定通过。
  • GDPval-AA v2:1631 Elo。成绩由 Artificial Analysis 在其 Stirrup 智能体 harness 中产出,覆盖 220 项真实职业任务,指标为盲对比得出的 Elo(人类基线锚定为 1000)。
  • Meta Internal Coding Bench:70.6%。基于 Meta 内部代码库的 440 个任务,使用内部 harness 与专用评分容器,每任务两次尝试。该基准不对外开放,DataLearner 未单独收录。

需要注意口径差异:Terminal-Bench 2.1 与 DeepSWE v1.1 的官方公开榜单使用统一 harness(DeepSWE 官方榜单为 mini-swe-agent),而 Meta 的评测让每个模型搭配各自的智能体产品,因此与公开榜单并非同一 harness;Meta 也说明其评测设置未针对第三方专有模型调优。截至 2026 年 8 月 7 日,Terminal-Bench 2.1 官方公开榜单尚未收录 Muse Spark 1.2 的核验条目,上述成绩应视为厂商自报结果。


访问方式、价格与许可

Muse Spark 1.2 通过 Meta Model API 提供,也可在 Muse Code 中调用。官方公布的价格为输入 1.25 美元 / 百万 tokens、输出 4.25 美元 / 百万 tokens,缓存读取 0.15 美元 / 百万 tokens,联网搜索按 2.50 美元 / 1000 次调用计费。

许可方面,Muse Spark 1.2 在 8 月 5 日发布时为闭源托管模型,未公开权重。2026 年 8 月 10 日,Mark Zuckerberg 宣布 Meta 将在“未来几周”开放 Muse Spark 1.2 的权重,这是 Meta 自 2026 年 4 月推出 Muse Spark 并停止 Llama 系列以来对闭源路线的一次调整;同日 Meta 以 Apache 2.0 许可发布了 300 亿参数的开放权重模型 Muse Glimmer。截至本条目更新时,Muse Spark 1.2 的权重尚未实际放出,因此仍按闭源收录,后续如权重与许可正式发布可按更新流程修正。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码