DataLearner 标志
MU

Muse Glimmer-30B

推理大模型工具使用

Muse Glimmer-30B by Meta Superintelligence Labs

发布时间: 2026-08-10知识截止: 2026-01-042
在线体验GitHubHugging FaceCompare
模型参数
296亿
上下文长度
128K+
中文支持
不支持
推理能力

Muse Glimmer-30B 是 Meta 于 2026 年 8 月 10 日以 Apache 2.0 发布的约 29.6B 稠密多模态智能体模型,支持 131,072+ 上下文和 low/medium/high/xhigh 推理档,可通过 4-bit 量化在 24GB 或 32GB 级消费设备上本地运行。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Muse Glimmer-30B

模型基本信息

推理过程
支持
思考模式
思考水平 · 低 (Low)思考水平 · 中 (Medium)思考水平 · 高 (High)思考水平 · 极高 (Extra-High)
上下文长度
128K+ tokens
最大输出长度
暂无数据
模型类型
推理大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-08-10
模型文件大小
约 55.5 GiB(BF16);4-bit 量化版本低于 20 GB
MoE架构
总参数 / 激活参数
296亿 / 不涉及
知识截止
2026-01-04
Muse Glimmer-30B

开源和体验地址

代码开源状态
预训练权重开源
Apache 2.0- 免费商用授权
GitHub 源码
暂无GitHub开源地址
在线体验
暂无在线体验地址
Muse Glimmer-30B

官方介绍与博客

DataLearnerAI博客
暂无介绍博客
Muse Glimmer-30B

API接口信息

接口速度
3/5
暂无公开的 API 定价信息。
Muse Glimmer-30B

评测结果

Muse Glimmer-30B 当前已收录的代表性评测结果包括 AA-LCR(1 / 16,得分 80)、IF Bench(4 / 31,得分 77)、AIME 2026(6 / 19,得分 94.70)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

综合评估

共 2 项评测
评测名称 / 模式
得分
排名/总数
83.50
63 / 188
HLE
22
109 / 173

编程与软件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
76
37 / 113
51.20
39 / 55
43.60
2 / 2

指令跟随

共 1 项评测
评测名称 / 模式
得分
排名/总数
77
4 / 31

长上下文能力

共 1 项评测
评测名称 / 模式
得分
排名/总数
80
1 / 16

数学推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
94.70
6 / 19

AI Agent - 工具使用

共 3 项评测
评测名称 / 模式
得分
排名/总数
MCP-Atlas
工具
75.50
12 / 28
65.90
19 / 25
51.70
29 / 29

生产力知识

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA v2
工具
953
6 / 6

AI Agent - 信息收集

共 1 项评测
评测名称 / 模式
得分
排名/总数
DeepSearchQA
工具联网
74.60
2 / 2

多模态理解

共 3 项评测
评测名称 / 模式
得分
排名/总数
78.80
9 / 9
75.80
2 / 2
74
5 / 7

Agent能力评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
τ³-Banking
工具
23.50
2 / 2

和其他模型对比

暂时没有为该模型整理的相关对比页面。

想自定义其他组合?打开对比工具

Muse Glimmer-30B

发布机构

Facebook AI研究实验室
Facebook AI研究实验室
查看发布机构详情
Muse Glimmer-30B by Meta Superintelligence Labs

模型解读

发布背景与模型定位

2026 年 8 月 10 日,Meta Superintelligence Labs 发布 Muse Glimmer-30B,并以 Apache 2.0 许可开放模型权重。该模型由 Muse Spark 蒸馏而来,面向可在个人设备上持续运行的本地智能体工作流,重点覆盖多步推理、工具与函数调用、错误恢复、编程、电脑操作和 LLM-as-a-judge 等任务。模型无需依赖云端基础设施即可在支持的 Mac 或单消费级 GPU PC 上运行。

架构与技术规格

Muse Glimmer-30B 是带独立感知编码器的稠密因果 Transformer,总参数约 29.6B。语言模型含 52 层、6656 隐藏维度,按三个局部滑动窗口注意力层加一个全局注意力层的模式重复,局部窗口为 2048 tokens;视觉侧采用约 1.8B 参数的 ViT-G/14 感知编码器。模型支持文本与图像交错输入、文本输出,最多为每张图像分配 4096 个视觉 tokens,上下文长度为 131,072+ tokens,官方知识截止日期为 2026 年 1 月 4 日。

智能体与推理能力

模型卡将端到端智能体任务完成、可靠工具使用、多步推理、工具失败恢复、多模态理解和智能体脚手架兼容性列为主要能力。Muse Glimmer 可在 OpenClaw、Hermes Agent 等编排模式中工作,并支持 low、medium、high、xhigh 四档 reasoning strength;官方建议复杂推理、编程和智能体任务使用 high 或 xhigh。模型训练覆盖 100 多种语言,但官方同时提醒其并未对所有训练语言完成全面评测。

本地部署与推理优化

Meta 为本地部署提供 BF16 全精度权重、两种 4-bit 量化权重、DFlash 推测解码 drafter 和感知编码器。官方模型卡称 4-bit 量化可把语言模型压缩到 20 GB 以下,使语言模型、KV cache、视觉编码器和 drafter 能同时放入 24 GB 或 32 GB 内存/显存空间。DFlash 以一次前向提出 16-token 块的方式加速生成;官方测得 RTX 5090 上从 74.9 tokens/s 提升到 233.4 tokens/s(3.1 倍),Apple M4 Max 和 M5 Max 上分别提升 1.5 倍和 1.8 倍,测试条件为 batch size 1 与 greedy decoding。

官方评测

官方统一使用 high reasoning strength、temperature=1.0、top_p=0.95、top_k=64 评测 Muse Glimmer。模型卡公布的代表性结果包括 MCP-Atlas 75.5、DeepSearchQA 74.6、SWE-Bench Pro 51.2、SWE-Bench Verified 76.0、SciCode 43.6、CharXiv Reasoning 78.8、AIME 2026 94.7、GPQA Diamond 83.5 和 AA-LCR 80.0。DataLearner 已将站内 benchmark 目录能够精确匹配的成绩结构化录入;WildClawBench、Gaia2、SkillsBench、ScreenSpot-Pro 与 BEAM-128K 等当前缺少对应目录项的结果暂不强行映射。

许可、获取方式与限制

完整精度和量化模型制品均按 Apache 2.0 许可发布,官方 Hugging Face 仓库提供 BF16 权重和模型卡。该模型没有官方托管 API 定价,当前以本地部署为主要使用方式。Meta 提醒:模型可能产生不准确、有偏或不适当的输出;新颖的长程任务仍可能出现多步推理错误;视频输入按单帧处理而非专门的视频建模;量化推理在边缘场景可能与全精度版本存在轻微质量差异。将模型接入可执行真实操作的智能体时,应增加不可逆操作确认、人类复核和应用级安全护栏。

官方资料

Meta AI Research 发布博客 · 官方 Hugging Face 模型卡与权重 · 官方评测方法报告 · Meta 开发者文档

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码