Nemotron 3 Ultra 是什么模型?
NVIDIA 于 2026 年 6 月 4 日发布的 Nemotron 3 Ultra,550B 总参数、55B 激活参数,采用 LatentMoE / Mamba-2 / Attention 混合架构,支持 1M 上下文和可开关 reasoning。
NVIDIA Nemotron 3 Ultra 550B-A55B
Nemotron 3 Ultra 是 NVIDIA 于 2026 年 6 月 4 日发布的 Nemotron 3 系列旗舰开放模型,5500 亿总参数 / 550 亿激活的 MoE。它的特别之处在于开放得非常彻底:除权重外还公开了预训练、后训练与量化 checkpoint、训练数据集和完整模型 recipe,许可为 OpenMDW-1.1,允许商业与非商业使用。架构上采用 LatentMoE,把 Mamba-2、MoE 与选择性 Attention 混合,并加入 Multi-Token Prediction 层,支持最高 1M tokens 上下文与 reasoning budget 控制,知识截止 2026 年 5 月;训练经过约 20 万亿 tokens 预训练、监督微调、多环境强化学习与多领域 on-policy 蒸馏四个阶段。能力分布相当偏科:数学与知识问答极强(IMO-AnswerBench 带工具 92.30 在 23 个模型中排第 1,GPQA 87 排 16 个第 1,LiveCodeBench 89 排 126 个第 9),但智能体与长程任务偏弱(Terminal-Bench 2.1 56.40 排 44 个第 41,BrowseComp 44.40 排 54 个第 46)。最低推荐硬件为 8 张 B200,面向有集群资源的团队。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
Nemotron 3 Ultra 当前已收录的代表性评测结果包括 IF Bench(4 / 282,得分 81.70)、IMO-AnswerBench(1 / 24,得分 92.30)、Pinch Bench(2 / 38,得分 90)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
Nemotron 3 Ultra 是 NVIDIA 于 2026 年 6 月 4 日发布的 Nemotron 3 系列旗舰开放模型,也是这个家族规模最大的成员:5500 亿总参数 / 550 亿激活参数的 MoE 结构。
它在一众「开放模型」里的特别之处,在于开放的彻底程度。NVIDIA 放出的不只是可以下载的权重,还包括预训练、后训练和量化三类 checkpoint、用于训练的数据集,以及完整的模型 recipe。许可证为 OpenMDW License Agreement v1.1,明确允许商业与非商业使用。对想复现训练流程、而不只是拿来推理的团队来说,这类开放度目前相当少见。
Nemotron 3 Ultra 采用 LatentMoE 混合架构,把 Mamba-2 状态空间层、MoE 层与选择性的 Attention 组件组合在一起,并加入 Multi-Token Prediction 层提升生成效率。这种混合设计的动机是在超长上下文下压低注意力开销——它支持最高 1M tokens 上下文,并提供 reasoning budget 控制,知识截止时间为 2026 年 5 月。
训练分四个阶段:约 20 万亿 tokens 的预训练(使用爬取与合成的代码、数学、科学和通用知识数据)、监督微调、多环境强化学习,以及多领域 on-policy 蒸馏。官方标注支持英语、法语、西班牙语、意大利语、德语、日语、印地语、韩语、巴西葡萄牙语和中文。
官方给出的成绩包括 SWE-Bench Verified 70.7%、LiveCodeBench 89.0%、IMO Answer Bench(带工具)92.3%、Terminal Bench 2.1 56.4%、MMLU-ProX 十语言平均 83.0%,另有第三方 LongBench v2 成绩 61.9%。
但把它放进 DataLearner 的横向榜单,会看到一个相当极端的能力分布:
这个反差对选型的指导意义很直接:它擅长「给定一道有明确答案的难题,把它算对」,而不擅长「在开放环境里连续操作很多步」。做数学、科研推理、算法题和知识密集问答是它的主场;要拿它当自主智能体的底座,则需要额外的编排和纠错机制兜底。
Hugging Face 模型卡标注 BF16 版本总参数 550B、激活 55B,官方给出的最低推荐硬件是 8 张 B200 或同等配置,多节点部署使用 Ray v2 编排,推理引擎支持 vLLM、SGLang 和 TensorRT-LLM。这基本意味着它面向的是有集群资源的研究机构与企业,而非个人本地部署——想在消费级硬件上跑,需要等社区的量化版本。
NVIDIA 于 2026 年 6 月 4 日发布的 Nemotron 3 Ultra,550B 总参数、55B 激活参数,采用 LatentMoE / Mamba-2 / Attention 混合架构,支持 1M 上下文和可开关 reasoning。
当前官方资料记录其支持文本输入,并生成文本输出。
上下文窗口为 1M。未公开或无法确认的规格不做推测。
根据已收录的官方能力标签,它适合推理大模型、多语言相关任务;实际效果应结合具体工作流验证。
代码与模型权重按 免费商用授权 记录;使用前仍应核对官方许可原文。
The checkpoint is listed under the Free Commercial license. Review the linked license text before commercial or derivative use.
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
