DataLearner 标志
NE

Nemotron 3 Ultra

推理大模型长上下文

NVIDIA Nemotron 3 Ultra 550B-A55B

发布时间: 2026-06-04更新于: 2026-08-23知识截止: 2026-05浏览量: 925
模型参数
5500亿
上下文长度
1M
多语言支持
支持
推理能力
5/5

Nemotron 3 Ultra 是 NVIDIA 于 2026 年 6 月 4 日发布的 Nemotron 3 系列旗舰开放模型,5500 亿总参数 / 550 亿激活的 MoE。它的特别之处在于开放得非常彻底:除权重外还公开了预训练、后训练与量化 checkpoint、训练数据集和完整模型 recipe,许可为 OpenMDW-1.1,允许商业与非商业使用。架构上采用 LatentMoE,把 Mamba-2、MoE 与选择性 Attention 混合,并加入 Multi-Token Prediction 层,支持最高 1M tokens 上下文与 reasoning budget 控制,知识截止 2026 年 5 月;训练经过约 20 万亿 tokens 预训练、监督微调、多环境强化学习与多领域 on-policy 蒸馏四个阶段。能力分布相当偏科:数学与知识问答极强(IMO-AnswerBench 带工具 92.30 在 23 个模型中排第 1,GPQA 87 排 16 个第 1,LiveCodeBench 89 排 126 个第 9),但智能体与长程任务偏弱(Terminal-Bench 2.1 56.40 排 44 个第 41,BrowseComp 44.40 排 54 个第 46)。最低推荐硬件为 8 张 B200,面向有集群资源的团队。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Nemotron 3 Ultra

模型基本信息

推理过程
支持
思考模式
思考模式 (默认)常规模式
上下文长度
1M tokens
最大输出长度
暂无数据
模型类型
推理大模型
输入/输出模态
文本 → 文本
发布时间
2026-06-04
模型文件大小
暂无数据
MoE架构
总参数 / 激活参数
5500亿 / 550亿
知识截止
2026-05
Nemotron 3 Ultra

开源和体验地址

代码开源状态
免费商用授权
预训练权重开源
免费商用授权
Nemotron 3 Ultra

官方介绍与博客

Nemotron 3 Ultra

API接口信息

接口速度
4/5
暂无公开的 API 定价信息。
Nemotron 3 Ultra

评测结果

Nemotron 3 Ultra 当前已收录的代表性评测结果包括 IF Bench(4 / 282,得分 81.70)、IMO-AnswerBench(1 / 24,得分 92.30)、Pinch Bench(2 / 38,得分 90)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

综合评估

共 8 项评测
评测名称 / 模式
得分
排名/总数
GPQA
思考模式
87
1 / 17
MMLU-Pro
思考模式
86.80
17 / 176
LiveBench
常规模式
51.78
90 / 117
HLE
思考模式
28.40
222 / 565
HLE
思考模式
26.70
236 / 565
HLE
思考模式工具
37.40
154 / 565
CritPt
思考模式
3.10
111 / 201

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
思考模式
86.70
137 / 463

编程与软件工程

共 4 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
思考模式
89
15 / 251
SWE-bench Verified
思考模式工具
70.70
58 / 116
SWE-bench Multilingual
思考模式工具
67.70
26 / 30
SciCode
思考模式
44.60
93 / 131

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1689.30
27 / 106

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
思考模式
41.70
62 / 93

Agent能力评测

共 3 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
思考模式工具
83.30
102 / 264
Terminal Bench Hard
思考模式工具
36.40
67 / 244
τ³-Banking
思考模式工具
22.60
85 / 167

指令跟随

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
思考模式
81.70
4 / 282

AI Agent - 信息收集

共 1 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
思考模式工具联网
44.40
49 / 58

数学推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
IMO-AnswerBench
思考模式
88.60
6 / 24
IMO-AnswerBench
思考模式工具
92.30
1 / 24

长上下文能力

共 2 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
思考模式
79.30
54 / 171
LongBench v2
常规模式
61.90
5 / 14

OpenClaw智能体能力综合测评

共 2 项评测
评测名称 / 模式
得分
排名/总数
Pinch Bench
思考模式工具
90
2 / 38
89.92
3 / 45

AI Agent - 工具使用

共 2 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
思考模式工具
56.40
120 / 194
Terminal-Bench 4.0
思考模式工具
0.50
83 / 88

生产力知识

共 4 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA v2
思考模式工具
1091
83 / 106
AA-Briefcase
思考模式工具
878
70 / 84
Harvey Lab-AA
思考模式工具
81.72
30 / 43
AA-AnalystAgent
思考模式工具联网
6.25
29 / 29

多模态理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
思考模式
5
97 / 119

和其他模型对比

Nemotron 3 Ultra

发布机构

NVIDIA Nemotron 3 Ultra 550B-A55B

模型解读

不只是开源权重,而是把配方一起给了

Nemotron 3 Ultra 是 NVIDIA 于 2026 年 6 月 4 日发布的 Nemotron 3 系列旗舰开放模型,也是这个家族规模最大的成员:5500 亿总参数 / 550 亿激活参数的 MoE 结构。

它在一众「开放模型」里的特别之处,在于开放的彻底程度。NVIDIA 放出的不只是可以下载的权重,还包括预训练、后训练和量化三类 checkpoint、用于训练的数据集,以及完整的模型 recipe。许可证为 OpenMDW License Agreement v1.1,明确允许商业与非商业使用。对想复现训练流程、而不只是拿来推理的团队来说,这类开放度目前相当少见。

架构:把 Mamba-2 和 MoE 混在了一起

Nemotron 3 Ultra 采用 LatentMoE 混合架构,把 Mamba-2 状态空间层、MoE 层与选择性的 Attention 组件组合在一起,并加入 Multi-Token Prediction 层提升生成效率。这种混合设计的动机是在超长上下文下压低注意力开销——它支持最高 1M tokens 上下文,并提供 reasoning budget 控制,知识截止时间为 2026 年 5 月。

训练分四个阶段:约 20 万亿 tokens 的预训练(使用爬取与合成的代码、数学、科学和通用知识数据)、监督微调、多环境强化学习,以及多领域 on-policy 蒸馏。官方标注支持英语、法语、西班牙语、意大利语、德语、日语、印地语、韩语、巴西葡萄牙语和中文。

评测:一个偏科非常明显的模型

官方给出的成绩包括 SWE-Bench Verified 70.7%、LiveCodeBench 89.0%、IMO Answer Bench(带工具)92.3%、Terminal Bench 2.1 56.4%、MMLU-ProX 十语言平均 83.0%,另有第三方 LongBench v2 成绩 61.9%。

但把它放进 DataLearner 的横向榜单,会看到一个相当极端的能力分布:

  • 强项——数学、知识与代码题:IMO-AnswerBench(带工具)92.30 在 23 个模型中排第 1,GPQA 87 在 16 个模型中排第 1,IF Bench 81.70 在 33 个模型中排第 2,LiveCodeBench 89 在 126 个模型中排第 9。
  • 弱项——智能体与长程任务:Terminal-Bench 2.1 56.40 在 44 个模型中排第 41,BrowseComp 44.40 在 54 个模型中排第 46,LiveBench 51.78 在 115 个模型中排第 88。

这个反差对选型的指导意义很直接:它擅长「给定一道有明确答案的难题,把它算对」,而不擅长「在开放环境里连续操作很多步」。做数学、科研推理、算法题和知识密集问答是它的主场;要拿它当自主智能体的底座,则需要额外的编排和纠错机制兜底。

部署门槛不低

Hugging Face 模型卡标注 BF16 版本总参数 550B、激活 55B,官方给出的最低推荐硬件是 8 张 B200 或同等配置,多节点部署使用 Ray v2 编排,推理引擎支持 vLLM、SGLang 和 TensorRT-LLM。这基本意味着它面向的是有集群资源的研究机构与企业,而非个人本地部署——想在消费级硬件上跑,需要等社区的量化版本。

官方来源

Nemotron 3 Ultra

常见问题

Nemotron 3 Ultra 是什么模型?

NVIDIA 于 2026 年 6 月 4 日发布的 Nemotron 3 Ultra,550B 总参数、55B 激活参数,采用 LatentMoE / Mamba-2 / Attention 混合架构,支持 1M 上下文和可开关 reasoning。

Nemotron 3 Ultra 支持哪些输入和输出模态?

当前官方资料记录其支持文本输入,并生成文本输出。

Nemotron 3 Ultra 的上下文窗口和最大输出是多少?

上下文窗口为 1M。未公开或无法确认的规格不做推测。

Nemotron 3 Ultra 适合哪些任务?

根据已收录的官方能力标签,它适合推理大模型、多语言相关任务;实际效果应结合具体工作流验证。

Nemotron 3 Ultra 是否开源?

代码与模型权重按 免费商用授权 记录;使用前仍应核对官方许可原文。

Is Nemotron 3 Ultra open source?

The checkpoint is listed under the Free Commercial license. Review the linked license text before commercial or derivative use.

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码