Nemotron 3.5 Lightning
推理大模型工具使用NVIDIA Nemotron 3.5 Lightning 30B-A3B
NVIDIA 于 2026 年 8 月 11 日发布的开放权重 MoE 模型,总参数 30B、每 token 激活约 3B,采用 Mamba-2 + MoE + 注意力混合架构,上下文最长 100 万 tokens。定位不是通用前沿聊天模型,而是长时间运行的智能体工作流中的高吞吐「主力模型」,以 OpenMDW-1.1 许可开放权重、训练数据与训练配方。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
模型基本信息
开源和体验地址
官方介绍与博客
API接口信息
发布机构
模型解读
Nemotron 3.5 Lightning 是 NVIDIA 于 2026 年 8 月 11 日发布并开放权重的混合专家(MoE)模型,与模型路由器 NeMo Switchyard 一同推出。它是 Nemotron 3 系列中主打效率的新成员:总参数 30B,每 token 仅激活约 3B,目标是把高频智能体工作负载的推理算力压下来,而不是去争夺通用前沿聊天模型的位置。
架构与规格
- 架构:Mamba-2 + MoE + 注意力的混合结构
- 参数:30B 总参数 / 3B 激活参数(30B-A3B)
- 上下文长度:最长 1,000,000 tokens
- 许可:OpenMDW-1.1,开放权重、训练数据与训练配方
- 发布形态:提供 BF16 与 NVFP4 量化检查点,并配套 DFlash / DSpark 草稿模型用于投机解码
官方给出的效果
NVIDIA 称该模型的输出速度可达同规模模型的 4 倍,在 10,000 个任务的批量场景下比 Qwen3.6-35B 快约 30% 且精度相当。第三方评测机构 Artificial Analysis 给出的 Intelligence Index 为 24,比 Nemotron 3 Nano 的 15 高 9 分。
获取方式
权重已在 Hugging Face 与 ModelScope 提供下载,也可通过 build.nvidia.com 上的 NVIDIA NIM 微服务、OpenRouter 以及一系列 NVIDIA 云合作伙伴、后训练平台与推理平台调用。由于是开放权重模型,NVIDIA 官方未发布第一方按 token 计价的 API 价格,DataLearner 因此暂不记录其 API 定价。
规格与说法来自 NVIDIA 官方博客与开发者博客(2026-08-30 核实)。
DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
