AI 快讯 编译自 marktechpost #模型发布#开源#Agent

NVIDIA 发布 Nemotron 3 Ultra:550B 参数开源 MoE 混合 Mamba-Transformer,专为长时 Agent 设计

NVIDIA 开源 Nemotron 3 Ultra,550B 总参数(55B 激活)MoE 模型,采用 Mamba-Attention 混合架构,支持 1M token 上下文,推理吞吐量比同类开源 LLM 高约 6 倍,并附带完整训练数据与配方。本文详解其架构、训练技巧、基准测试结果及对中文开发者的实用价值。

编译发布 2026/06/04 原文发布 2026/06/04

一句话看懂

NVIDIA 开源 Nemotron 3 Ultra,550B 参数 MoE 模型,混合 Mamba-Transformer 架构,1M 上下文,推理吞吐量比同类高 6 倍,专为长时运行 Agent 优化。

详细发生了什么

NVIDIA 正式发布 Nemotron 3 Ultra,这是 Nemotron 3 系列中最大的模型,总参数量 550B,但每次推理仅激活 55B 参数。它采用 Mixture-of-Experts(MoE)设计,结合 Mamba 状态空间模型与 Attention 机制,在长序列任务中实现亚二次缩放。模型预训练于 20 万亿 token,上下文窗口扩展至 1M token,并通过 SFT、RLVR 和多教师在线蒸馏(MOPD)进行后训练。

关键架构创新包括:LatentMoE 路由(在固定推理成本下激活更多专家)、Multi-Token Prediction(MTP,原生推测解码加速生成)、以及 NVFP4 4-bit 预训练(首次在大规模上稳定实现)。推理吞吐量在 8K 输入/64K 输出设置下可达 GLM-5.1 的 5.9 倍、Kimi-K2.6 的 4.8 倍。基准测试方面,SWE-Bench Verified 得分 71.9,Terminal Bench 2.1 得分 56.4,RULER 长上下文评测在 1M token 下得分 94.7。

NVIDIA 还开源了训练数据:173B 刷新 GitHub 代码 token、10M 新 SFT 样本、1M 新 RL 任务,以及 15 个新 RL 环境。模型权重、训练配方均以 OpenMDW-1.1 协议发布。

中文圈视角

Nemotron 3 Ultra 对中文开发者意味着几个关键点:

  1. 开源可用但硬件门槛高:模型以 NVFP4 量化发布,在 H100 上需 8 卡 W4A16 部署(FP8 需跨节点)。国内可获取 H100 的团队有限,但华为昇腾、寒武纪等国产卡能否兼容 NVFP4 格式存疑。平替方案可关注 DeepSeek-V3(671B MoE,37B 激活)或 Qwen-3.5(397B),后者在中文任务上可能更优。

  2. Agent 场景的差异化价值:Mamba 架构使长序列推理成本线性增长,这对国内 Agent 应用(如自动化办公、代码助手)极具吸引力。但需注意,模型对中文原生支持未明确说明,可能需额外微调。

  3. 训练数据与合规:开源数据包含大量 GitHub 代码和合成数据集,但未提及中文数据。国内用户若用于商业产品,需自行补充中文语料并注意数据出境合规。

  4. MOPD 技术值得关注:多教师蒸馏方法可缓解多环境 RL 信号稀释问题,国内团队(如智谱、百川)可借鉴此思路提升自家 Agent 模型。

几条值得记住的细节

  • 模型总参数 550B,激活 55B,每层 512 专家,每 token 激活 22 个。
  • 推理吞吐量最高达同类 6 倍,但 prefill 阶段因激活参数多,短输入场景可能落后。
  • 支持三种推理模式:reasoning-off、regular、medium-effort,后者节省约 2.5x token,准确率下降约 7%。
  • 训练中遇到两次 loss 发散,一次因 BF16 梯度精度不足,一次原因不明,通过提前退火学习率解决。
  • 模型在 AA-Omniscience 上非幻觉得分最高(78.7),表明不确定性处理较好。

一句话总结

Nemotron 3 Ultra 是长时 Agent 推理效率的标杆,但国内用户需权衡硬件成本与中文适配,开源数据与训练配方为二次开发提供了扎实基础。