NVIDIA Nemotron 3 Ultra 登陆 Amazon SageMaker JumpStart:550B MoE 模型推理速度提升 5 倍,成本
NVIDIA Nemotron 3 Ultra 现已在 Amazon SageMaker JumpStart 上提供一键部署。该模型拥有 550B 总参数、55B 活跃参数,采用混合 Transformer-Mamba MoE 架构,支持百万 token 上下文,专为长时间运行的自主智能体工作负载优化,推理速度提升 5 倍,成本降低 30%。
一句话看懂
NVIDIA 与 AWS 联合发布 Nemotron 3 Ultra,一款 550B 参数 MoE 推理模型,在 SageMaker JumpStart 上可一键部署,专为自主智能体场景设计,推理速度提升 5 倍,成本降低 30%。
详细发生了什么
NVIDIA 和 AWS 宣布,NVIDIA Nemotron 3 Ultra 模型即日起在 Amazon SageMaker JumpStart 上提供 day-zero 支持,用户可通过一键部署快速使用。Nemotron 3 Ultra 是一个开放的大语言模型,总参数量 550B,但每次前向传播仅激活 55B 参数(MoE 架构),支持高达 1M token 的 context window。
模型基于混合 Transformer-Mamba MoE 架构,采用 NVFP4 精度优化,在长时间运行的自主智能体工作负载中,推理速度提升 5 倍,成本最高降低 30%。它特别适合需要多步推理的场景,如智能体编排、代码代理、深度研究和复杂企业工作流自动化。
部署方式包括 SageMaker Studio 图形界面和 Python SDK,支持 ml.p5en.48xlarge、ml.p5.48xlarge 或 ml.g7e.48xlarge 等 GPU 实例。用户需注意,部署后 SageMaker endpoint 会按小时计费,使用后应及时删除以避免额外费用。
中文圈视角
对于中文开发者来说,Nemotron 3 Ultra 的开放性和 AWS 生态的集成意味着两件事:
-
可用性与门槛:模型通过 SageMaker JumpStart 部署,需要 AWS 账号和 GPU 配额,对国内用户来说,如果使用 AWS 中国区(北京/宁夏)或通过海外账号,均可直接使用。但 GPU 实例(如 ml.p5en.48xlarge)每小时成本可能高达数十美元,个人开发者需谨慎评估成本。国内类似服务如阿里云 PAI、华为云 ModelArts 也提供模型部署,但目前尚无直接对标 Nemotron 3 Ultra 的开放 MoE 模型。
-
国产替代对比:目前国内开源模型如 DeepSeek-V2(236B 总参数,21B 活跃)和 Qwen2.5-72B 在 MoE 架构上也有布局,但 Nemotron 3 Ultra 的 1M token context 和 NVFP4 精度优化在长上下文智能体场景中具有明显优势。对于中文写作、编程辅助等场景,Nemotron 3 Ultra 的多语言能力(虽未明确强调中文优化)理论上可支持,但实际效果需测试。
-
监管与合规:Nemotron 3 Ultra 是开放模型,但通过 AWS 部署涉及数据出境问题。国内企业若需处理敏感数据,建议使用国产平台或私有化部署。目前该模型尚未出现在国内主流模型平台(如 ModelScope)上,中文社区讨论较少,这是一个值得关注的盲点。
几条值得记住的细节
- 模型规格:550B 总参数,55B 活跃参数,MoE 架构,混合 Transformer-Mamba 设计。
- 上下文长度:最高 1M token,适合长文档分析和多轮对话。
- 性能提升:在自主智能体工作负载中,推理速度提升 5 倍,成本降低 30%。
- 部署方式:SageMaker JumpStart 一键部署,支持 ml.p5en.48xlarge、ml.p5.48xlarge、ml.g7e.48xlarge 实例。
- 定价提醒:GPU 实例每小时数美元,使用后务必删除 endpoint 以避免持续计费。
一句话总结
如果你在 AWS 上构建需要长时间多步推理的智能体应用,Nemotron 3 Ultra 是目前性价比最高的开放模型之一。