AI 快讯 编译自 marktechpost #模型发布#开源#AI代理

NVIDIA发布Nemotron 3.5 Lightning:30B开源MoE模型与NeMo Switchyard路由器,加速AI代理执行

NVIDIA推出Nemotron 3.5 Lightning,一款30B参数、3B激活的开源MoE模型,支持1M上下文,速度提升4倍,并配套NeMo Switchyard路由库,可降低74%成本。本文解读其技术亮点、部署方式及对中文开发者的实用价值。

编译发布 2026/08/12 原文发布 2026/08/12

一句话看懂

NVIDIA发布Nemotron 3.5 Lightning,一款30B参数、3B激活的开源MoE模型,搭配NeMo Switchyard路由器,旨在降低AI代理执行层的成本和延迟。

详细发生了什么

NVIDIA推出了两项开源技术,用于构建由多个专用模型组成的常驻AI代理系统。Nemotron 3.5 Lightning是一个轻量级、可定制的开源模型,专为高吞吐量的代理任务设计;NeMo Switchyard则是一个开源路由库,能将代理工作流的每一步引导至最合适、最高效的模型。

这两个工具解决的核心问题是:长时间运行的代理大部分时间消耗在工具调用、结果验证和子代理委派上,如果每一步都使用顶尖推理模型,会带来高昂成本和延迟。Lightning采用30B混合专家(MoE)架构,仅激活3B参数,结合Mamba-2、MoE和Attention的混合设计,支持1M token的上下文窗口。NVIDIA声称其输出速度比同类模型快4倍,在PinchBench基准上完成10,000个任务比Qwen3.6 35B快30%,且准确率相当。

该模型已在CrowdStrike、Harvey、CodeRabbit、Fastino Labs和Lila Sciences等公司中用于网络安全、法律、编程、金融和医疗等领域。Nemotron 3.5 Lightning采用宽松的OpenMDW-1.1许可证,开放权重、训练数据和配方,允许商业使用。部署门槛低,单张现代GPU(如DGX Spark或H100)即可运行,也可通过Baseten、Together AI或Nebius等平台托管,或完全本地部署。

NeMo Switchyard提供了多种免调优路由器,包括LLM分类器、阶段路由器和升级路由器,能根据任务难度动态选择模型。在LangChain的145个多轮代理任务基准中,使用升级路由器在Lightning和Claude Opus 4.8之间路由,成本降低74%,仅7%的调用发送到前沿模型,准确率损失约6个百分点。

中文圈视角

对中文开发者而言,Nemotron 3.5 Lightning的发布有几个值得关注的要点。首先,模型权重在Hugging Face和ModelScope上均可下载,国内用户无需额外工具即可获取,这比许多海外模型更友好。其次,单GPU部署能力降低了使用门槛,个人开发者或小团队可以在消费级硬件上运行,无需依赖云端API,这为数据敏感场景(如金融、医疗)提供了本地化解决方案。

与国产模型相比,Lightning的1M上下文和快速推理能力在长文档处理、代码审查等场景有竞争力,但中文能力可能不如DeepSeek或Kimi等本土模型。不过,NeMo Switchyard的路由思路值得借鉴——它允许混合使用多个模型,例如将简单任务交给Lightning,复杂任务交给更强大的模型,这种策略可以显著降低成本,中文开发者可以尝试将其应用于现有工作流。此外,OpenMDW-1.1许可证允许商用,但需注意数据出境合规问题,建议在部署时评估数据存储位置。

几条值得记住的细节

  • 模型架构:30B MoE,3B激活参数,混合Mamba-2 + MoE + Attention,1M token上下文。
  • 性能数据:输出速度比同类模型快4倍;PinchBench 10,000任务完成速度快30%。
  • 部署方式:单张DGX Spark或H100即可运行,支持Ollama、LM Studio、llama.cpp和Unsloth本地推理。
  • 路由效果:NeMo Switchyard在LangChain基准中降低74%成本,准确率仅下降约6点。
  • 获取渠道:权重可在Hugging Face或ModelScope下载,也可在build.nvidia.com或OpenRouter试用。

一句话总结

Nemotron 3.5 Lightning让低成本、高速度的AI代理执行成为可能,中文开发者可轻松上手并优化现有工作流。