AI 快讯 编译自 marktechpost #模型发布#语音交互#开源

NVIDIA发布NemotronLabs VoiceChat 11B:开源全双工语音模型,450毫秒响应支持实时工具调用

NVIDIA推出NemotronLabs VoiceChat 11B,一个开源的全双工语音到语音模型,端到端延迟仅448毫秒,支持实时工具调用。本文解析其架构、性能及对中文开发者的部署建议,并对比国内语音AI方案。

编译发布 2026/08/10 原文发布 2026/08/09

一句话看懂

NVIDIA发布NemotronLabs VoiceChat 11B,一个开源的全双工语音到语音模型,端到端延迟仅448毫秒,支持实时工具调用,但仅限研究用途。

详细发生了什么

NVIDIA发布了NemotronLabs VoiceChat 11B,这是一个拥有110亿参数的开源端到端语音到语音模型,专为实时全双工对话设计。与传统的级联架构(ASR→LLM→TTS)不同,该模型在一个统一的网络中同时处理流式语音理解和语音生成,省去了多模型协调和API切换的环节,从而将端到端延迟降至448毫秒(在Full-Duplex-Bench 1.0基准上测得)。模型支持边听边说,用户可以在对话中随时打断,代理会立即让出话语权,在480毫秒时的接管率达到1.00。

更值得关注的是,这是首个支持工具调用的开源全双工模型。它通过一个独立的输出通道发送<TOOLCALL>脚本,同时运营商可以定义“保持”话术,在API执行期间填充对话空隙,避免冷场。然而,NVIDIA团队明确表示,该模型目前仅用于研究目的,存在一些已知缺陷,例如两分钟的音频上下文限制、多轮对话后可能退化为无法恢复的胡言乱语、对话结束后出现失控的自言自语,以及用户转录中的单词丢失等问题。

模型权重和容器均已公开,采用宽松的OpenMDW-1.1许可证,但需要至少80GB显存的GPU(如A100、H100、RTX 6000 Pro或B200)才能运行,且目前没有托管API或推理服务提供商。

中文圈视角

对于中文开发者而言,NemotronLabs VoiceChat 11B的发布提供了一个研究全双工语音交互的宝贵参考,但直接部署到生产环境并不现实。首先,模型对GPU的高要求(80GB显存)将许多个人开发者和小型团队拒之门外,而国内云服务商(如阿里云、腾讯云)虽然提供A100/H100实例,但成本不菲。其次,模型在中文语音上的表现尚未有公开评测,其训练数据以英语为主,中文识别和生成质量存疑。相比之下,国内厂商如科大讯飞、智谱AI等已在中文语音交互领域深耕多年,推出了成熟的商业解决方案,如讯飞开放平台的全双工语音交互API,虽然延迟可能略高,但在中文场景下更可靠。

不过,该模型的开源性质为国内研究者提供了改进中文全双工语音模型的起点。社区可以基于其架构进行中文微调,或借鉴其工具调用设计,推动中文语音助手的智能化。但需注意,模型权重托管在Hugging Face上,国内访问可能受限,需使用镜像或代理。

几条值得记住的细节

  • 模型架构:混合Mamba/Transformer,结合Fast Conformer编码器、Nemotron Nano v2 LLM骨干和NVIDIA TTS解码器。
  • 训练数据:约55万小时音频,涵盖真实和合成语料。
  • 工具调用限制:每个会话最多5个工具,不支持并行调用,且工具执行期间用户无法打断。
  • 性能数据:在Full-Duplex-Bench 1.0上,平滑轮换TOR为0.82(448ms),用户打断TOR为1.00(480ms);在BFCL-v3语音工具调用上平均准确率56.1%。
  • 部署要求:单块80GB显存GPU(A100/H100/RTX 6000 Pro/B200),x86_64 Linux系统。

一句话总结

NemotronLabs VoiceChat 11B为语音AI研究提供了新范式,但中文用户需等待社区适配或选择国内替代方案。