AI 快讯 编译自 marktechpost #模型发布#语音识别#开源

NVIDIA 开源 Nemotron 3.5 ASR:600M 参数流式语音模型,单模型支持 40 种语言实时转录

NVIDIA 发布 Nemotron 3.5 ASR,一个 600M 参数的流式语音识别模型,单 checkpoint 支持 40 种语言实时转录,内置标点和大小写,缓存感知架构实现低延迟。开源权重可自托管,支持 fine-tuning,中文用户可关注其多语言覆盖和国产替代对比。

编译发布 2026/06/06 原文发布 2026/06/06

一句话看懂

NVIDIA 开源 Nemotron 3.5 ASR,一个 600M 参数的流式语音识别模型,单模型覆盖 40 种语言,延迟可低至 80ms,支持自托管和 fine-tuning。

详细发生了什么

NVIDIA Nemotron Speech 团队发布了 Nemotron 3.5 ASR。这是一个 600M 参数的流式自动语音识别(ASR)模型。它用单个 checkpoint 就能实时转录 40 种语言,并原生支持标点和大写。模型权重以 OpenMDW-1.1 许可证在 Hugging Face 上开源。

架构上,Nemotron 3.5 ASR 采用 Cache-Aware FastConformer-RNNT。它的 24 层 FastConformer 编码器通过缓存自注意力和卷积激活,避免重复计算重叠音频窗口,从而降低延迟。RNNT 解码器逐帧输出文本,支持流式处理。

模型提供可配置的延迟-准确率权衡参数 att_context_size,支持 80ms、160ms、320ms、560ms 和 1.12s 五种延迟模式,无需重新训练。语言检测支持手动指定或自动识别,自动模式下会在句末输出语言标签。

NVIDIA 还展示了 fine-tuning 效果:在希腊语和保加利亚语上,使用 80ms 最低延迟模式,WER 分别降低 32%(35→24)和 31%(22→15)。

中文圈视角

对中文用户来说,Nemotron 3.5 ASR 的亮点在于单模型覆盖 40 种语言,包括中文(普通话),且支持流式低延迟。但需要注意几点:

  1. 中文支持有限:虽然覆盖普通话,但中文方言(如粤语、闽南语)未包含。相比之下,国产方案如科大讯飞、阿里云语音识别对中文方言支持更广。
  2. 自托管门槛:模型需要 GPU 部署(推荐 H100),对个人开发者成本较高。国内用户可通过 ModelScope 或本地 GPU 尝试,但需注意网络访问 Hugging Face 的稳定性。
  3. 国产平替:百度、阿里、腾讯等提供的云端 API 在中文场景下准确率更高,且延迟同样低至 200ms 以内,但闭源且按量付费。Nemotron 3.5 ASR 的优势在于开源可定制,适合需要私有化部署或 fine-tuning 的团队。
  4. 合规考量:模型权重可下载,数据不出境,适合对数据安全要求高的企业。但需注意 OpenMDW-1.1 许可证的商业使用限制。

中文圈目前讨论较少,但该模型对多语言实时转录场景(如跨国会议、客服)有参考价值。

几条值得记住的细节

  • 单模型覆盖 40 种语言:包括中文、英语、日语、韩语、阿拉伯语等,无需切换模型。
  • 延迟可配置:att_context_size 参数支持 80ms 到 1.12s 五种模式,推理时选择,无需重新训练。
  • 缓存感知架构:每个音频帧只处理一次,在 H100 上并发流数达到缓冲方法的 17 倍。
  • 内置标点和大小写:无需后处理步骤,输出即用。
  • fine-tuning 效果显著:希腊语 WER 降低 32%,保加利亚语降低 31%(80ms 模式)。

一句话总结

Nemotron 3.5 ASR 让多语言实时语音识别开源化,中文用户可自托管或 fine-tuning,但国产方案在中文场景仍更成熟。