Interfaze 开源 diffusion-gemma-asr-small:首个多语言扩散 ASR 模型,6 种语言单适配器转录
Interfaze 开源了 diffusion-gemma-asr-small,一个基于扩散解码器的多语言语音识别模型。它通过约 42M 参数的适配器,在 Google 的 DiffusionGemma 上实现音频转录,支持英语、德语、法语、西班牙语、印地语和普通话。转录成本取决于去噪步数而非文本长度,LibriSpeech 上 WER 6.6%,领先其他扩散 ASR 模型。
一句话看懂
Interfaze 开源了 diffusion-gemma-asr-small,首个多语言扩散 ASR 模型,用约 42M 参数适配器在 Google 的 DiffusionGemma 上实现 6 种语言的并行去噪转录。
详细发生了什么
Interfaze,一家 YC 孵化的初创公司,开源了名为 diffusion-gemma-asr-small 的语音识别模型。与传统自回归模型逐 token 生成不同,该模型采用扩散解码器并行精炼所有 token,是首个开源的多语言音频扩散 ASR 模型。
模型基于 Google 的 DiffusionGemma(26B 参数混合专家模型,激活 4B 参数,128 专家 top-8 路由),通过约 42M 参数的适配器将音频引入。适配器使用 frozen whisper-small 编码器提取 768 维声学特征,经卷积和线性映射压缩为 188 个“音频 token”,再注入 DiffusionGemma 的编码器。解码器在 192 token 的转录画布上双向去噪约 16 步,输出文本。
训练初期因梯度无法回传至投影器而失败,团队通过 CTC loss 直接监督音频嵌入,使 loss 在 300 步内从 24 降至 8.6。在 LibriSpeech test-clean 上,WER 从 90% 降至 6.6%。
性能方面,在 LibriSpeech test-clean 上 WER 6.6%,优于 Whisfusion 的 8.3%,但落后于自回归 Whisper-small(约 3.4%)和 Whisper-large-v3(约 2.0%)。去噪步数从 8 增至 48 仅带来 0.1 个 WER 点提升,但延迟增加约 3 倍,8 步即可达到接近最优性能。
适配器以 Apache-2.0 协议发布,DiffusionGemma 和 whisper-small 需按各自许可单独下载。
中文圈视角
对中文用户而言,这个模型有几个值得关注的点:
-
多语言支持:一个适配器覆盖英语、德语、法语、西班牙语、印地语和普通话。普通话的 CER 为 29.6%,虽然不如专用模型,但作为扩散 ASR 的首次尝试,已是不错的起点。中文用户可以用它做简单的普通话转录,但高精度场景仍需依赖 Whisper 或国产模型(如 SenseVoice、Paraformer)。
-
成本优势:转录成本取决于去噪步数而非音频长度,这对长音频批量处理非常有利。10 秒音频约需 0.7-1.5 秒模型时间,8 步即可达到接近最优效果。国内用户做会议记录、语音转写时,可考虑用此模型降低计算成本。
-
开源与可复现:适配器仅 42M 参数,训练配方公开,为国内 ASR 研究提供了可复现的扩散基线。研究人员可以在此基础上扩展更多语言或更大编码器。
-
与国产模型对比:目前国内主流 ASR 模型(如阿里 Paraformer、科大讯飞)多为自回归或 CTC 架构,扩散 ASR 仍是空白。此模型填补了该方向的开源空白,但中文性能尚需提升。
-
合规与部署:模型需加载 Google 的 DiffusionGemma(26B 参数),对硬件要求较高。国内用户需注意数据出境问题,建议在本地部署。
几条值得记住的细节
- 适配器仅 42M 参数,占 26B 骨干网络的 0.16%,训练时只更新适配器。
- 支持 6 种语言:英语、德语、法语、西班牙语、印地语、普通话。
- LibriSpeech test-clean WER 6.6%,优于 Whisfusion 的 8.3%,但落后 Whisper-small 的约 3.4%。
- 8 步去噪即可达到接近最优性能,速度约 14.9 倍实时。
- 适配器以 Apache-2.0 开源,DiffusionGemma 需遵守 Gemma 条款,whisper-small 为 MIT。
一句话总结
扩散 ASR 首次开源多语言模型,中文转录可用但精度有限,适合低成本批量场景和研究基线。