AI 快讯 编译自 the_decoder #模型发布#开源#语音交互

开源语音模型Audio Interaction:持续监听每0.4秒决定是否说话,超越GPT-4o

新开源模型Audio Interaction实现不间断语音交互,每0.4秒决策是否响应,支持翻译、转录、聊天及环境音识别。对比GPT-4o和Qwen3.5-Omni,无需等待录音结束。代码和权重已开源,对中文开发者意味着什么?

编译发布 2026/06/06 原文发布 2026/06/06

一句话看懂

开源语音模型Audio Interaction实现持续监听,每0.4秒决定是否说话,无需等待录音结束,支持翻译、转录、聊天和环境音识别。

详细发生了什么

6月6日,一个名为Audio Interaction的新开源语音模型发布。与GPT-4o或Qwen3.5-Omni等需要等待用户说完再处理的模型不同,Audio Interaction能够持续监听音频流,每0.4秒判断一次是否该说话或保持沉默。它不仅能处理语音对话,还能翻译、转录,甚至识别咳嗽等日常环境音,所有功能在单一音频流中完成。

模型代码、权重和下载说明已在GitHub上以Apache 2.0开源许可证发布,训练数据后续也会公开。这意味着开发者可以自由下载、修改和部署该模型,用于构建实时语音交互应用。

中文圈视角

对中文开发者来说,这个模型有几个值得关注的点:

  1. 实时交互体验:传统语音模型(如Whisper)需要等待录音结束才能处理,而Audio Interaction的持续监听机制更接近人类对话节奏。国内类似产品如Kimi的语音模式、百度的语音助手,目前大多采用分段处理,延迟感明显。这个模型可能带来更自然的对话体验。

  2. 开源优势:模型完全开源(Apache 2.0),国内开发者可以基于它进行二次开发,比如适配中文方言、加入特定场景的噪音识别。相比依赖闭源API(如讯飞、阿里云),开源模型在数据隐私和定制化上更有优势。

  3. 环境音识别:模型能识别咳嗽、敲门等非语音声音,这对智能家居、医疗监护等场景很有价值。国内目前很少有开源模型做到这一点。

  4. 合规风险:持续监听涉及用户隐私,国内部署需注意《个人信息保护法》要求,可能需要在应用层增加用户授权和本地处理机制。

  5. 中文支持:原文未明确说明中文效果,但基于开源社区,国内开发者可以贡献中文数据微调,提升中文识别和对话质量。

几条值得记住的细节

  • 决策间隔:模型每0.4秒判断一次是否说话,实现低延迟交互。
  • 多任务:同一音频流中同时支持翻译、转录、聊天和环境音识别。
  • 开源许可:Apache 2.0,允许商用和修改,训练数据后续公开。
  • 对比对象:作者明确对比GPT-4o和Qwen3.5-Omni,强调无需等待录音结束。
  • 下载地址:GitHub上可获取代码和模型权重。

一句话总结

Audio Interaction让实时语音交互不再依赖分段录音,开源特性为中文开发者提供了低成本定制语音助手的可能。