AI 快讯 编译自 marktechpost #模型发布#语音识别#企业服务

PolyAI发布Dialog-RSN-1:音频原生对话模型,融合语音识别与函数调用,响应低于300毫秒

PolyAI推出Dialog-RSN-1,一款直接处理用户音频的对话模型,将语音识别、函数调用和响应生成融合于一体,响应时间低于300毫秒。本文解析其架构、性能及对中文企业客服场景的启示,并对比国内同类方案。

编译发布 2026/07/31 原文发布 2026/07/31

一句话看懂

PolyAI发布Dialog-RSN-1,一个直接听音频而非读转写文本的对话模型,把语音识别、函数调用和回复生成融进一个模型,响应低于300毫秒,已在真实客服电话中上线。

详细发生了什么

PolyAI推出了Dialog-RSN-1,这是一个音频原生的对话模型,它直接感知来电者的音频,而不是像传统系统那样先做语音转写(ASR)再处理文本。该模型将话轮转换(turn-taking)、语音识别、函数调用(function calling)和回复生成融合在同一个模型中,但TTS(语音合成)保持独立,以便控制输出声音。它采用基于请求的LLM调用方式,而非常驻流式处理,从而避免长时间占用GPU。

据PolyAI报告,在真实部署中,该模型响应时间低于300毫秒,在某餐厅集团的测试中,问题解决率相对提升11%,在某保险公司的部署中,延迟降低37%。目前仅支持英文,通过PolyAI平台提供,不开放权重或公开API。现有客户可立即启用,新客户可申请早期访问。PolyAI在2025年12月完成8600万美元D轮融资时,宣称拥有100多家企业客户和2000多个实时部署。

中文圈视角

Dialog-RSN-1的发布对中文企业客服领域有几点启示。首先,国内用户无法直接使用该模型,因为它不开放API,且仅支持英文。但国内已有类似产品,如阿里云的语音对话模型、腾讯云的智能客服等,它们同样在探索音频端到端处理。其次,PolyAI强调的“音频原生”理念值得关注:传统级联架构(ASR+LLM)会丢失语气、犹豫等副语言信息,而直接处理音频能保留这些线索,提升对话自然度。国内厂商在开发客服机器人时,可借鉴其将话轮转换作为模型第一输出token的设计,优化交互体验。此外,PolyAI选择不开放权重,而是通过平台提供服务,这符合企业级客户对数据安全和合规的需求,国内厂商在推广时也需考虑类似策略。

几条值得记住的细节

  • Dialog-RSN-1的输入侧感知音频,输出侧仍用独立TTS,保证声音可控。
  • 模型以请求方式调用,非流式常驻,降低GPU占用。
  • 话轮转换由模型第一输出token决定:EMPTY、ONGOING或COMPLETE。
  • 在A100 GPU上实现亚300毫秒响应,模型规模在8B稠密到30B稀疏之间。
  • 转录在响应或工具调用之后并行进行,不阻塞主流程。

一句话总结

Dialog-RSN-1展示了音频原生对话模型的潜力,国内企业可关注其架构思路,但实际应用还需等待中文支持和开放接口。