AI 快讯 编译自 marktechpost #模型发布#语音合成#阿里云

阿里通义实验室发布Qwen-Audio-3.0-TTS:Flash和Plus双版本,支持16种语言和86种精细标签控制

阿里通义实验室推出Qwen-Audio-3.0-TTS,提供Flash(实时)和Plus(高质量)两个版本,通过阿里云Model Studio以API形式提供服务。模型支持16种语言和20种中文方言,Plus版在Artificial Analysis TTS排行榜上排名第一,定价约$27.59/百万字符。本文详解技术细节、中文用户使用门槛及与国产竞品对比。

编译发布 2026/07/20 原文发布 2026/07/20

一句话看懂

阿里通义实验室发布Qwen-Audio-3.0-TTS,提供Flash(实时)和Plus(高质量)两个API版本,支持16种语言和86种精细标签控制,Plus版在独立评测中排名第一。

详细发生了什么

阿里通义实验室正式发布Qwen-Audio-3.0-TTS,一个面向生产的文本转语音系统。该模型提供两个变体:Flash版本针对实时交互优化,首包延迟约300ms;Plus版本追求高质量生成,强调自然度和音色保真度。两者均通过阿里云Model Studio以托管API形式提供,不开放权重下载。

模型采用12.5Hz低帧率语音分词器降低自回归解码成本,并通过五阶段渐进训练范式协调语言模型和流匹配组件。支持16种语言(阿拉伯语、中文、英语、法语、德语、印尼语、意大利语、日语、韩语、马来语、葡萄牙语、俄语、西班牙语、他加禄语、泰语、越南语)及20种中文方言区域。Plus版在Artificial Analysis TTS排行榜上以约1236 Elo分排名第一,略高于Simba 3.2(1234分)。定价为$27.59/百万字符,约为ElevenLabs和MiniMax同类产品的三分之一。

中文圈视角

对中文用户而言,Qwen-Audio-3.0-TTS的发布有几点值得关注:

  1. 中文方言支持是亮点:模型覆盖20种中文方言区域,这在海外TTS产品中极为罕见。对于需要方言语音合成的国内开发者(如地方政务、客服、内容创作),这是一个差异化优势。

  2. API服务需注意合规:模型通过阿里云Model Studio提供,国内用户可直接使用,无需梯子。但数据出境问题需留意:如果使用新加坡区域,文本和音频数据会离开中国大陆,涉及敏感内容时需评估合规风险。北京区域则无此问题。

  3. 与国产竞品对比:百度、科大讯飞等国内厂商也有TTS API,但Qwen-Audio-3.0-TTS在语言覆盖(16种语言)和精细控制(86种标签)上更胜一筹。不过,国内竞品通常提供更低的价格和更成熟的本地化服务,例如讯飞TTS在中文自然度上仍有优势。

  4. 中文社区盲点:目前中文讨论多集中在模型排名和价格上,但较少人注意到其“仅托管”模式意味着开发者无法本地部署或微调,对于需要私有化部署的企业(如金融、医疗)可能不够友好。

几条值得记住的细节

  • Flash版本首包延迟约300ms,适合实时对话场景;Plus版本质量优先,但吞吐量仅约16字符/秒,低于Simba 3.2的30.2字符/秒。
  • 支持86种精细内联标签,包括[excited]、[sad]、[laughing]、[clears throat]等,可控制情感和非语言事件。
  • 定价$27.59/百万字符,约为ElevenLabs和MiniMax的三分之一,但吞吐量较低。
  • 模型与开源版Qwen3-TTS(Apache-2.0)不同,Qwen-Audio-3.0-TTS仅通过API使用。
  • 提供DashScope SDK及Python、Java、Go、C#、PHP、Node.js的WebSocket示例。

一句话总结

如果你需要多语言或中文方言的TTS,且能接受API调用和中等吞吐量,Qwen-Audio-3.0-TTS是目前性价比最高的选择之一。