AI 快讯 编译自 the_decoder #模型发布#语音合成#阿里

阿里Qwen Audio 3.0 TTS Plus登顶语音合成排行榜,支持16语言和自然语言风格控制

阿里巴巴的Qwen Audio 3.0 TTS Plus在Artificial Analysis的Speech Arena排行榜中夺得第一,支持16种语言,并允许用户通过自然语言或标签(如[angry])控制说话风格。但每秒16字符的生成速度远慢于竞品Sonic 3.5和Simba 3.2。本文解读该模型的技术亮点、中文用户的实际可用性,以及与国内TTS产品的对比。

编译发布 2026/07/21 原文发布 2026/07/21

一句话看懂

阿里Qwen Audio 3.0 TTS Plus在语音合成排行榜夺冠,支持16种语言和自然语言风格控制,但生成速度较慢。

详细发生了什么

阿里巴巴的Qwen Audio 3.0 TTS Plus在Artificial Analysis的Speech Arena排行榜中登顶,成为目前评分最高的文本转语音(TTS)模型。该模型支持16种语言,包括中文、英文、日文、韩文等,并允许用户通过自然语言描述(如“用温柔的语气说话”)或标签(如[angry]、[whisper])来控制说话风格。

不过,它的生成速度仅为每秒16个字符,远慢于竞品Sonic 3.5和Simba 3.2。Artificial Analysis的测试显示,Qwen Audio 3.0 TTS Plus在语音自然度、情感表达和多语言准确性上表现优异,但速度是其主要短板。该模型目前可通过阿里云API调用,定价尚未公开。

中文圈视角

对于中文用户来说,Qwen Audio 3.0 TTS Plus的登顶意义重大。首先,它原生支持中文,且风格控制功能(如[angry]标签)对中文语音合成场景非常实用,比如有声书角色配音、视频旁白情绪调节等。相比之下,国内主流TTS产品如百度语音、科大讯飞虽然也支持多风格,但通常需要预设参数或模板,而Qwen的自然语言控制更灵活。

不过,速度问题值得注意。每秒16字符意味着生成1分钟的中文语音(约300字)需要近19秒,对于实时交互场景(如语音助手)可能不够流畅。国内竞品如字节跳动的火山引擎TTS和腾讯云TTS在速度上更有优势,但自然度可能稍逊。

另外,Qwen Audio 3.0 TTS Plus通过阿里云提供服务,国内用户无需梯子即可使用,但API定价和免费额度尚未公布。对于开发者,如果追求高质量语音且不苛求实时性,这是一个值得尝试的选择。目前中文社区对此模型讨论较少,多数注意力仍在文本模型上,这可能是一个盲点。

几条值得记住的细节

  • 排行榜登顶:Qwen Audio 3.0 TTS Plus在Artificial Analysis Speech Arena中排名第一,超越Sonic 3.5和Simba 3.2。
  • 16种语言:支持中文、英文、日文、韩文、法文、德文等,覆盖主要语种。
  • 风格控制:可通过自然语言(如“用高兴的语气”)或标签([angry]、[sad]、[whisper])调整说话风格。
  • 生成速度:每秒16字符,远慢于竞品Sonic 3.5(约50字符/秒)和Simba 3.2(约40字符/秒)。
  • 可用性:通过阿里云API调用,国内用户可直接访问,定价待公布。

一句话总结

阿里Qwen Audio 3.0 TTS Plus在语音质量上领先,但速度较慢,适合非实时的高质量语音合成场景。