Miso Labs 发布 MisoTTS:8B 参数开源情感语音合成模型,支持语气感知与本地部署
Miso Labs 推出 MisoTTS,一个 8B 参数的开源文本转语音模型,采用残差向量量化(RVQ)技术扩展声音范围,无需增加参数量。模型同时处理文本和音频上下文,能感知说话者语气,生成更自然的对话语音。支持本地部署,权重已开放下载。
一句话看懂
Miso Labs 开源了 8B 参数的 MisoTTS 模型,用残差向量量化解决语音多样性问题,支持语气感知,可本地部署。
详细发生了什么
Miso Labs 于 2026 年 6 月 3 日发布了 MisoTTS,一个 8B 参数的开源文本转语音(TTS)模型。它基于残差向量量化(RVQ)技术,将每个音频 token 表示为 32 个 codebook 索引的向量,从而将可寻址词汇量扩展到约 10^105,而无需增加模型参数。
MisoTTS 的架构分为两部分:一个 7.7B 参数的 backbone(自回归处理时间序列),和一个 300M 参数的 decoder(自回归处理深度)。模型同时以文本和先前的音频为条件,因此能捕捉说话者的语气、情感和节奏,避免“恐怖谷”效应。
模型使用 Mimi 作为音频分词器,文本词汇量 128,256,最大序列长度 2,048,默认精度 torch.bfloat16。Miso Labs 声称推理延迟为 110ms,远低于 ElevenLabs 的 700ms 和 Sesame 的 300ms。权重以修改版 MIT 许可证发布,支持本地部署,可通过 Hugging Face 下载。
中文圈视角
MisoTTS 的开源特性对中文用户意义重大。首先,它支持本地部署,意味着敏感音频数据无需上传云端,这对注重数据安全的企业和开发者是重要优势。其次,虽然模型主要针对英文,但 RVQ 架构理论上可迁移至中文语音,中文社区可基于开源权重进行微调或适配。
目前国产 TTS 模型如字节跳动的 MegaTTS、百度的语音合成系统多采用端到端架构,但在情感表达和语气感知方面仍有提升空间。MisoTTS 的 RVQ 技术提供了一种新思路:通过向量量化扩展声音范围,而非堆叠参数。中文开发者可以借鉴其架构,开发更自然的中文语音助手或有声读物生成工具。
需要注意的是,MisoTTS 目前仅支持半双工(单次对话),不支持实时打断,且需要 CUDA GPU 运行。API 尚未开放,但开源权重降低了使用门槛。对于中文场景,直接使用可能需额外处理中文分词和声调问题。
几条值得记住的细节
- 模型参数量 8B(7.7B backbone + 300M decoder),使用 Mimi 音频分词器,32 个 2048-way codebook。
- 推理延迟声称 110ms,但需第三方验证;模型需要 CUDA GPU 运行,默认 torch.bfloat16。
- 权重以修改版 MIT 许可证开源,支持本地部署,音频默认通过 SilentCipher 加水印。
- 支持从约 10 秒音频片段进行一次性声音克隆。
- 目前仅支持半双工单次对话,全双工和实时打断列为未来工作。
一句话总结
MisoTTS 让开发者能在本地运行一个情感丰富的语音合成模型,开源权重降低了实验和定制门槛。