AI 快讯 编译自 marktechpost #实时语音翻译#模型发布#工具评测

Gradium 发布实时语音翻译模型 stt-translate 和 s2s-translate,精度和延迟超越 GPT 实时翻译

Gradium 推出两款实时语音翻译模型 stt-translate 和 s2s-translate,支持英语、法语、德语、西班牙语和葡萄牙语共 20 个语言对。通过将传统三模型级联压缩为两阶段,在 BLEU 和 MetricX 指标上超越 gpt-realtime-translate 和 gemini-3.5-live-translate,平均延迟 3.0 秒,并支持输出语音选择和克隆…

编译发布 2026/06/24 原文发布 2026/06/24

一句话看懂

Gradium 推出两款实时语音翻译模型,将传统三模型级联简化为两阶段,在精度和延迟上超越 GPT 和 Gemini 的同类产品。

详细发生了什么

Gradium 于 2026 年 6 月 24 日发布了两款实时语音翻译模型:stt-translate(语音→文本)和 s2s-translate(语音→语音)。两者覆盖英语、法语、德语、西班牙语和葡萄牙语共 5 种语言,支持 20 个语言对(任意源语言到任意目标语言)。

核心架构创新在于将传统的三模型级联(ASR → 文本翻译 → TTS)压缩为两阶段:stt-translate 在一个单次推理中同时完成语音识别和文本翻译,消除了中间文本转录的等待和系统间切换;s2s-translate 在此基础上集成 Gradium 自家的 TTS 模型,通过单一 duplex WebSocket 流式返回合成语音和翻译文本。

在基准测试中(基于专有对话语音数据集),Gradium 在 BLEU 指标上领先 gpt-realtime-translate 和 gemini-3.5-live-translate,在 MetricX 指标上优于 Gemini 并与 GPT 相当。平均端到端延迟为 3.0 秒,快于 GPT 的 3.6 秒,略慢于 Gemini 的 2.9 秒。此外,Gradium 支持输出语音选择和语音克隆,这是 GPT 实时翻译所不具备的。

中文圈视角

对中文用户而言,Gradium 目前仅支持五种欧洲语言,暂不支持中文,直接使用场景有限。但这项技术本身值得关注:

  1. 架构思路可借鉴:单次转录+翻译的设计减少了延迟和错误累积,国内厂商(如科大讯飞、百度、阿里)的语音翻译系统大多仍采用三模型级联,Gradium 的 Hibiki-Zero 框架可能启发国产方案优化。
  2. 语音克隆的合规风险:Gradium 支持输出语音克隆,这在中文互联网环境下可能涉及声音肖像权、深度伪造等监管问题。国内类似功能(如腾讯的语音合成)通常有严格的使用限制和审核机制。
  3. 平替可能性:目前国内没有直接对标的产品。讯飞听见的实时翻译延迟约 2-4 秒,但仅支持语音到文本;百度的语音翻译 API 也采用级联架构。Gradium 的端到端语音到语音能力在国内尚属空白。
  4. 使用门槛:Gradium 提供 Python SDK,需要 API key 和海外网络访问。对于需要实时跨语言会议、直播同传的国内用户,可关注其后续是否增加中文支持。

几条值得记住的细节

  • 语言覆盖:5 种语言(EN, FR, DE, ES, PT),20 个语言对,任意方向互译。
  • 延迟对比:Gradium 平均 3.0s,gpt-realtime-translate 3.6s,gemini-3.5-live-translate 2.9s。
  • 精度指标:BLEU 领先 GPT 和 Gemini;MetricX 与 GPT 相当,优于 Gemini。
  • 语音控制:支持从目录选择输出语音,也支持克隆用户自己的声音。
  • 输入输出格式:输入 PCM 24kHz 16-bit mono,输出 PCM 48kHz 16-bit mono,也支持 WAV、Opus、mu-law、A-law。
  • SDK 使用:提供 Python SDK,支持 s2s_realtime(实时流)、s2s_stream(有限迭代器)、s2s(缓冲文件)三种模式。

一句话总结

Gradium 的实时语音翻译模型在精度和延迟上超越了 GPT 和 Gemini,但暂不支持中文,国内用户可关注其架构思路对国产方案的启发。