AI 快讯 编译自 marktechpost #模型发布#语音翻译#Google

Google 发布 Gemini 3.5 Live Translate:流式语音翻译覆盖 70+ 语言,集成 Meet、Translate 和 Live A

Google 推出 Gemini 3.5 Live Translate,一个流式语音到语音翻译模型,支持 70+ 语言,延迟仅几秒。开发者可通过 Live API 集成,企业版在 Google Meet 内测,普通用户可在 Translate 应用使用。本文详解技术细节、中文用户可用性及国产替代对比。

编译发布 2026/06/09 原文发布 2026/06/09

一句话看懂

Google 发布 Gemini 3.5 Live Translate,一个流式语音到语音翻译模型,支持 70+ 语言,延迟仅几秒,已集成到 Meet、Translate 应用和 Live API。

详细发生了什么

Google 正式发布 Gemini 3.5 Live Translate,这是其最新的流式语音到语音翻译音频模型。与传统的轮次式翻译不同,该模型在说话人讲话的同时持续生成翻译语音,仅落后说话人几秒。它支持自动检测 70 多种语言,并保留原说话人的语调、语速和音高。

模型通过三个渠道推出:开发者可通过 Gemini Live API 和 Google AI Studio 公开预览使用;企业用户本月可在 Google Meet 中获取私人预览;普通用户则通过 Android 和 iOS 上的 Google Translate 应用使用。

技术层面,该模型是一个纯音频模型(gemini-3.5-live-translate-preview),不支持文本输入、工具调用或系统指令,以确保极低的实时延迟。输入为 16kHz 16-bit PCM 单声道音频,输出为 24kHz 16-bit PCM 单声道音频。开发者可通过设置 targetLanguageCode(BCP-47 格式)和 echoTargetLanguage 来控制翻译行为。所有生成的音频都带有不可感知的 SynthID 水印。

Google 还展示了合作伙伴案例:Grab 正在测试该模型用于司机与乘客的沟通,其用户每月进行超过 1000 万次语音通话;CJ ENM、LiveKit 等公司反馈质量、准确性和低延迟表现良好。

中文圈视角

国内用户能用吗? 目前 Gemini 3.5 Live Translate 通过 Google 服务提供,国内正常访问需要网络环境。Google Translate 应用在国内 Android 市场通常不可用,iOS 用户需切换至美区账号。对于企业用户,Google Meet 的私人预览可能仅限于海外企业。

国产平替有哪些? 国内类似产品包括:

  • 讯飞听见:支持多语种实时语音翻译,但多为轮次式,延迟较高。
  • 腾讯翻译君:支持语音翻译,但流式体验不如 Gemini 3.5。
  • 百度翻译:支持语音输入,但未实现真正的流式语音到语音。
  • 阿里云语音翻译:提供 API,但同样以文本中间态为主。

中文场景影响:对于需要实时跨语言沟通的场景(如国际会议、在线课程、客服),该模型能大幅提升体验。但中文用户需注意,模型对中文的语调、方言(如粤语、四川话)支持程度未知,官方仅提到 70+ 语言,未具体列出中文变体。

监管合规:数据通过 Google 服务器处理,涉及数据出境,国内企业需评估合规风险。SynthID 水印虽有助于检测 AI 生成内容,但国内尚无类似要求。

几条值得记住的细节

  • 模型名称为 gemini-3.5-live-translate-preview,纯音频输入输出,不支持文本。
  • 输入音频格式:16kHz 16-bit PCM 单声道,输出:24kHz 16-bit PCM 单声道,每 100ms 发送一次。
  • 支持 BCP-47 语言代码,默认目标语言为英语(“en”)。
  • Google Meet 更新后,语言从 5 种扩展到 70+,组合从仅英语到 2000+ 种。
  • 所有输出音频带有 SynthID 水印,用于检测 AI 生成内容。

一句话总结

如果你需要实时跨语言语音沟通,Gemini 3.5 Live Translate 是当前延迟最低、覆盖最广的选项,但国内用户需考虑网络和合规问题。