OpenAI 发布 GPT-Live 全双工语音模型:实时对话中可委托 GPT-5.5 处理复杂推理
OpenAI 推出 GPT-Live 系列语音模型,采用全双工架构实现同时听说,并能在对话中委托 GPT-5.5 进行搜索和深度推理。本文详解其技术突破、与旧版语音模式的对比,以及对中文用户的实际影响和可用性分析。
一句话看懂
OpenAI 今日发布 GPT-Live 全双工语音模型,能同时听和说,并在后台委托 GPT-5.5 处理复杂任务,让对话更自然流畅。
详细发生了什么
OpenAI 于 2026 年 7 月 8 日发布 GPT-Live 系列语音模型,包括 GPT-Live-1 和 GPT-Live-1 mini,即日起为 ChatGPT Voice 提供支持。GPT-Live 采用全双工架构,模型可以同时处理输入和输出,在对话中实时发出“嗯”、“对”等反馈,也能在用户思考时保持安静。
关键设计是“委托机制”:当用户提问需要搜索、深度推理或复杂操作时,GPT-Live 将任务交给后台的 GPT-5.5 处理,同时自身继续维持对话流畅。GPT-Live-1(instant)和 mini 使用 GPT-5.5 Instant,而 GPT-Live-1 Medium 和 High 则使用 GPT-5.5 Thinking 的不同推理强度。
与之前的级联式语音系统(STT→LLM→TTS)和基于轮次的 Advanced Voice Mode 相比,GPT-Live 在延迟、自然度和打断处理上显著提升。人类评估中,GPT-Live-1 和 mini 在愉悦度和对话流畅性上被强烈偏好。
中文圈视角
对中文用户来说,GPT-Live 目前有几个关键限制:首先,发布时不支持视频、屏幕共享和完整的多语言支持,中文体验可能不如英文流畅。其次,需要访问 OpenAI 服务,国内用户需自行解决网络问题。
国产替代方面,国内语音模型如讯飞星火、百度文心一言的语音模式目前仍以轮次式交互为主,尚未实现全双工架构。字节跳动的豆包和阿里通义千问在实时语音上有所探索,但均未公开类似委托机制。
具体场景影响:
- 语言学习:全双工支持实时纠正,对英语口语练习很有价值,但中文教学场景需等待多语言支持。
- 免提助手:做菜、导航等场景非常实用,但国内用户可能更习惯使用本地语音助手。
- 实时翻译:全双工时序支持同声传译,但目前仅限部分语言。
合规角度:语音数据涉及敏感信息,国内用户使用 OpenAI 服务需注意数据出境风险。
几条值得记住的细节
- GPT-Live 采用全双工架构,每秒可做多次交互决策(说、听、打断、调用工具等)。
- 委托机制将深度推理交给 GPT-5.5,GPT-Live 自身保持对话流畅。
- 人类评估中 GPT-Live-1 和 mini 在愉悦度和流畅性上强烈优于 Advanced Voice Mode。
- 自动基准测试:GPQA 科学推理、BrowseComp 网页搜索、τ³-Voice Telecom 多轮客服均显著提升。
- API 尚未开放,仅限 ChatGPT 应用内使用。
一句话总结
GPT-Live 让语音对话真正接近真人交流,但中文用户需等待多语言支持和 API 开放才能充分受益。