OpenAI 发布 GPT-Realtime-2.1 系列:低延迟语音 Agent 的推理与成本优化
OpenAI 推出 GPT-Realtime-2.1 和 GPT-Realtime-2.1-mini,后者是首个支持推理的 mini 语音模型,定价与旧版一致。p95 延迟降低至少 25%,支持 WebRTC 连接。本文详解模型差异、定价、缓存优化及中文开发者如何接入。
一句话看懂
OpenAI 发布 GPT-Realtime-2.1 和 GPT-Realtime-2.1-mini,后者是首个支持推理的 mini 语音模型,定价不变,p95 延迟降低至少 25%,通过缓存优化实现。
详细发生了什么
OpenAI 在 API 中新增了两个 Realtime 模型:gpt-realtime-2.1 和 gpt-realtime-2.1-mini。前者是 GPT-Realtime-2 的升级版,改进了字母数字识别、静音/噪声处理和中断行为,支持可配置推理强度、指令遵循和工具调用。后者是 mini 推理模型,专为实时语音交互设计,定价与之前的 gpt-realtime-mini 相同,但增加了推理能力。
关键改进包括:
- p95 延迟降低至少 25%:通过改进缓存实现,缓存输入 token 价格大幅折扣。
- 推理能力下放至 mini 层:模型可在说话前内部思考,支持工具调用时用语音提示用户等待,避免中断。
- 可配置推理强度:从 minimal 到 xhigh 五档,默认 low,开发者可根据任务调整延迟与深度。
定价方面,gpt-realtime-2.1-mini 的音频输出为 $20/1M tokens,而完整版为 $64/1M,差距约 3 倍。文本输入 $0.60/1M,缓存后仅 $0.06/1M。
中文圈视角
对中文开发者来说,这次更新有几个直接价值:
-
低延迟语音 Agent 成本可控:mini 模型定价与旧版一致,但多了推理能力,适合客服、预约、语音助手等场景。中文语音识别和生成仍需依赖 OpenAI 的多模态能力,但延迟改善对实时对话体验至关重要。
-
国产平替对比:国内类似产品如百度智能云语音服务、阿里云语音 AI 在成本上可能更低,但缺乏端到端推理和工具调用能力。OpenAI 的 Realtime API 优势在于单模型处理语音+推理+工具调用,减少系统复杂度。不过,中文场景下语音识别的准确性仍需测试。
-
WebRTC 接入简化:OpenAI 提供了浏览器端 WebRTC 示例,国内开发者可直接集成,但需注意网络延迟和 API 访问稳定性。对于需要低延迟的语音应用,可以考虑使用国内云服务商的中转方案。
-
监管与合规:语音数据涉及敏感信息,使用 OpenAI API 需注意数据出境合规。国内企业可能更倾向使用本地化部署的语音模型,如科大讯飞或腾讯云的服务。
几条值得记住的细节
- gpt-realtime-2.1-mini 定价:音频输出 $20/1M tokens,缓存音频输入 $0.30/1M,与旧版 mini 一致。
- p95 延迟降低 25%+:通过缓存优化,长会话中系统提示在首轮后缓存,大幅降低后续延迟。
- 推理强度可调:默认 low,适合简单任务;高推理强度增加延迟和 token 消耗,仅用于复杂多步任务。
- 工具调用时语音提示:模型可在执行函数前说“让我查一下”,保持对话连贯。
- WebRTC 连接:浏览器端通过 ephemeral key 直接连接,无需服务器中转音频流。
一句话总结
GPT-Realtime-2.1-mini 让低成本语音 Agent 拥有推理能力,延迟更低,适合中文开发者构建实时对话应用。