AI 快讯 编译自 simon_willison #功能更新#工具评测#OpenAI

OpenAI WebRTC 音频对话工具更新:支持 GPT-Realtime-2 模型与文档上下文粘贴

开发者 Simon Willison 更新了其 OpenAI WebRTC 音频对话演示工具,新增 GPT-Realtime-2 模型选择,并允许粘贴文档作为对话上下文。中文用户可通过浏览器体验实时语音对话,但需 API Key 和网络条件。

编译发布 2026/06/13 原文发布 2026/06/12

一句话看懂

Simon Willison 更新了其 OpenAI WebRTC 音频对话演示工具,新增 GPT-Realtime-2 模型和文档上下文粘贴功能,可在浏览器中与 AI 进行基于文档的实时语音对话。

详细发生了什么

2024 年 12 月,开发者 Simon Willison 构建了一个基于 OpenAI WebRTC API 的实时音频对话演示工具。上个月,OpenAI 推出了 GPT-Realtime-2 模型,号称是“首个具备 GPT-5 级推理能力的语音模型”,知识截止日期为 2024 年 9 月 30 日。由于该模型迟迟未在 ChatGPT iPhone 应用中上线,Willison 更新了他的演示工具。

新版工具允许用户选择 GPT-Realtime-2 模型,并新增了“文档上下文”功能:用户可以在开始对话前粘贴一大段文本(如 Markdown 文档),模型将能够围绕该文档内容进行语音讨论。界面包含 API Token 输入、语音选择(如 Coral)、模型下拉菜单,以及一个可折叠的文档粘贴区域。

中文圈视角

对中文用户来说,这个工具本身是一个演示性质的开源项目,需要自行获取 OpenAI API Key 并确保网络能访问 OpenAI 服务(可能需要代理)。目前国内没有直接平替——国产语音模型如讯飞星火、百度文心一言的实时语音 API 尚未开放类似 WebRTC 的低延迟对话能力,且不支持文档上下文。

不过,这一更新展示了两个趋势:一是 GPT-Realtime-2 的推理能力可能接近 GPT-5,二是“文档+语音对话”的场景正在成熟。对于需要快速理解长文档(如论文、合同、技术文档)的中文用户,如果网络条件允许,这是一个高效的辅助工具。但要注意,粘贴的文档内容会通过 API 发送到 OpenAI 服务器,涉及数据出境问题,敏感信息不建议使用。

几条值得记住的细节

  • GPT-Realtime-2 是 OpenAI 首个声称具备 GPT-5 级推理能力的语音模型。
  • 工具基于 WebRTC 协议,在浏览器中实现低延迟实时音频对话。
  • 文档上下文功能支持粘贴任意文本,模型会围绕该内容进行讨论。
  • 目前该模型仍未在 ChatGPT iPhone 应用中提供。
  • 使用需自备 OpenAI API Key,且可能受网络限制。

一句话总结

如果你有 OpenAI API Key 和稳定的网络,这个工具能让你用语音快速探讨文档内容,是高效的信息消化方式。