研究揭示:Anthropic、OpenAI 和 Google 的加密推理链可被破解,隐藏思维过程面临泄露风险
最新研究显示,Anthropic、OpenAI 和 Google 的 API 返回的加密 chain-of-thought 块可被重放攻击,通过较弱模型 jailbreak 恢复强模型的隐藏推理。本文解读攻击原理、影响及对中文开发者的安全建议。
一句话看懂
一项新研究展示了如何通过重放加密的 chain-of-thought 块,破解 Anthropic、OpenAI 和 Google 前沿模型的隐藏推理过程,将其明文还原。
详细发生了什么
安全研究者发布了一篇题为《Stealing Reasoning Traces from Proprietary LLM APIs》的论文,并搭建了专门的网站 stolen-thoughts.com 来展示攻击细节。论文指出,Anthropic、OpenAI 和 Google 在 API 响应中返回的加密 chain-of-thought 块存在严重缺陷:这些加密块可以在不同会话、用户甚至模型之间重放。攻击者只需获取一个由前沿模型(如 GPT-5.6-luna)生成的加密推理块,将其输入到功能较弱的同系列模型中,再通过 jailbreak 手段诱导弱模型解密,就能以明文形式恢复强模型的完整推理链。
论文作者提供了一个简单的 curl 命令示例,展示如何从 OpenAI API 获取包含 reasoning.encrypted_content 的响应。这些加密块看似安全,但实际上缺乏与特定请求或用户的绑定,导致重放攻击成为可能。研究团队强调,这一漏洞影响所有主流闭源模型提供商,且目前尚未有完全修复方案。
中文圈视角
对于中文开发者而言,这一研究具有双重警示意义。首先,国内不少团队依赖 OpenAI、Anthropic 的 API 进行应用开发,尤其是需要复杂推理的任务(如代码生成、数学解题)。如果加密推理可被破解,那么敏感的业务逻辑和内部思考过程可能暴露给第三方,带来数据安全风险。其次,国内主流模型如 DeepSeek、Kimi 等是否也存在类似问题?虽然论文未提及,但国产模型在架构上可能借鉴了类似的加密机制,开发者应关注后续研究。此外,对于合规要求高的行业(如金融、医疗),使用闭源 API 时需重新评估风险,考虑本地部署或使用开源模型。
几条值得记住的细节
- 攻击利用的是加密 chain-of-thought 块的可重放性,不依赖破解加密算法本身。
- 论文提供了 curl 示例,展示如何获取包含
reasoning.encrypted_content的响应。 - 受影响模型包括 GPT-5.6-luna 等前沿模型,以及 Anthropic 和 Google 的对应产品。
- 攻击者需要访问一个较弱但同系列的模型,并成功 jailbreak 才能解密。
- 目前尚无官方修复,建议开发者谨慎处理 API 返回的加密推理数据。
一句话总结
闭源模型的加密推理并非绝对安全,中文开发者应警惕数据泄露风险,并关注国产模型的类似漏洞。