OpenAI第三方网络安全评估事故:测试环境配置错误致模型攻击真实网站
OpenAI披露第三方网络安全评估中,因测试环境配置错误,模型意外访问互联网并攻击真实网站。本文梳理事件经过、影响及对中文用户的启示,涵盖AI安全评估风险与合规要点。
一句话看懂
OpenAI 披露第三方网络安全评估中,因测试环境配置错误,AI 模型意外访问互联网并攻击了真实网站,凸显 AI 安全测试的潜在风险。
详细发生了什么
OpenAI 发布官方声明,说明了第三方网络安全评估中发生的两起事故。其中一起涉及外部安全测试合作伙伴 Irregular 公司。Irregular 在运行 Capture-the-Flag(CTF)风格的评估时,本应隔离于互联网的测试环境因配置错误,导致模型能访问公共互联网。
更严重的是,在一次测试中,CTF 挑战里虚构目标的名称恰好与一个真实域名重合。由于测试环境被错误地连上互联网,模型误把真实网站当成模拟环境的一部分,并对其发起攻击。OpenAI 在声明中承认了问题,并表示正在采取措施防止类似事件重演。
Irregular 公司也出现在 Anthropic 的报告中。Anthropic 指出,Irregular 托管的错误配置评估环境,在部分测试中让 Claude 获得了实时互联网访问权限。也就是说,同一家第三方测试公司可能同时影响了多家 AI 巨头的安全评估流程。
中文圈视角
这起事件对中文用户有几点启示。首先,AI 安全评估本身有风险,尤其是测试环境与真实网络隔离不当时,可能引发意外后果。国内企业在做类似红队测试或安全评估时,应严格检查网络隔离配置,避免测试模型“越狱”到真实环境。
其次,事件中“虚构目标与真实域名重合”属于小概率但高影响的事件。中文用户在用 AI 工具时,也应意识到模型可能因上下文混淆而误操作,尤其在涉及网络请求的场景下。对于依赖 AI 做自动化操作的企业,建议增加人工审核环节,防止模型误触外部系统。
此外,国内对 AI 安全评估的监管日趋严格,此类事件可能促使监管机构加强对第三方测试机构的资质审查。中文用户在选择 AI 服务时,可关注服务商的安全评估流程是否透明,以及是否有类似的事故披露机制。
几条值得记住的细节
- OpenAI 的声明同时涵盖了英国 AI 安全研究所(UK AI Safety Institute)的攻击事件,以及 Irregular 公司引发的另一起事故。
- Irregular 是一家外部网络安全测试合作伙伴,其运行的 CTF 评估本应完全隔离于互联网。
- 测试环境配置错误导致模型访问公共互联网,并因虚构目标与真实域名重合而攻击了真实网站。
- Anthropic 的报告中同样提到了 Irregular,该公司托管的错误配置环境让 Claude 在部分测试中获得了实时互联网访问权限。
- Simon Willison 为此专门创建了“accidental-cyberattacks”标签,用于追踪此类意外网络攻击事件。
一句话总结
AI 安全测试也可能“引火烧身”,中文用户应关注服务商的安全评估透明度,并警惕模型误操作风险。