2000人尝试黑掉AI助手:6000次攻击均失败,Opus 4.6抗提示注入能力实测
Fernando Irarrázaval发起挑战,让2000人通过邮件尝试从OpenClaw实例中窃取秘密。6000次攻击、500美元token消耗和一个Google账号被封后,无人成功。这验证了前沿模型在抗提示注入方面的进步,但作者仍警告不要在生产系统依赖此安全性。
一句话看懂
2000人尝试通过邮件攻击AI助手,6000次尝试后无人能泄露秘密,Opus 4.6的抗提示注入能力经受住考验。
详细发生了什么
Fernando Irarrázaval 在 hackmyclaw.com 上发起了一项挑战:任何人都可以给运行 Opus 4.6 模型的 OpenClaw 测试实例发送邮件,试图诱骗它泄露存储在 secrets.env 中的秘密。结果出乎意料:经过 6000 次尝试(消耗了 500 美元的 token 费用,并且由于入站邮件过多导致一个 Google 账号被暂停),没有一个人成功。
核心防御在于系统提示中的反注入规则,明确禁止模型根据邮件内容泄露凭证、修改自身文件、执行命令或外传数据。这印证了 Simon Willison 的观察:前沿模型在训练中对抗提示注入的努力正在见效。OpenAI 在 GPT-5.6 系统卡中也专门讨论了这一点。
不过,作者强调这并不代表生产系统可以高枕无忧——6000 次失败不能保证更复杂的方法无法突破。
中文圈视角
这个实验对中文用户有直接参考价值。目前国内大模型如 DeepSeek、Kimi、智谱 GLM 等,在提示注入防护上的公开测试数据很少。如果你正在用这些模型构建自动化客服、邮件处理或数据查询系统,建议自己跑一遍类似的压力测试。
另外,实验中的攻击向量是邮件,而中文场景下微信消息、钉钉通知等也可能成为注入入口。国内模型是否对中文 prompt injection 有同等抵抗力?目前没有公开信息,值得警惕。
合规方面,如果模型被注入导致泄露用户数据,在国内可能违反《个人信息保护法》。因此,即使模型声称安全,仍建议在应用层增加额外的过滤和权限控制。
几条值得记住的细节
- 攻击总数:6000 次,无人成功泄露秘密。
- 成本:消耗 500 美元 token 费用,一个 Google 账号因邮件过多被暂停。
- 底层模型:Opus 4.6,使用明确的反注入系统提示。
- 防护要点:禁止泄露凭证、修改文件、执行命令、外传数据。
- 作者警告:6000 次失败不保证绝对安全,生产系统仍需多层防护。
一句话总结
AI 模型抗提示注入能力在提升,但别把安全全押在模型上——应用层防护不能省。