AI 快讯 编译自 simon_willison #安全#提示注入#模型评测

2000人尝试黑掉AI助手:6000次攻击均失败,Opus 4.6抗提示注入能力实测

Fernando Irarrázaval发起挑战,让2000人通过邮件尝试从OpenClaw实例中窃取秘密。6000次攻击、500美元token消耗和一个Google账号被封后,无人成功。这验证了前沿模型在抗提示注入方面的进步,但作者仍警告不要在生产系统依赖此安全性。

编译发布 2026/06/26 原文发布 2026/06/26

一句话看懂

2000人尝试通过邮件攻击AI助手,6000次尝试后无人能泄露秘密,Opus 4.6的抗提示注入能力经受住考验。

详细发生了什么

Fernando Irarrázaval 在 hackmyclaw.com 上发起了一项挑战:任何人都可以给运行 Opus 4.6 模型的 OpenClaw 测试实例发送邮件,试图诱骗它泄露存储在 secrets.env 中的秘密。结果出乎意料:经过 6000 次尝试(消耗了 500 美元的 token 费用,并且由于入站邮件过多导致一个 Google 账号被暂停),没有一个人成功。

核心防御在于系统提示中的反注入规则,明确禁止模型根据邮件内容泄露凭证、修改自身文件、执行命令或外传数据。这印证了 Simon Willison 的观察:前沿模型在训练中对抗提示注入的努力正在见效。OpenAI 在 GPT-5.6 系统卡中也专门讨论了这一点。

不过,作者强调这并不代表生产系统可以高枕无忧——6000 次失败不能保证更复杂的方法无法突破。

中文圈视角

这个实验对中文用户有直接参考价值。目前国内大模型如 DeepSeek、Kimi、智谱 GLM 等,在提示注入防护上的公开测试数据很少。如果你正在用这些模型构建自动化客服、邮件处理或数据查询系统,建议自己跑一遍类似的压力测试。

另外,实验中的攻击向量是邮件,而中文场景下微信消息、钉钉通知等也可能成为注入入口。国内模型是否对中文 prompt injection 有同等抵抗力?目前没有公开信息,值得警惕。

合规方面,如果模型被注入导致泄露用户数据,在国内可能违反《个人信息保护法》。因此,即使模型声称安全,仍建议在应用层增加额外的过滤和权限控制。

几条值得记住的细节

  • 攻击总数:6000 次,无人成功泄露秘密。
  • 成本:消耗 500 美元 token 费用,一个 Google 账号因邮件过多被暂停。
  • 底层模型:Opus 4.6,使用明确的反注入系统提示。
  • 防护要点:禁止泄露凭证、修改文件、执行命令、外传数据。
  • 作者警告:6000 次失败不保证绝对安全,生产系统仍需多层防护。

一句话总结

AI 模型抗提示注入能力在提升,但别把安全全押在模型上——应用层防护不能省。