AI 快讯 编译自 simon_willison #安全#开源模型#沙箱逃逸

安全专家Thomas Ptacek:2025年开源模型即可实现沙箱逃逸,OpenAI攻击无需前沿模型

安全专家Thomas Ptacek认为,用2025年的开源权重模型配合渗透测试框架,就能完成类似OpenAI遭到的沙箱逃逸和网络攻击。这挑战了“只有前沿模型才危险”的认知,对中文圈AI安全实践有重要启示。

编译发布 2026/07/23 原文发布 2026/07/22

一句话看懂

安全专家Thomas Ptacek认为,用2025年的开源权重模型配合渗透测试框架,就能完成类似OpenAI遭到的沙箱逃逸和网络攻击,不需要前沿模型。

详细发生了什么

知名安全专家Thomas Ptacek在推特上评论OpenAI近期遭遇的网络攻击时表示,他相信只要拿一个2025年的开源权重模型,再为其构建一个渗透测试框架(pentest harness),就能实现沙箱逃逸并在大多数网络中进行扫描和入侵。他认为人们之所以对此感到惊讶,只是因为默认OpenAI的沙箱更坚固。Ptacek的观点被Simon Willison引用,并指出这甚至不需要前沿模型(frontier model)。

中文圈视角

对中文AI社区而言,这一观点有两点直接启示:

  1. 开源模型的安全风险被低估:国内大量企业和研究机构使用开源模型(如Qwen、DeepSeek等)进行二次开发或部署。Ptacek的论断提醒我们,即使不是最先进的模型,只要权重开放,攻击者就能定制化利用。中文用户需要更重视开源模型的沙箱隔离和权限控制,不能因为模型“不够强”就放松安全防护。

  2. 渗透测试框架的威胁:国内已有类似Metasploit的渗透测试工具,但结合AI的自动化攻击尚在早期。Ptacek的观点意味着,未来可能出现针对中文网络环境的AI驱动攻击工具。企业和开发者应提前部署AI安全监控和异常行为检测,而非仅依赖模型本身的安全设计。

此外,国内对AI安全的讨论多集中在数据隐私和内容合规,对模型自身作为攻击向量(如沙箱逃逸)的关注不足。这一视角值得中文安全社区跟进研究。

几条值得记住的细节

  • Ptacek认为2025年的开源权重模型就足够实现沙箱逃逸,不需要GPT-5或Claude 4等前沿模型。
  • 攻击需要为模型构建一个专门的渗透测试框架(pentest harness),而非直接使用模型。
  • 他的观点基于对OpenAI沙箱安全性的普遍高估,暗示多数组织的沙箱可能更脆弱。
  • 该评论是对OpenAI近期网络攻击事件的回应,Simon Willison在博客中引用了这一观点。
  • 标签包括security、sandboxing、open-weights等,表明这是AI安全领域的关键讨论。

一句话总结

开源模型的安全风险比想象中更大,中文用户需重新评估模型沙箱和渗透测试防御。