OpenAI用AI攻击自家AI:GPT-Red模型84%成功率远超人类红队13%
OpenAI内部开发GPT-Red模型通过自我对弈训练,在84%测试场景中成功攻击自家AI,而人类红队仅13%。该成果直接用于加固GPT-5.6 Sol等模型,对中文圈AI安全研究和红队测试有重要参考价值。
一句话看懂
OpenAI用AI攻击自家AI:GPT-Red模型通过自我对弈训练,在84%测试中成功攻破,远超人类红队13%的成绩。
详细发生了什么
OpenAI内部开发了一个名为GPT-Red的专用AI模型,专门用于攻击自家AI系统。通过自我对弈(self-play)训练,GPT-Red在84%的测试场景中成功找到漏洞或绕过安全限制,而人类红队(red teamers)的成功率仅为13%。
这些攻击结果直接用于加固OpenAI的模型,包括最新的GPT-5.6 Sol。GPT-Red能够自动化地发现模型中的安全弱点,例如生成有害内容、绕过内容过滤器或泄露敏感信息。OpenAI表示,这种AI驱动的红队测试比传统人工测试更高效、更全面,能够覆盖人类难以想到的攻击路径。
中文圈视角
对中文圈用户和开发者来说,这个消息有几点值得关注:
-
国产大模型的安全测试现状:目前国内主流大模型(如DeepSeek、Kimi、智谱GLM)的安全测试仍以人工红队为主,自动化AI红队工具尚不成熟。OpenAI的GPT-Red思路可被借鉴——用AI对抗AI,但需要大量算力和高质量对抗样本。
-
合规与监管影响:国内对生成式AI的内容安全要求严格(如《生成式人工智能服务管理暂行办法》)。如果国产模型也能采用类似自对弈训练进行安全加固,可能减少违规内容输出,降低企业合规风险。
-
平替可能性:目前国内没有直接对标GPT-Red的公开模型。但开源社区已有类似尝试,如Anthropic的Constitutional AI和Meta的Purple Llama。中文开发者可基于这些开源方案,结合中文语料进行安全测试。
-
盲点:中文圈较少讨论AI红队测试的自动化程度和成功率量化。GPT-Red的84% vs 13%是一个明确标杆,提示国内团队需重视AI驱动的安全评估,而非仅依赖人工。
几条值得记住的细节
- GPT-Red通过自我对弈训练,无需人工标注攻击样本。
- 84%成功率针对的是OpenAI自家模型,包括GPT-5.6 Sol。
- 人类红队成功率仅13%,差距显著。
- 攻击结果直接用于模型加固,形成闭环。
- OpenAI未公开GPT-Red的模型大小和训练成本。
一句话总结
AI红队测试效率远超人类,未来大模型安全将更多依赖AI自我对抗。