AI 快讯 编译自 simon_willison #安全#Prompt Injection#模型漏洞

Prompt Injection 新研究:模型更信风格而非内容,攻击成功率从 61% 降至 10%

最新研究揭示 LLM 在区分角色标签时更依赖文本风格而非内容,导致 prompt injection 攻击。通过“去风格化”可将攻击成功率从 61% 降至 10%。对中文开发者使用 API 和本地模型有重要安全启示。

编译发布 2026/06/23 原文发布 2026/06/22

一句话看懂

新研究发现 LLM 在区分系统指令和用户输入时,更看重文本风格而非实际内容,导致角色混淆型 prompt injection 攻击成功率高达 61%。

详细发生了什么

Charles Ye、Jasmine Cui 和 Dylan Hadfield-Menell 发表了一篇论文,研究 LLM 如何区分自己的特权文本(如 <system><think><assistant> 标签内的内容)和不可信的用户输入(<user> 标签)。

坏消息是:他们证实模型不仅无法可靠区分,而且似乎更重视文本的风格而非实际内容。例如,在用户输入中模仿模型内部思考块的写作风格,就能让模型忽略安全策略,生成制造毒品的指南。

更关键的是,他们发现“去风格化”(destyling)——即用略微不同的方式重写文本,使其看起来不像角色标签内的预期格式——能显著影响模型对文本的分类。对人类读者来说,两个版本意思相同,但对 LLM 来说差异巨大:去风格化使攻击成功率从 61% 骤降至 10%。

中文圈视角

这项研究对中文开发者有直接警示。国内很多应用依赖 OpenAI API 或开源模型(如 Qwen、DeepSeek),且常使用 <system><user> 等角色标签来构建 prompt。如果模型对风格敏感,攻击者可以通过模仿系统提示或思考链的写作风格来绕过安全限制。

目前中文社区对此类攻击的讨论较少,多数安全实践仍集中在关键词过滤和输出审核上。但这项研究表明,仅靠内容过滤是不够的——攻击者可以利用风格模仿来“伪装”恶意指令。建议开发者在构建 prompt 时加入随机化风格、使用特殊分隔符或对用户输入进行去风格化预处理。

另外,国产模型如 DeepSeek 和 Qwen 也使用类似的角色标签机制,是否同样存在此漏洞?值得国内安全团队跟进测试。

几条值得记住的细节

  • 攻击成功率从 61% 降至 10% 仅通过去风格化实现,对人类读者几乎不可见。
  • 模型更重视文本风格而非实际内容,导致角色混淆。
  • 研究测试了包括 gpt-oss-20b 在内的多个模型,均受影响。
  • 去风格化方法包括改变句式、替换同义词、调整标点等。
  • 论文附带博客风格解读,方便非学术读者理解。

一句话总结

LLM 对文本风格比内容更敏感,开发者需在 prompt 设计中加入风格混淆防御。