AI 快讯 编译自 aws_ml_blog #模型发布#功能更新#安全

Amazon Nova 推出选择性遗忘技术 rDPO,让模型学会“忘记”不必要的安全拦截

AWS 发布 Amazon Nova 自定义内容审核设置(CCMS),基于新型遗忘技术 rDPO(反向直接偏好优化),允许企业客户有选择地降低模型在安全、敏感内容等维度的过度拦截,同时保持模型通用能力。本文详解 rDPO 原理、效果及对中文用户的应用启示。

编译发布 2026/07/06 原文发布 2026/07/06

一句话看懂

AWS 发布 Amazon Nova 自定义内容审核设置(CCMS),基于新型遗忘技术 rDPO,让模型在特定领域“忘记”安全拦截,同时保持通用能力。

详细发生了什么

企业部署大模型时,常遇到安全护栏“过度防御”的问题:媒体公司处理含成人语言的剧本、安全团队模拟钓鱼邮件用于员工培训、法律团队处理敏感证据——这些合法业务请求往往被模型直接拒绝。传统 prompt engineering 无法解决,因为安全对齐已嵌入模型参数。

AWS 在 Amazon Nova 中推出 CCMS,允许获批客户在四个 RAI 支柱(安全、敏感内容、公平性、安全性)中选择性调整护栏。核心技术是 rDPO(Reverse Direct Preference Optimization),一种新型遗忘技术。它训练 LoRA adapter 来逆转模型在特定策略上的对齐,使模型在客户批准的政策领域不再拒绝请求,同时保持其他领域的对齐。

相比现有方法 NPO(Negative Preference Optimization),rDPO 不仅让模型“忘记”拒绝行为,还同时引导它生成高质量替代响应。实验显示,rDPO 在约 30 步内收敛,而 NPO 几乎无法改变模型行为。效果上,安全类请求的拒绝率从 86.51% 降至 32.77%,公平性、安全、敏感内容等类别也有 28-46 个百分点的下降,且通用能力(指令遵循、数学推理等)不受影响。

中文圈视角

这项技术对中文用户有直接价值。国内企业同样面临安全护栏过度拦截的问题:金融合规审查、医疗文献分析、教育内容生成等场景中,模型常因敏感词过滤而拒绝合法请求。目前国内模型(如 DeepSeek、Kimi、智谱)的审核机制多为“一刀切”式关键词拦截,缺乏细粒度可配置遗忘能力。

Amazon Nova CCMS 的 rDPO 方案提供了一条可行路径:通过 LoRA adapter 实现局部遗忘,无需修改基座模型,部署成本低。但需注意,该功能目前仅面向 AWS 获批客户,且依赖 Amazon Nova 生态。国内用户若想复现,可参考 rDPO 的公开原理(基于 DPO 反转偏好对),在开源模型(如 Qwen、Yi)上自行训练 LoRA adapter,但需自行构建“遗忘-目标”数据对,且需注意内容安全合规要求。

一个中文圈尚未讨论的盲点:遗忘技术可能被滥用于绕过安全审核。AWS 强调保留了不可配置的核心控制(如儿童保护、隐私),但企业客户在自定义时需自行评估风险。国内监管环境下,类似功能可能需额外备案。

几条值得记住的细节

  • rDPO 训练约 30 步即可收敛,效率远高于 NPO。
  • 安全类请求拒绝率从 86.51% 降至 32.77%,降幅 53.74 个百分点。
  • 使用 LoRA adapter 实现遗忘,不修改基座模型权重,推理成本低。
  • CCMS 覆盖四个 RAI 支柱:安全、敏感内容、公平性、安全性。
  • 核心控制(儿童保护、隐私)不可配置,确保底线安全。

一句话总结

rDPO 让企业按需“忘记”模型的安全过度拦截,但中文用户需注意合规风险与生态依赖。