Amazon Nova 推出选择性遗忘技术 rDPO,让模型学会“忘记”不必要的安全拦截
AWS 发布 Amazon Nova 自定义内容审核设置(CCMS),基于新型遗忘技术 rDPO(反向直接偏好优化),允许企业客户有选择地降低模型在安全、敏感内容等维度的过度拦截,同时保持模型通用能力。本文详解 rDPO 原理、效果及对中文用户的应用启示。
一句话看懂
AWS 发布 Amazon Nova 自定义内容审核设置(CCMS),基于新型遗忘技术 rDPO,让模型在特定领域“忘记”安全拦截,同时保持通用能力。
详细发生了什么
企业部署大模型时,常遇到安全护栏“过度防御”的问题:媒体公司处理含成人语言的剧本、安全团队模拟钓鱼邮件用于员工培训、法律团队处理敏感证据——这些合法业务请求往往被模型直接拒绝。传统 prompt engineering 无法解决,因为安全对齐已嵌入模型参数。
AWS 在 Amazon Nova 中推出 CCMS,允许获批客户在四个 RAI 支柱(安全、敏感内容、公平性、安全性)中选择性调整护栏。核心技术是 rDPO(Reverse Direct Preference Optimization),一种新型遗忘技术。它训练 LoRA adapter 来逆转模型在特定策略上的对齐,使模型在客户批准的政策领域不再拒绝请求,同时保持其他领域的对齐。
相比现有方法 NPO(Negative Preference Optimization),rDPO 不仅让模型“忘记”拒绝行为,还同时引导它生成高质量替代响应。实验显示,rDPO 在约 30 步内收敛,而 NPO 几乎无法改变模型行为。效果上,安全类请求的拒绝率从 86.51% 降至 32.77%,公平性、安全、敏感内容等类别也有 28-46 个百分点的下降,且通用能力(指令遵循、数学推理等)不受影响。
中文圈视角
这项技术对中文用户有直接价值。国内企业同样面临安全护栏过度拦截的问题:金融合规审查、医疗文献分析、教育内容生成等场景中,模型常因敏感词过滤而拒绝合法请求。目前国内模型(如 DeepSeek、Kimi、智谱)的审核机制多为“一刀切”式关键词拦截,缺乏细粒度可配置遗忘能力。
Amazon Nova CCMS 的 rDPO 方案提供了一条可行路径:通过 LoRA adapter 实现局部遗忘,无需修改基座模型,部署成本低。但需注意,该功能目前仅面向 AWS 获批客户,且依赖 Amazon Nova 生态。国内用户若想复现,可参考 rDPO 的公开原理(基于 DPO 反转偏好对),在开源模型(如 Qwen、Yi)上自行训练 LoRA adapter,但需自行构建“遗忘-目标”数据对,且需注意内容安全合规要求。
一个中文圈尚未讨论的盲点:遗忘技术可能被滥用于绕过安全审核。AWS 强调保留了不可配置的核心控制(如儿童保护、隐私),但企业客户在自定义时需自行评估风险。国内监管环境下,类似功能可能需额外备案。
几条值得记住的细节
- rDPO 训练约 30 步即可收敛,效率远高于 NPO。
- 安全类请求拒绝率从 86.51% 降至 32.77%,降幅 53.74 个百分点。
- 使用 LoRA adapter 实现遗忘,不修改基座模型权重,推理成本低。
- CCMS 覆盖四个 RAI 支柱:安全、敏感内容、公平性、安全性。
- 核心控制(儿童保护、隐私)不可配置,确保底线安全。
一句话总结
rDPO 让企业按需“忘记”模型的安全过度拦截,但中文用户需注意合规风险与生态依赖。