亚马逊 Nova 模型自蒸馏推理技术 SDR:无需人工标注即可提升 SFT 性能并缓解灾难性遗忘
亚马逊发布 Self-Distilled Reasoning (SDR) 技术,利用模型自身思维链增强 SFT 数据集,无需人工标注即可提升目标性能并缓解灾难性遗忘。本文详解 SDR 原理、与模型合并的对比,以及中文用户如何借鉴这一思路优化模型微调。
一句话看懂
亚马逊 Nova 2 模型推出 Self-Distilled Reasoning (SDR) 技术,用模型自己的思维链增强 SFT 数据集,无需人工标注即可提升目标性能并缓解灾难性遗忘。
详细发生了什么
亚马逊在官方博客中介绍了一种名为 Self-Distilled Reasoning (SDR) 的新方法,用于解决监督微调(SFT)中缺乏推理链(chain-of-thought)数据的问题。当使用不含推理步骤的数据集进行 SFT 时,模型会逐渐丧失推理能力(称为“推理抑制问题”),即使推理模式开启也无法恢复。
SDR 的核心思路是:在 SFT 训练过程中,让基础模型(Amazon Nova 2 Lite)为每个训练样本生成自己的推理链,然后将这些推理链作为额外 token 加入训练数据。这样,模型在训练时既能学习目标任务,又能保留推理能力。
实验在三个基准上验证:ToolACE(工具调用)、CoCoHD(长文本结构化提取)和 GovReport(长文本摘要)。结果显示,SDR 在目标性能上比纯 SFT 平均提升 6.5%,同时数学能力从 6% 恢复到 70%(接近基础模型的 70%)。相比之下,模型合并(model merging)虽然也能恢复推理能力,但会牺牲目标性能。
中文圈视角
SDR 对中文 AI 开发者有直接参考价值。目前国内主流模型(如 DeepSeek、Kimi、Qwen)也支持 SFT 定制,但高质量的中文推理链数据同样稀缺且昂贵。SDR 提供了一种零成本的数据增强方案:直接用模型自身生成推理链。
对于使用国产模型进行微调的用户,可以尝试类似思路:在 SFT 时,让模型先输出思考过程(如果模型支持),再输出最终答案。这不仅能提升目标任务性能,还能缓解灾难性遗忘——这是中文社区微调时常见的痛点,比如微调后模型数学能力大幅下降。
不过需要注意:SDR 依赖模型本身具备推理能力。如果基础模型推理能力弱,生成的推理链质量可能不高。此外,国内部分模型(如 Qwen 2.5)已原生支持思考模式,可以直接借鉴 SDR 思路。
几条值得记住的细节
- SDR 无需人工标注,适用于任何现有 SFT 数据集,无论领域。
- 相比模型合并,SDR 在目标性能上平均提升 6.5%,同时数学能力恢复至 70%(合并为 68%)。
- 推理抑制问题:在无推理链的数据集上 SFT 后,模型推理能力从 70% 降至 6%。
- SDR 通过在训练中引入模型自身的推理链作为正则化,有效缓解灾难性遗忘。
- 实验使用 Amazon Nova 2 Lite 模型,但方法可推广至其他支持推理的模型。
一句话总结
如果你在微调模型时发现推理能力下降,试试让模型自己生成推理链加入训练数据——免费且有效。