AI 快讯 编译自 interconnects #后训练#MOPD#模型蒸馏#RLHF#DeepSeek

前沿模型后训练配方演进:从InstructGPT到MOPD,Finbarr Timbers深度解析

Interconnects播客专访Finbarr Timbers,梳理从InstructGPT到2026年MiMo Flash V2、DeepSeek V4的后训练配方演变。重点介绍多教师在线蒸馏(MOPD)为何成为主流,以及对中文开源社区和国产模型的启示。

编译发布 2026/06/16 原文发布 2026/06/16

一句话看懂

Finbarr Timbers与Nathan Lambert梳理了从InstructGPT到2026年MiMo Flash V2的后训练配方演进,揭示多教师在线蒸馏(MOPD)如何取代单一RL阶段成为前沿模型标配。

详细发生了什么

在最新一期Interconnects播客中,Nathan Lambert与即将离开AI2的Finbarr Timbers回顾了后训练配方的历史与最新趋势。两人基于一份技术幻灯片,梳理了从2022年InstructGPT的SFT→RM→RL三步法,到2024年Llama 3和Tülu 3的SFT→DPO→RLVR,再到2025年DeepSeek R1以大规模RL为中心的变化。

2026年,配方进一步碎片化:MiMo Flash V2、DeepSeek V4、Nemotron 3 Ultra等模型采用了多教师在线蒸馏(MOPD)——先训练N个领域专家教师(每个领域独立SFT+RL),再训练一个通用学生模型,通过采样自身轨迹并最小化与相关教师输出的反向KL散度来合并能力。MOPD兴起的原因是单一RL阶段成本高且易产生能力冲突,而专家教师训练便宜、可并行。

此外,播客还讨论了GLM-5的分阶段RL、Kimi K2.5的图文联合RL等非MOPD路线,以及MAI-Thinking-1更接近R1的多阶段RL+轨迹蒸馏方案。

中文圈视角

MOPD的出现对中文大模型社区有直接参考价值。国内头部模型如DeepSeek V4、GLM-5、Kimi K2.5已经在实践中探索类似思路:DeepSeek V4使用10+领域专家进行MOPD,GLM-5则采用分能力阶段RL(推理→智能体→通用)。对于中小团队,MOPD降低了后训练门槛——不需要维护一个庞大的通用RL集群,而是可以分领域训练专家,再通过蒸馏合并。

但需要注意:MOPD依赖高质量领域数据和成熟的蒸馏技术,中文场景下领域数据(如中文法律、医疗)的获取和标注仍是瓶颈。此外,MOPD的在线蒸馏部分需要大量推理计算,对算力要求不低。国产平替方案如ModelScope社区的开源工具(SWIFT、LLaMA-Factory)已支持部分蒸馏流程,但尚未完整实现MOPD。

一个中文圈尚未充分讨论的盲点:MOPD可能加剧模型能力的“领域隔离”——如果专家教师只在各自领域训练,学生模型在跨领域任务上的泛化能力可能不如单一RL训练。这需要后续研究验证。

几条值得记住的细节

  • MOPD全称:Multi-teacher On-Policy Distillation,首次由MiMo Flash V2(2026年1月)明确提出。
  • DeepSeek V4:使用10+领域专家进行MOPD,是规模最大的实践之一。
  • Nemotron 3 Ultra:两轮MOPD,先蒸馏再重新蒸馏,从刷新后的教师中学习。
  • 非MOPD路线:Kimi K2.5采用文本→图文联合RL,GLM-5分阶段RL,MAI-Thinking-1多阶段RL+轨迹蒸馏。
  • 历史转折点:2025年DeepSeek R1将大规模RLVR作为主要驱动,SFT仅用于蒸馏和精炼RL行为。

一句话总结

后训练配方正从单一RL转向多教师蒸馏,中文开发者可关注MOPD工具链,但需警惕领域隔离风险。