DAPD:给策略蒸馏补上“信息对齐”这一课
导语
语言模型后训练中,在线策略自蒸馏(OPSD)越来越常见:模型在训练过程中利用自身或强化后的教师信号,试图把更强策略压缩回学生模型。但 DAPD 这篇论文提醒我们,一个看似合理的设定可能隐藏着关键风险——教师在训练时看到的“特权信息”,学生在推理时并没有。如果学生把这种依赖学了下来,就会产生论文所说的 privilege illusion(特权幻觉):验证时看似表现不错,实际部署时却因为信息缺失而退化。
核心要点
- 问题根源是信息不对称:传统 OPSD 中,教师或参考策略可能依赖训练阶段额外可见的信息,而学生在推理阶段只能基于普通上下文做决策。论文认为,这种信息条件不一致是性能下降的根本原因。
- DAPD 的目标不是简单增强教师:作者提出 Dual-Anchored Policy Distillation,希望让蒸馏过程在“匹配的信息条件”下进行,而不是把特权条件下形成的行为直接迁移给学生。
- Dual-Path Anchoring(DPA)构建双路径对齐:DPA 引入自条件桥接机制,让参考行为与 rollout 行为沿两条信息匹配的路径对齐,从而减少特权依赖行为进入最终学生策略的可能性。
- Dual-Source Anchoring(DSA)进一步降低单向依赖:DSA 将上述路径用于 reference-to-rollout 与 rollout-to-reference 两个方向,既保留正确性监督,又避免学生过度依赖带有特权信息的参考指导。
- 实验结果显示增益可扩展:论文称,DAPD 在 Qwen3-4B 上相较 OPSD 平均提升 2.00 分;在不同规模上仍保持收益,4B 为 +2.69,32B 为 +2.78。
意义与影响
DAPD 的价值在于,它把后训练蒸馏中的一个常见“隐性变量”显性化了:训练时的教师到底看到了什么,学生部署时又能看到什么。对于以强化学习、在线采样、自我改进为核心的 LLM 后训练流程来说,这一点尤其重要。模型并不是只要模仿更强输出就会变强;如果模仿目标依赖不可复现的信息,蒸馏反而会把错误的决策依据固化下来。
这也为后续研究提出了更实际的问题:当教师与学生并非同一架构、同一模型家族,甚至能力差距更大时,信息对齐机制是否仍然稳定?论文讨论区中也有人提到异构教师—学生场景的敏感性。作者回应称,DAPD 当前主要面向 on-policy self-distillation,并已在 OLMo 上做了初步实验,结果与 Qwen 类似;更完整结果会在后续版本补充。
整体来看,DAPD 不是一个单纯追求更高分数的技巧,而是在提醒后训练社区:蒸馏的对象不只是答案分布,还包括答案背后的信息条件。未来如果要让自蒸馏成为可靠的模型改进路径,像 DAPD 这样的“信息锚定”思路可能会成为重要组成部分。
评论
正在确认登录状态……
正在加载评论……