弱模型也能教强模型?微软研究提出 W2S-OPD 蒸馏框架
导语
大模型蒸馏通常默认存在一个“更强老师”:要么用大模型教小模型,要么把多个同规模专家模型的能力合并到一个学生模型中。但在前沿模型训练中,这个假设常常不成立——如果学生已经足够强,哪里还能找到更大、更贵、且稳定可用的教师?论文《Weak-to-Strong On-Policy Distillation》提出的 W2S-OPD,正是围绕这个问题给出一种新的蒸馏思路:让多个较弱、低成本模型也能为更强学生提供有效训练信号。
核心要点
- 从“弱到强”的 on-policy 蒸馏:OPD 的关键在于,教师不是在固定数据上指导学生,而是在学生自己的 rollout 上对齐 token 级分布。W2S-OPD 延续这一范式,但不要求教师本身强于学生。
- 用对比模型构造代理教师:方法选取一个正向模型和一个负向模型,二者都小于学生。它们在 logit 空间的差值被视为某种“能力方向”,例如 RL 带来的技能增益、模型规模带来的能力差异,或正确提示相对错误提示指向答案的方向。
- 保持与学生分布相邻:论文不是直接让学生模仿弱模型,而是把提取出的能力方向加到学生自己的基础模型上,形成一个代理教师。这样既引入了弱模型揭示的有用信号,又避免教师分布与学生差距过大。
- 训练目标简洁:学生在自身生成轨迹上最小化逐 token 的 reverse KL,从而学习代理教师给出的分布调整。
意义与影响
这项工作的价值在于,它把蒸馏的重心从“寻找更强教师”转向“从弱模型之间的差异中提取方向”。这对前沿大模型尤其重要:当没有明显更强的教师可用时,便宜的小模型、RL 前后版本、不同规模基座模型,甚至正确与错误提示下的小模型输出,都可能转化为可利用的训练信号。
论文报告称,在四个数学和三个代码基准上,W2S-OPD 优于常规 OPD,并能让学生超过领域教师;同时,不同对比来源产生的信号并不相同:post-RL 与提示对比更强调推理框架,规模对比更偏向解题过程。这提示蒸馏不只是压缩模型,也可以成为组织、放大弱监督的一种训练机制。
当然,素材摘要尚未给出完整实验细节、模型规模和成本对比,因此实际可复现性与泛化边界仍需阅读论文与代码进一步判断。但从研究方向看,W2S-OPD 为“强模型如何继续从弱监督中学习”提供了一个值得关注的技术路径。
评论
正在确认登录状态……
正在加载评论……