无需外部监督的在策略自蒸馏:让大模型从自己的共识中学习
导语
大语言模型后训练正在从“依赖更强教师模型或人工真值”转向“让模型从自身行为中改进”。来自 Hugging Face Daily Papers 的论文《On-Policy Self-Distillation without Any Supervision》进一步推进了这一方向:研究者提出无监督在策略自蒸馏 U-OPSD,试图证明模型不一定需要外部答案、环境反馈或更大模型指导,也能通过自身生成结果中的内部一致性获得提升。
核心要点
- 问题背景:已有 OPD / OPSD 方法虽然被称为“自蒸馏”,但通常仍需要真实标签、环境反馈,或来自更强模型的答案。这意味着它们并不完全是“自我学习”。
- 方法思路:U-OPSD 让同一个模型对同一问题采样多个 rollout,再在自一致性阈值约束下用多数投票构造伪解。这个伪解不是外部标注,而是模型自己多次尝试后形成的“共识”。
- 训练重点:方法并不是盲目模仿所有输出,而是将模型分布条件化到伪解上,并针对与伪解不一致的补全进行蒸馏。换言之,它把学习焦点放在“模型较有把握但仍会出错”的位置。
- 实验表现:在 AIME24、AIME25、HMMT25、MATH500、AMC23 五个数学推理基准上,U-OPSD 在 Qwen3 非思考模式的 4B 和 8B 规模上分别比基础模型平均提升 8.5% 和 10.7%,并分别超过 OPSD 3.2% 和 2.3%。在思考模式下,它与 OPSD 基本持平,在 4B 上领先 0.9%,8B 上持平,同时分别超过 GRPO 0.7% 和 1.1%。
意义与影响
这项工作的关键价值在于降低后训练对高质量监督信号的依赖。对于数学推理这类答案可通过多次生成形成稳定共识的任务,模型自身的多数一致性可能成为一种低成本信号来源。如果结论能在更多任务和更大模型上延续,U-OPSD 将为“无标签后训练”提供一种更可扩展的路径。
不过,这类方法也有天然边界:多数投票只在模型内部存在可利用共识时有效;如果模型整体知识不足,或多个错误答案形成稳定多数,伪解仍可能引导错误方向。因此,它更像是一种把已有能力组织得更好的机制,而不是凭空创造新知识的方案。
总体来看,U-OPSD 的亮点不在于复杂奖励设计,而在于把“自一致性”转化为训练信号。它提示我们:后训练未必总要依赖外部教师,模型自身的分歧与共识,也可能成为提升推理能力的重要资源。
评论
正在确认登录状态……
正在加载评论……