返回文章列表
强化学习

跨分词器在策略蒸馏中,监督覆盖率不如可靠性重要

阅读约 3 分钟

在线策略蒸馏(On-Policy Distillation,OPD)让学生模型先生成自己的回答,再利用教师模型的预测分布提供训练信号。它比单纯模仿固定数据更接近学生实际会遇到的生成轨迹,但当教师和学生采用不同分词器时,如何比较两者的预测就成为关键难题:不仅序列需要对齐,词表层面的候选 token 也必须能够对应。

这篇论文重新审视了一个看似自然的方向:既然跨分词器会造成监督缺口,那么扩大对齐覆盖率是否就能改善蒸馏?作者在数学推理和代码生成任务上,比较了三组具有异构分词器的教师—学生组合。结果并不支持“覆盖越广越好”的简单判断。

核心发现包括:

  • 严格的一对一对齐组已经覆盖了大多数学生生成的 token,即使教师与学生的词表存在明显差异。
  • 在蒸馏前由学生自行采样的回答上,严格对齐位置的共享词表通常承载了教师和学生几乎全部的概率质量。这意味着,很多有效的教师信号并没有因为词表不同而丢失。
  • 在每个严格对齐位置,只对学生选出的共享词表 Top-16 子集计算反向 KL,取得了与完整共享词表 OPD 相近的准确率,并优于论文评估的其他跨分词器基线。
  • 对不匹配分组增加跨度级 log-probability 均方误差,可以实现完整监督覆盖,但准确率反而下降。

作者进一步分析了训练信号之间的关系。在仅使用严格对齐损失训练出的若干检查点上,不匹配跨度损失产生的梯度,与严格损失梯度之间只有较弱的方向一致性,部分情况下甚至方向相反;与此同时,跨度梯度相对于严格梯度的幅度还会逐渐增大。这为“额外监督为何损害效果”提供了一个可能解释:新增信号虽然填补了覆盖空白,却未必与当前最有用的优化方向一致,甚至可能干扰原本有效的学习过程。

这项工作的意义不在于否定更广泛的对齐方法,而在于改变评估重点。跨分词器蒸馏不能只问“有多少 token 得到了监督”,还应进一步检查监督是否稳定、是否包含足够概率质量,以及它带来的梯度是否与既有目标协同。对于 OPD 系统设计而言,较小的共享词表候选集和严格位置上的高质量损失,可能比对所有不匹配片段强行补齐监督更值得优先尝试。

当然,论文结论来自有限的教师—学生组合及数学、代码任务,不能直接推导出所有模型和场景的普遍规律。它更像是一项诊断性研究:在追求更高监督覆盖率之前,先验证新增信号是否真正可靠,可能是提升跨分词器蒸馏效率的关键。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
NeMo-DCR:用增量同步把万亿参数智能体强化学习权重更新提速约35倍
强化学习
cctest.ai
强化学习

NeMo-DCR:用增量同步把万亿参数智能体强化学习权重更新提速约35倍

NeMo-DCR 面向训练集群与 rollout 集群之间的权重同步,只传输发生变化的参数,并保证接收端与完整检查点加载结果逐位一致。在 1 万亿参数、3% 元素变化的测试中,同步时间从 87.5 分钟降至 2.5 分钟。

阅读全文