返回文章列表
强化学习

PLC-DPO:让偏好优化学会纠正噪声标签

阅读约 2 分钟

导语

直接偏好优化(DPO)因不需要单独训练奖励模型,已经成为大语言模型对齐中的常用方法。它的基本假设是:偏好数据中被选答案确实优于未选答案。然而,人工标注和自动构造的数据并不总是可靠,比较结果可能出现偏好方向颠倒、两种回答差距很小,或者标注者实际上无法明确判断的情况。若DPO仍把这些样本当成强监督,模型就可能被推向错误方向。

PLC-DPO做了什么

PLC-DPO将偏好学习重新表述为“判断监督信号应如何使用”。它为每个回答对设置三种潜在状态:

  • clean:观测到的偏好方向可信,正常强化该方向;
  • flip:观测标签可能反了,训练时反转更新方向;
  • tie:两者差异不足以支持明确偏好,削弱方向性学习并加入平局约束。

方法的关键证据来自当前策略与参考模型在两个回答上的对数概率差,也就是策略—参考边际。经过校准后,这一边际被用来估计不同状态的路由权重。换言之,模型不会简单地把“看起来可疑”的样本丢弃,而是决定它应当被正向学习、反向修正,还是降低其方向性影响。

为提高训练稳定性,PLC-DPO结合了正向损失、反向损失和平局正则项,并采用指数移动平均校准、预热阶段与置信度门控。整个流程复用了DPO本来就需要的对数概率,不依赖额外模型或新增人工监督。

实验与意义

论文在57个数据集—模型—基准组合中比较了多种方法。PLC-DPO报告的平均对DPO胜率为60.5%,下一优方法为55.5%。此外,作者还进行了注入噪声测试、平局压力测试、人工分歧分析和自确认诊断,用于观察路由是否稳定,以及它能否区分“标签翻转”和“偏好很弱”这两类问题。素材显示,方法在这些分析中表现出相应的区分能力。

这项工作的价值不在于宣称所有偏好标签都能被自动纠正,而在于改变了处理噪声监督的思路:低质量样本不一定只能被删除,也可以被分解为方向和强度两个问题分别处理。对于偏好数据规模扩大、标注成本上升的训练流程,这种机制可能提供更细粒度的利用方式。与此同时,路由判断依赖模型自身的边际,因此校准质量、预热策略以及错误自我强化仍是实际部署时需要持续验证的环节。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章