返回文章列表
强化学习

扩散模型也能做奖励模型:DRM让人类偏好从“单一分数”走向分布

阅读约 3 分钟

导语

奖励模型是RLHF的重要组成部分:它负责把人类对回答质量、安全性或帮助性的判断转化为训练信号。传统方法通常为每个“提示词—回答”对输出一个标量,或者假设奖励服从某种预先指定的分布。这样的设计高效,却可能掩盖一个事实:人类对同一回答的评价并不总是收敛到单一答案,不同评判者可能基于不同标准给出合理判断。

清华NLP团队提出的 Diffusion Reward Model(DRM),试图把这种不确定性直接纳入奖励建模。论文将任务改写为条件密度估计,即学习给定输入和回答后的奖励分布 p(r|x,y),而不是只预测一个固定分数。

核心方法

  • 用扩散过程生成奖励:DRM以冻结的大语言模型编码器提取输入表示,再由轻量级 Diffusion Transformer 从高斯噪声逐步去噪,生成奖励向量。
  • 不预设输出分布形状:与高斯等固定参数族不同,扩散模型不要求奖励分布符合某一种简单形式,因此更适合描述多峰或多模态偏好。
  • 兼容多种标注形式:同一套架构既可以处理多属性回归,也可以处理成对偏好数据,减少了针对不同任务设计不同奖励头的需要。
  • 从样本得到更多决策信号:推理时对同一输入采样多个奖励值,可形成经验分布,并进一步计算均值、方差、分位数等信息。

实验与意义

论文在五个基准上将DRM与数据和骨干模型相匹配的基线进行比较。结果表明,DRM能够达到或超过部分基线;即使训练规模相对克制,也能与参数量更大的判别式、分布式和生成式奖励模型保持竞争力。更重要的是,作者观察到传统奖励头容易把多模态结构压缩成一个点,而DRM能够恢复这类结构。

这类分布信息并非只是可视化工具。论文进一步探索了不确定性感知的拒绝机制,以及下置信界(LCB)聚合:系统可以在奖励均值之外考虑风险和置信程度,从而辅助奖励模型作出更谨慎的选择。在下游RLHF实验中,使用DRM提供训练时奖励也带来了更好的策略表现,说明奖励分布可能不仅能解释模型判断,还能参与优化过程。

影响与边界

DRM代表了一种值得关注的方向:奖励模型不必被限定为“输入对应一个分数”,而可以成为描述偏好、分歧与不确定性的条件生成模型。对于安全对齐、拒答决策和高风险任务,这种信息有望帮助系统避免过度自信。

不过,现有素材没有披露各基准的具体分数、采样成本和不同聚合策略的详细对比,因此不宜据此断言DRM已经全面取代传统奖励模型。实际部署仍需权衡额外采样带来的推理开销,以及奖励分布是否真正反映了目标人群的偏好。总体而言,DRM为RLHF从标量奖励走向结构化奖励提供了一个新的技术路径。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章