返回文章列表
强化学习

LLM-as-a-Coach:让模型把“评语”学进权重里

阅读约 2 分钟

导语

在开放式任务里,传统强化学习常把复杂的文本反馈压缩成一个分数。这样做虽然方便优化,却会丢掉大量有价值的评语信息,也容易把本来质量不同的回答混成同一类。微软研究院这篇工作提出 LLM-as-a-Coach,希望让模型不只是“判卷”,而是能像教练一样把经验教给学生。

核心思路

论文的关键是把反馈链路从“标量奖励”改成“经验知识”。作者将原本的 LLM-as-a-Judge 重新设计为 LLM-as-a-Coach:

  • 教练不只判断对错或好坏,还会从当前策略生成的回答中提炼可迁移的经验。
  • 这些经验再作为条件输入,去指导一个 teacher model。
  • 最后,策略模型通过 on-policy context distillation,把这些经验内化到参数中。

相比只给一个 reward 分数,这条链路传递的信息更密,能够保留高质量回答之间的细微差别,而不是把它们简单压成“都差不多好”。

为什么这很重要

开放式任务往往没有唯一标准答案,比如创意写作、复杂推理、对话生成、任务规划等。此时,单纯依赖分数会带来两个问题:一是监督信号稀薄,二是模型可能学会迎合奖励而不是提升真实能力。EL 试图解决的正是这两个痛点。

论文传达的几个要点

  • 更高带宽的反馈:文本化经验比标量奖励包含更多细节。
  • 更强的泛化:在训练分布之外的任务上,EL 也表现得更稳。
  • 更少的奖励黑客:当反馈不再只是一个可投机的分数,模型更难钻空子。
  • 适用范围更广:作者在两类策略模型上都做了验证,反馈既可以来自模型自身,也可以来自专有模型。

影响与启发

这项工作的重要性不在于又提出一种“更复杂的 RL 公式”,而在于重新思考了后训练阶段的监督形式。对于非可验证任务来说,未来也许不该只问“这个答案得几分”,而应该问“这个答案为什么好、哪里还可改进、哪些经验可以迁移到下一次”。

如果这一方向继续发展,后训练可能会更像知识传授而不只是打分优化。对实际应用而言,这意味着模型有机会学到更细致的偏好结构,也可能在面对新任务时保持更好的适应性。

Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
GEPO:给混合任务里的大模型强化学习加上“分组熵”调节器
强化学习
cctest.ai
强化学习

GEPO:给混合任务里的大模型强化学习加上“分组熵”调节器

GEPO 是对 GRPO 的轻量改造,核心不是简单压高熵或保低熵,而是按 prompt 分组的熵状态,去做更细粒度的优势项塑形。它试图解决混合任务训练中,不同题型探索需求不一致、导致统一熵控制失灵的问题。

阅读全文