返回文章列表
大语言模型

TOPL:把后训练改写成“逐 token 判断”,提升分布偏移下的忠实生成

阅读约 2 分钟

导语

在大模型后训练中,如何让模型在“看过的分布”之外依然保持忠实输出,一直是个难题。尤其在摘要、翻译这类任务里,模型不仅要生成流畅文本,更要尽量贴近事实或源文。来自这篇论文的核心思路很直接:不要让模型硬去模仿离策略采样出来的整段回答,而是把学习目标改成“逐个 token 判断对错”。

核心要点

  • 重新定义训练目标:TOPL(Token-Level Off-Policy Labeling)把后训练变成 token 级别的正确性预测,而不是传统的序列级生成拟合。
  • 训练信号更稳健:模型学习区分一段回答中的好 token 和坏 token,从而间接被引导去生成更好的 token。
  • 跨数据集表现更强:在文档摘要任务上,方法在 11 个数据集上展示了较好的分布外泛化能力,并与多种 sequence-level 和 token-level 基线相比保持竞争力。
  • 可迁移到其他忠实生成任务:作者还展示了它能有效迁移到机器翻译,说明这种训练范式并不局限于摘要。
  • token 级信号是关键:消融实验表明,简单的 sequence-level 类比方法并没有带来同样收益,说明粒度更细的监督更重要。
  • 更新结果更可解释:通过 TOPL 学到的 LoRA adapter,模型更新表现得像线性分类头和 steering vector,便于理解其作用方式。

这意味着什么

这篇工作最值得关注的地方,不只是“效果更好”,而是它提供了一种新的后训练视角:与其把离策略数据当作完整答案去模仿,不如把它拆成局部判断任务,让模型学会识别哪些 token 值得延续、哪些 token 应该回避。这样的设计尤其适合分布发生变化时的忠实生成,因为它减少了对整段错误输出的直接追随。

从应用角度看,这类方法可能对摘要、翻译以及其他需要事实一致性的生成场景都有参考价值。更重要的是,论文还给出了可解释性线索:如果 LoRA 更新本身可以近似成分类头或 steering vector,那么后训练不再只是“黑箱调参”,而更像一种可分析、可控制的行为塑形过程。

总结

TOPL 的贡献在于把离策略学习从“生成模仿”改造成“局部判断”,从而在分布偏移下获得更稳的忠实生成能力。它既提供了实验上的改进,也给出了一种更易理解的训练机制。

来源: Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
DeepLoop:让循环 Transformer 的深度扩展更稳定
大语言模型
cctest.ai
大语言模型

DeepLoop:让循环 Transformer 的深度扩展更稳定

DeepLoop 关注一个容易被忽视的问题:当 Transformer 通过重复使用同一组模块来增加“展开深度”时,传统残差缩放规则不一定仍然适用。论文提出按参数被重复访问的方式重新设定缩放,从而提升循环式语言模型的训练稳定性与效果。

阅读全文
CCTest · Blog
GigaWorld-Policy-0.5:让世界动作模型更接近实时机器人控制
大语言模型
cctest.ai
大语言模型

GigaWorld-Policy-0.5:让世界动作模型更接近实时机器人控制

GigaWorld-Policy-0.5 试图解决世界动作模型在推理阶段“太重”的问题:训练时利用未来视觉动态,部署时只解码动作。其混合训练、专家化 Transformer 与 AutoResearch 搜索流程,共同指向更高效的机器人策略学习。

阅读全文