返回文章列表
大语言模型

TOPL:把后训练改写成“逐 token 判断”,提升分布偏移下的忠实生成

阅读约 2 分钟

导语

在大模型后训练中,如何让模型在“看过的分布”之外依然保持忠实输出,一直是个难题。尤其在摘要、翻译这类任务里,模型不仅要生成流畅文本,更要尽量贴近事实或源文。来自这篇论文的核心思路很直接:不要让模型硬去模仿离策略采样出来的整段回答,而是把学习目标改成“逐个 token 判断对错”。

核心要点

  • 重新定义训练目标:TOPL(Token-Level Off-Policy Labeling)把后训练变成 token 级别的正确性预测,而不是传统的序列级生成拟合。
  • 训练信号更稳健:模型学习区分一段回答中的好 token 和坏 token,从而间接被引导去生成更好的 token。
  • 跨数据集表现更强:在文档摘要任务上,方法在 11 个数据集上展示了较好的分布外泛化能力,并与多种 sequence-level 和 token-level 基线相比保持竞争力。
  • 可迁移到其他忠实生成任务:作者还展示了它能有效迁移到机器翻译,说明这种训练范式并不局限于摘要。
  • token 级信号是关键:消融实验表明,简单的 sequence-level 类比方法并没有带来同样收益,说明粒度更细的监督更重要。
  • 更新结果更可解释:通过 TOPL 学到的 LoRA adapter,模型更新表现得像线性分类头和 steering vector,便于理解其作用方式。

这意味着什么

这篇工作最值得关注的地方,不只是“效果更好”,而是它提供了一种新的后训练视角:与其把离策略数据当作完整答案去模仿,不如把它拆成局部判断任务,让模型学会识别哪些 token 值得延续、哪些 token 应该回避。这样的设计尤其适合分布发生变化时的忠实生成,因为它减少了对整段错误输出的直接追随。

从应用角度看,这类方法可能对摘要、翻译以及其他需要事实一致性的生成场景都有参考价值。更重要的是,论文还给出了可解释性线索:如果 LoRA 更新本身可以近似成分类头或 steering vector,那么后训练不再只是“黑箱调参”,而更像一种可分析、可控制的行为塑形过程。

总结

TOPL 的贡献在于把离策略学习从“生成模仿”改造成“局部判断”,从而在分布偏移下获得更稳的忠实生成能力。它既提供了实验上的改进,也给出了一种更易理解的训练机制。

来源: Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Qwen3.8-Next架构解读:把效率、能力与稳定性放进同一张设计表
大语言模型
cctest.ai
大语言模型

Qwen3.8-Next架构解读:把效率、能力与稳定性放进同一张设计表

Qwen团队公布Qwen3.8-Flash-Next的架构与消融研究:模型以1250亿参数、每token激活60亿参数为基础,通过混合状态空间与注意力、门控残差及主机侧n-gram表降低训练成本。论文更强调,损失、下游能力、推理开销和训练稳定性必须联合优化。

阅读全文
CCTest · Blog
可解释性不再是性能税?Steerling-8B 探索“生来透明”的语言模型
大语言模型
cctest.ai
大语言模型

可解释性不再是性能税?Steerling-8B 探索“生来透明”的语言模型

这篇技术报告提出一种训练期可解释语言模型路线:不是在模型训练后再解释黑箱,而是把可解释性作为训练目标的一部分。其代表模型 Steerling-8B 试图在生成结果、输入 token、概念与训练数据之间建立可追溯关系。

阅读全文
CCTest · Blog
无需外部监督的在策略自蒸馏:让大模型从自己的共识中学习
大语言模型
cctest.ai
大语言模型

无需外部监督的在策略自蒸馏:让大模型从自己的共识中学习

这篇论文提出 U-OPSD:只利用模型自身多次生成结果的一致性来构造伪答案,并在分歧样本上进行自蒸馏。实验显示,该方法在数学推理基准上可稳定提升 Qwen3 等模型表现,并能匹敌或超过带真值监督的方法。

阅读全文