返回文章列表
强化学习

长链思维强化学习的新问题:不是每个 Token 都该拿同样信用

阅读约 3 分钟

导语

长链思维(long-CoT)已经成为提升大模型数学推理能力的重要路径,而基于可验证奖励的强化学习(RLVR)则是其中的关键训练范式。问题在于,当一个回答最终被判定为正确或错误时,模型生成过程中的每个 token 是否都应该承担同样的功劳或责任?论文《Not All Tokens Deserve Equal Credit》给出的答案是否定的。

核心要点

  • GRPO 的信用分配过于粗糙:GRPO 等无 critic 方法通常把回答级奖励转成 advantage,再广播到整段输出的 token 上。这种做法简单稳定,但默认每个 token 对最终结果贡献相近,难以区分关键推理步骤和普通连接词、格式词。

  • 自蒸馏信号也未必可靠:OPSD 通过“带特权信息的自教师”提供更密集的分布监督,理论上希望概率变化能反映哪些 token 更接近正确答案。但作者固定采样轨迹,在“假设正确”和“假设错误”两种相反结果条件下重新打分,发现许多受影响 token 在两种条件下朝同一方向变化,真正发生符号反转的并不多。

  • 大幅变化常出现在表层 token:论文进一步观察到,概率移动较大的 token 往往是高度可替换的表面表达,例如格式、衔接或措辞类成分;而携带题目特定推理内容的 token 反而未必最敏感。这说明“变化大”不等于“学习价值高”。

  • CSCR 的思路:作者提出 Counterfactual Sensitivity Credit Reallocation。它并不试图用特权模型重新决定奖励方向,而是在 GRPO 的基础上,根据 token 的反事实敏感度降低其信用,再对 token 级 advantage 重新归一化,从而保留原有验证器确定的总体信用预算和方向。

意义与影响

这项工作提醒我们,长 CoT 强化学习的难点不只是“奖励是否正确”,还包括“奖励应该落到哪些生成动作上”。如果把同一结果奖励平均分配给整条推理链,模型可能会过度强化无关的表述习惯;如果盲目信任自蒸馏产生的概率变化,又可能把表层敏感性误读为推理贡献。

CSCR 的价值在于提供了一个相对克制的改动:它仍然尊重验证器给出的回答级判断,只是在 token 层面重新分配信用。论文称,在多个长 CoT 数学推理基准和不同模型规模上,CSCR 在相同策略更新次数下持续优于 GRPO 及自蒸馏基线;消融实验也支持其诊断,即特权诱导方向并不稳定,适度降权最有效,过强调制会破坏优化稳定性。

对于正在训练推理模型的团队而言,这篇论文的启发是:token 级训练信号需要区分“对结果有因果贡献的推理内容”和“对提示条件敏感但可替换的语言外壳”。未来更精细的 CoT 强化学习,可能会越来越重视这种信用分配机制。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
SAF-OPD:让强化学习与在线蒸馏更稳定地合流
强化学习
cctest.ai
强化学习

SAF-OPD:让强化学习与在线蒸馏更稳定地合流

SAF-OPD 关注一个训练大模型时常见但容易被低估的问题:可验证奖励强化学习与在线蒸馏各有优势,简单相加却可能让训练提前失去探索能力。论文提出的 SAF 通过调节教师信号的强度与时机,在数学推理和代码生成任务中带来更稳定的收益。

阅读全文