长链思维强化学习的新问题:不是每个 Token 都该拿同样信用
导语
长链思维(long-CoT)已经成为提升大模型数学推理能力的重要路径,而基于可验证奖励的强化学习(RLVR)则是其中的关键训练范式。问题在于,当一个回答最终被判定为正确或错误时,模型生成过程中的每个 token 是否都应该承担同样的功劳或责任?论文《Not All Tokens Deserve Equal Credit》给出的答案是否定的。
核心要点
-
GRPO 的信用分配过于粗糙:GRPO 等无 critic 方法通常把回答级奖励转成 advantage,再广播到整段输出的 token 上。这种做法简单稳定,但默认每个 token 对最终结果贡献相近,难以区分关键推理步骤和普通连接词、格式词。
-
自蒸馏信号也未必可靠:OPSD 通过“带特权信息的自教师”提供更密集的分布监督,理论上希望概率变化能反映哪些 token 更接近正确答案。但作者固定采样轨迹,在“假设正确”和“假设错误”两种相反结果条件下重新打分,发现许多受影响 token 在两种条件下朝同一方向变化,真正发生符号反转的并不多。
-
大幅变化常出现在表层 token:论文进一步观察到,概率移动较大的 token 往往是高度可替换的表面表达,例如格式、衔接或措辞类成分;而携带题目特定推理内容的 token 反而未必最敏感。这说明“变化大”不等于“学习价值高”。
-
CSCR 的思路:作者提出 Counterfactual Sensitivity Credit Reallocation。它并不试图用特权模型重新决定奖励方向,而是在 GRPO 的基础上,根据 token 的反事实敏感度降低其信用,再对 token 级 advantage 重新归一化,从而保留原有验证器确定的总体信用预算和方向。
意义与影响
这项工作提醒我们,长 CoT 强化学习的难点不只是“奖励是否正确”,还包括“奖励应该落到哪些生成动作上”。如果把同一结果奖励平均分配给整条推理链,模型可能会过度强化无关的表述习惯;如果盲目信任自蒸馏产生的概率变化,又可能把表层敏感性误读为推理贡献。
CSCR 的价值在于提供了一个相对克制的改动:它仍然尊重验证器给出的回答级判断,只是在 token 层面重新分配信用。论文称,在多个长 CoT 数学推理基准和不同模型规模上,CSCR 在相同策略更新次数下持续优于 GRPO 及自蒸馏基线;消融实验也支持其诊断,即特权诱导方向并不稳定,适度降权最有效,过强调制会破坏优化稳定性。
对于正在训练推理模型的团队而言,这篇论文的启发是:token 级训练信号需要区分“对结果有因果贡献的推理内容”和“对提示条件敏感但可替换的语言外壳”。未来更精细的 CoT 强化学习,可能会越来越重视这种信用分配机制。
评论
正在确认登录状态……
正在加载评论……