RLVR如何把推理锁在门口:能力未消失,路径先收缩
导语
强化学习与可验证奖励(RLVR)通常能提升模型的单次回答准确率,但这项收益可能伴随着另一种代价:模型越来越倾向于重复少数几条熟悉的解题路径。这样一来,即使增加测试时采样次数,获得新答案的机会也会下降。
来自 Hugging Face Daily Papers 的这项研究提出了一个关键问题:解空间收缩究竟发生在哪里?是模型已经无法调用某类有效解法,还是已经进入该解法后,无法继续完成计算?研究者给出的答案是:问题主要出在“入口”,而不是后续执行阶段。
核心发现
- 解题覆盖率明显下降。 研究以 Countdown 为实验任务,将可能的解法按“第一个操作数和运算符”划分为离散的入口家族,并比较 Qwen2.5-3B 在 PPO、Qwen2.5-3B-Instruct 在 GRPO 下的变化。两种训练设置都出现了解空间收缩,覆盖率最高下降 67%;即使是所有训练检查点都能解决的问题,覆盖范围也可能减少一半。
- 变化集中在首次计算之前。 首次算术操作前的逐 token 似然变化,比后续推理阶段大 11 至 16 倍。这说明 RLVR 更像是在重塑模型“从哪里开始想”,而不是全面削弱其计算能力。
- 替代路径仍然可以执行。 当研究者只提供一个模型原本较少选择的入口前缀时,低访问率解法家族的完成率在 PPO 设置下由 0.018 提升至 0.212。这个结果支持一种解释:模型仍保留后续推理能力,只是很少主动开启这些路径。
- 入口干预优于表面提示。 普通提示词未能有效恢复多样性,而将晚层参数与早期检查点进行插值后,解题覆盖率提升 37%,且 pass@1 没有损失。
- 现象并非 RLVR 的必然结果。 在六个数学基准和 7B、14B 模型上,研究者观察到早期步骤熵下降会反复出现;但 SFT 基线保留了超过两倍的覆盖率,分阶段的 SFT—DPO—RLVR 流程也能保留早期步骤熵。
意义与影响
这项工作把“RLVR 降低探索性”具体定位成了一个入口控制问题。对推理模型而言,提升 pass@1 并不等于保留广泛的候选解空间;如果训练持续奖励少数高频、易验证的起点,模型可能更快进入熟悉路线,却更难尝试其他同样可行的路线。
这一结论对测试时扩展尤其重要。增加采样数量的前提,是策略仍能产生足够多样的轨迹。如果多样性在第一步就被压缩,单纯扩大推理预算可能只是在重复相似答案。未来的 RLVR 训练或许需要显式监控早期熵、入口家族覆盖率等指标,并把探索约束放在推理起点,而不只是最终奖励上。
不过,研究主要基于 Countdown 及若干数学基准,结论能否直接推广到开放式推理、代码生成或多模态任务,仍需进一步验证。它提供的更稳妥启示是:评估强化学习后的模型时,除了看最终正确率,也应检查模型究竟还保留了多少可进入、可执行的替代路径。
评论
正在确认登录状态……
正在加载评论……