从预训练到强化学习:用国际象棋拆解模型推理能力
导语
强化学习正在成为提升大语言模型复杂推理能力的关键步骤,但一个长期被模糊处理的问题是:RL 后训练的收益,到底有多少来自 RL 本身,又有多少已经被预训练阶段“预埋”好了?论文《Understanding Reasoning from Pretraining to Post-Training》试图把这个问题拆开来看。
作者没有直接在庞大、不可控的通用语料上做实验,而是选择国际象棋作为受控测试床。这样做的好处是,棋局数据、推理轨迹和奖励信号都更容易界定,能够更清楚地观察从预训练到后训练的因果关系。
核心要点
- 搭建完整训练链路:研究沿用了类似 LLM 的标准流程,先在真人棋局上预训练 5M 到 1B 参数规模的语言模型,再用合成推理轨迹做监督微调,最后在国际象棋谜题上通过可验证奖励进行 RL。
- 预训练质量能预测 RL 后表现:在给定 RL 计算量下,模型经过 RL 后能达到的性能,与预训练损失有较强关系。换言之,后训练并不是一个完全独立的“魔法步骤”,它的上限和效率受到预训练基础的明显约束。
- 预训练 token 影响 RL 学习速度:论文观察到,RL 奖励曲线的斜率会随预训练 token 数近似线性改善。这意味着更充分的预训练不仅提高起点,也会让模型在 RL 阶段更快吸收奖励信号。
- RL 不只是“锐化”SFT 策略:在容易的棋题上,RL 会放大 SFT 阶段已经偏好的正确走法;但在困难棋题上,RL 可能把 SFT 下几乎没有出现过的正确走法挖掘出来。这说明 RL 的作用不只是让模型更自信,也可能改变可搜索到的解空间。
- 数学领域出现相似模式:作者还在数学领域文本上训练 1B 模型进行验证,发现更长预训练的检查点在 RL 后达到更高表现,并且提升更快,说明该规律可能不局限于棋类任务。
意义与影响
这项研究的价值在于,它把“预训练—SFT—RL”放在同一个可控框架里分析,而不是只观察最后的 RL 阶段。对模型研发来说,这提醒我们:如果预训练基础不足,单纯堆 RL 计算可能并不划算;如果预训练做得更充分,RL 的边际收益可能也会更高。
同时,论文对“RL 是否只是让模型更贴合已有策略”给出了更细的答案。RL 在简单任务中像是增强器,在困难任务中则可能像探索器。这对理解推理模型为何能在后训练后突然解决更难问题,提供了一个更可检验的实验视角。
当然,国际象棋仍是高度结构化的环境,不能直接等同于开放语言推理。但它为研究推理能力形成机制提供了低噪声实验场,也为未来设计更系统的后训练计算分配策略提供了参考。
评论
正在确认登录状态……
正在加载评论……