返回文章列表
强化学习

Rufus-Air:把大模型后训练做成一套可复现流水线

阅读约 3 分钟

导语

大模型竞争正在从“预训练了多少参数”转向“如何把基础模型训练成真正好用的系统”。Rufus-Air 的价值,正是在于把后训练从零散的技巧组合,整理成一条公开、连续且尽可能可复现的工程流水线。该方案建立在 GLM-4.5-Air-Base(106B-A12B)之上,目标是说明一个开放团队如何通过数据、奖励和训练顺序,逐步获得更强的推理、编码、指令遵循与代理能力。

八个阶段,逐级扩大能力边界

Rufus-Air 采用串行管线,而不是把所有任务混在同一轮训练中:

  • SFT:先用多样且高质量的数据建立基本能力下限。
  • Reasoning RL:训练更强的推理表现。
  • Coding RL:针对代码任务使用强化学习。
  • Instruction-Following RL:强化对用户指令的遵循能力。
  • General Agent:扩展到通用代理任务。
  • Coding Agent:进一步处理代码代理场景。
  • Search Agent:训练搜索相关的代理行为。
  • RLHF:最后引入更偏好导向的人类反馈强化学习。

这套顺序体现出一个清晰原则:先处理目标明确、结果容易验证的问题,再进入需要综合判断的复杂任务。早期阶段依赖相对硬、可靠的奖励信号,后期才逐步使用更柔性的评审模型信号,以减少训练目标不稳定带来的风险。

论文真正强调的四个变量

第一,SFT 并非简单的启动步骤。作者认为,足够多样且质量稳定的监督数据,决定了模型后续强化学习能够达到的能力底线。

第二,强化学习数据需要做难度过滤。过于简单的提示无法提供有效学习信号,过于困难的提示又可能让优化陷入低效区间;把任务保持在“有挑战但可学习”的范围内,是提升训练效率的实用方法。

第三,奖励可靠性可以用来安排阶段顺序。可执行测试、明确答案等硬奖励适合较早使用,而依赖评审模型的软奖励更适合在模型已有基础能力后介入。

第四,基础设施不是论文之外的细节。数据管线、训练系统、评估方式以及各阶段衔接,都会影响最终结果,因此 recipe 的可复现性不能只依靠算法名称来保证。

意义与影响

Rufus-Air 表明,开放模型后训练的门槛不仅在于拥有一个强大的底座,也在于能否把数据治理、奖励建模和工程执行组织成稳定流程。作者称,该方案优于官方 GLM-4.5-Air 后训练版本,并与同规模开放模型具备竞争力;同时,项目主要使用开源组件和公开数据,没有新增人工标注,也没有依赖内部蒸馏教师。

对研究者而言,这提供了一个可拆解的实验框架:可以分别观察每个阶段带来的变化,而不是只比较最终分数。对模型开发者而言,Rufus-Air 的启示也很直接——后训练不是一次性“加上 RL”,而是围绕能力基础、奖励可信度和任务复杂度进行的长期系统工程。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
让推理模型学会适时停下:效率奖励如何改善拒答能力
强化学习
cctest.ai
强化学习

让推理模型学会适时停下:效率奖励如何改善拒答能力

一项研究发现,推理模型面对信息不足的问题时,往往比面对可回答问题投入更多计算,并在无休止的思考后仍尝试作答。研究者通过强化学习奖励高效判断任务是否可解,使模型在提升拒答表现的同时显著缩短思维链。

阅读全文