Rufus-Air:把大模型后训练做成一套可复现流水线
导语
大模型竞争正在从“预训练了多少参数”转向“如何把基础模型训练成真正好用的系统”。Rufus-Air 的价值,正是在于把后训练从零散的技巧组合,整理成一条公开、连续且尽可能可复现的工程流水线。该方案建立在 GLM-4.5-Air-Base(106B-A12B)之上,目标是说明一个开放团队如何通过数据、奖励和训练顺序,逐步获得更强的推理、编码、指令遵循与代理能力。
八个阶段,逐级扩大能力边界
Rufus-Air 采用串行管线,而不是把所有任务混在同一轮训练中:
- SFT:先用多样且高质量的数据建立基本能力下限。
- Reasoning RL:训练更强的推理表现。
- Coding RL:针对代码任务使用强化学习。
- Instruction-Following RL:强化对用户指令的遵循能力。
- General Agent:扩展到通用代理任务。
- Coding Agent:进一步处理代码代理场景。
- Search Agent:训练搜索相关的代理行为。
- RLHF:最后引入更偏好导向的人类反馈强化学习。
这套顺序体现出一个清晰原则:先处理目标明确、结果容易验证的问题,再进入需要综合判断的复杂任务。早期阶段依赖相对硬、可靠的奖励信号,后期才逐步使用更柔性的评审模型信号,以减少训练目标不稳定带来的风险。
论文真正强调的四个变量
第一,SFT 并非简单的启动步骤。作者认为,足够多样且质量稳定的监督数据,决定了模型后续强化学习能够达到的能力底线。
第二,强化学习数据需要做难度过滤。过于简单的提示无法提供有效学习信号,过于困难的提示又可能让优化陷入低效区间;把任务保持在“有挑战但可学习”的范围内,是提升训练效率的实用方法。
第三,奖励可靠性可以用来安排阶段顺序。可执行测试、明确答案等硬奖励适合较早使用,而依赖评审模型的软奖励更适合在模型已有基础能力后介入。
第四,基础设施不是论文之外的细节。数据管线、训练系统、评估方式以及各阶段衔接,都会影响最终结果,因此 recipe 的可复现性不能只依靠算法名称来保证。
意义与影响
Rufus-Air 表明,开放模型后训练的门槛不仅在于拥有一个强大的底座,也在于能否把数据治理、奖励建模和工程执行组织成稳定流程。作者称,该方案优于官方 GLM-4.5-Air 后训练版本,并与同规模开放模型具备竞争力;同时,项目主要使用开源组件和公开数据,没有新增人工标注,也没有依赖内部蒸馏教师。
对研究者而言,这提供了一个可拆解的实验框架:可以分别观察每个阶段带来的变化,而不是只比较最终分数。对模型开发者而言,Rufus-Air 的启示也很直接——后训练不是一次性“加上 RL”,而是围绕能力基础、奖励可信度和任务复杂度进行的长期系统工程。
评论
正在确认登录状态……
正在加载评论……