ISO:把 RLVR 的优化重点从“改谱”转向“调框架”
导语
RLVR(reinforcement learning with verifiable rewards,可验证奖励强化学习)正在成为提升语言模型推理与代码能力的重要路线。但一个长期被低估的问题是:奖励信号到底如何转化为模型权重空间中的有效更新?来自 UT Austin 等机构的论文《ISO: An RLVR-Native Optimization Stack》试图回答这一“优化层”问题,并给出一个面向 RLVR 的固定谱优化框架 ISO。
核心要点
- 关键发现:能力变化不主要来自奇异值谱。 作者从模型权重的奇异结构入手,观察到 RLVR 训练后,基座模型的奇异值谱基本被继承下来;新行为更多体现在与奇异值相配套的输入、输出奇异框架(U、V)变化上。
- 谱交换实验提供功能性验证。 论文称,把基座模型的谱重新放回 RL checkpoint,在不同混合比例下,基准测试仍保持 RL 水平;反过来,将 RL 训练后的谱移植到训练前框架上,并不能带来提升。这支持了“继承谱、优化框架”的判断。
- ISO-Merger 面向离线合并。 对共享同一基座的 RL 专家模型,ISO-Merger 组合它们的框架变化,形成一个固定谱模型。它不需要合并后数据、rollout、梯度更新或 on-policy distillation,并在论文比较中优于 TA、TIES、TSV、RAM、OrthoMerge 等数据-free 合并方法。
- ISO-Optimizer 面向在线训练。 在线版本把 AdamW、Muon 等基础优化器作用在框架变量上,同时冻结基座谱。在 1.5B 到 8B 参数规模的推理和代码任务上,报告结果显示它能提升准确率,并以更少训练步达到匹配分数。
意义与影响
ISO 的价值不只在于一个新优化器,而在于它给 RLVR 后训练提供了更明确的结构假设:如果奖励驱动的能力增量主要写入奇异框架,那么继续沿用预训练阶段的权重更新直觉可能并不最优。固定谱、调框架的做法,可能让训练更高效,也让多专家能力合并更可控。
论文给出的一个具体结果是,在 Qwen3-8B-Base 上,AdamW 在 270 步达到 0.495 的 aggregate accuracy,而 ISO-AdamW 在 100 步达到相同准确率,并在 210 步提升到 0.509。这样的结果说明,ISO 至少在报告设置中展现了加速 RLVR 后训练的潜力。
当然,ISO 仍需要更多独立复现与更广泛模型、任务验证。它提出的“谱继承”视角,为理解 RLVR 如何改造模型提供了一个清晰抓手,也可能影响未来的模型合并、后训练优化和高效强化学习流程设计。
评论
正在确认登录状态……
正在加载评论……