返回文章列表
强化学习

VLA强化学习的关键变化,可能集中在一个被忽视的小模块

阅读约 3 分钟

导语

视觉-语言-动作(VLA)模型正在从“会理解、会模仿”走向“能通过试错持续改进”。不过,强化学习究竟改变了VLA策略的哪些部分,长期以来并不清晰。来自HOLI-LAB的这项研究没有只关注最终成功率,而是转向参数空间,追踪强化学习信号具体沉淀在哪里。

核心发现

研究覆盖了多种流式VLA模型,包括π_{0.5}与GR00T N1.5/N1.6,并在LIBERO、ManiSkill、MetaWorld和CALVIN等任务环境中进行分析。研究者发现:

  • 强化学习更新具有低秩结构。 与模型整体参数规模相比,训练后产生的有效变化集中在相对有限的方向上,说明策略改进未必需要大范围重塑基础模型。
  • 更新高度集中于Timestep Modules。 这些模块位于动作专家内部,规模较小,过去并不是VLA后训练中最受关注的组件。但替换模块的实验显示,它们承载了强化学习带来的不成比例的性能收益。
  • 离散去噪时间步是重要线索。 强化学习 rollout 使用的离散去噪时间步,会使Timestep Modules针对这些特定步骤进行专门化;研究认为,这种离散化训练也是低秩更新形成的重要原因。
  • shift向量变化最明显。 在Timestep Modules的多个输出中,shift向量在强化学习前后呈现出最突出的变化。基于探测实验,shift更新方向对任务成功具有很强的预测能力,最高ROC-AUC达到99.6%。
  • 参数几何可以呈现任务关系。 不同任务对应的shift更新方向,其两两相似度与跨任务迁移模式存在相关性。这意味着参数更新的方向,不只是“改了多少”的指标,也可能包含任务之间的结构信息。

意义与影响

这项工作带来的重要启发是:VLA强化学习可能不是对整套策略进行均匀调整,而是在动作生成流程中找到少量、任务相关的控制方向。若这一结论在更多模型和真实机器人场景中得到验证,未来的后训练可以减少需要更新的参数范围,从而降低训练成本,并提高策略变化的可解释性。

研究还展示了一种不依赖额外强化学习训练的改进思路:沿着已识别的shift更新方向对策略进行引导,并进一步提升经过RL训练的策略。这并不意味着该方法已经取代完整的强化学习流程,但它说明,分析参数更新本身,可能帮助研究者进行更精细的策略编辑、任务迁移和能力诊断。

需要注意的是,现有结论建立在特定流式VLA架构、离散去噪设置和若干仿真任务基准之上。低秩更新是否同样适用于其他动作生成范式、连续时间设置及真实世界机器人,仍有待后续研究检验。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章