返回文章列表
机器人与物理 AI

RL²-VLA:让机器人在推理时学会“该出手时再出手”

阅读约 3 分钟

导语

视觉-语言-动作模型(VLA)正在成为机器人执行开放式任务的重要路线:模型能够看懂场景、理解语言指令,并直接输出动作。然而,一旦任务变得更复杂,或环境与训练数据分布不一致,VLA 的表现往往会明显下滑。来自新加坡国立大学等机构的论文 RL²-VLA 试图解决的正是这个问题:在不重新训练大模型、不收集大量新数据的前提下,让机器人在推理时更聪明地调整动作。

核心要点

  • 问题不只是“采样不够多”:已有测试时缩放或引导方法会在推理阶段生成更多动作候选,但这些动作常常集中在相近行为附近,容易共享同一类失败模式。
  • RL² 使用 VLA 潜变量训练轻量 RL 策略:研究者从 VLA 的动作专家中提取表达性潜变量,用离线强化学习训练一个额外策略。推理时,它并不替换原模型,而是将 RL 策略的流速度与冻结 VLA 的流速度进行组合。
  • 把模仿学习先验和 RL 多样性结合起来:大规模模仿学习带来稳定的行为先验,离线 RL 则可能探索示范数据主模式之外的动作,从而在困难场景中提供更多逃离失败轨迹的机会。
  • 关键是自适应干预:论文指出,测试时引导在“可能成功”和“可能失败”的状态下呈现不同规律。若基础 VLA 已经大概率会成功,额外动作多样性可能反而扰乱原本正确的输出;若模型处于可能失败状态,多样性才更有价值。
  • 实验结果:在 SIMPLER 和 PolaRiS 基准上,RL² 在分布外设置中最高提升 +17.3% 成功率。消融与缩放研究强调了潜变量表示和 RL 训练的重要性,真实世界实验也显示该方法具备迁移潜力。

意义与影响

RL²-VLA 的价值在于,它把“测试时缩放”从简单增加采样,推进到更有条件判断的策略组合。对机器人部署来说,这很关键:现实环境中的失败往往来自边缘状态,而不是每一步都需要强行干预。若系统能识别何时应相信基础策略、何时应引入更具探索性的 RL 引导,就能在稳定性和适应性之间取得更好平衡。

更重要的是,该框架保持了预训练 VLA 的冻结状态,降低了改造成本。对于已经拥有大规模 VLA 模型的团队而言,RL² 更像一个可插拔的推理时增强模块,而不是推倒重来的训练方案。当然,论文摘要中披露的信息仍主要集中在方法和基准结果,未来还需要观察其失败预测机制在更开放、更长时程任务中的可靠性,以及离线 RL 策略对数据质量的敏感程度。

总体来看,RL²-VLA 为具身智能提供了一个务实方向:不是让机器人时刻“更激进”,而是让它在意识到自己可能出错时,再调用额外的行动多样性。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章