EXIMO:让VLM为VLA机器人策略规划探索路径
导语
让机器人学会一个新任务,通常有两条路:一条是依赖人类遥操作,采集大量示范后对视觉-语言-动作模型(VLA)进行行为克隆;另一条是使用强化学习,让机器人通过试错自行寻找策略。前者成本高、需要大量人工参与,后者在长时任务中又容易面临探索困难和样本效率低的问题。EXIMO提出了一套结合两者优势的微调流程,试图让大型VLA更快适应新任务。
核心方法:探索、模仿与优化
EXIMO的名称对应三个连续阶段:
- 探索(Explore):系统为VLA配备一个视觉语言模型(VLM)作为规划器。面对需要多个步骤才能完成的任务,VLM负责理解目标、进行思考,并将长时任务拆分成更短、更容易执行的子任务。VLM与VLA协同工作,在新任务环境中收集“经过组织”的数据,而不是让VLA直接在完整任务空间中盲目试错。
- 模仿(Imitate):收集到的数据被用于微调VLA。经过规划器整理的轨迹,为策略提供了更明确的行为示范,使模型能够先学习任务的基本结构和执行流程。
- 优化(Optimize):在已有策略的基础上,EXIMO进一步引入残差离策略强化学习。强化学习不必从零开始寻找动作,而是学习对现有VLA策略的补充或修正,从而将优化重点放在仍然存在的执行误差上。
这种设计的关键不只是把VLM和VLA放在同一个系统中,而是为不同模型分配不同职责:VLM侧重高层理解与任务分解,VLA负责视觉条件下的具体动作执行,强化学习则用于处理模仿数据未能覆盖的细节。
为什么值得关注
VLA模型通常规模较大,直接对其进行强化学习既需要大量交互数据,也会受到模型架构和训练成本的限制。EXIMO先用VLM引导探索,再用模仿学习建立较好的初始化策略,最后通过残差强化学习完成局部修正,形成了一条由高层规划到低层控制的渐进式路径。
论文通过对三个阶段分别进行消融实验,考察各环节对整体效果的贡献。根据作者报告,完整EXIMO在样本效率和最终性能方面显著优于已有方法。这一结果说明,机器人策略微调未必需要在“纯示范学习”和“纯强化学习”之间二选一,合理组织探索数据可能是连接两者的重要环节。
意义与局限
如果这类方法能够在更多机器人平台和任务上保持效果,未来适应新任务的成本有望从持续遥操作,转向少量交互加模型引导的自主数据收集。尤其对于步骤较多、容易在早期失败的任务,任务分解可能帮助策略更快获得有效经验。
不过,现有素材主要介绍了方法框架和总体实验结论,未提供具体任务、机器人配置、数据规模或性能数值。因此,EXIMO在不同环境中的泛化能力、VLM规划错误对VLA的影响,以及残差强化学习的稳定性,仍需要结合论文完整实验进一步判断。可以明确的是,它为大型VLA的持续适应提供了一个清晰思路:先让模型知道“应该分几步做”,再让策略学会“每一步如何做得更好”。
评论
正在确认登录状态……
正在加载评论……