返回文章列表
世界模型

EVO-WAM:让机器人世界模型从“想象”中迭代学习

阅读约 3 分钟

机器人策略要适应新任务,通常需要补充专家示范或反复在真实环境中试错。这两种方式成本高、速度慢,也限制了世界模型在机器人学习中的应用。论文《EVO-WAM: Evolving World Action Models through Video-Action Verification》尝试让模型利用自己的“想象”完成迭代,而不是依赖新的人工数据。

问题:看起来成功,不代表动作可执行

世界动作模型(World Action Model,WAM)能够结合视频先验,同时预测未来画面和机器人动作。它们因此有机会为新任务提供合成监督,但生成结果存在两个风险:视频可能根本没有展示任务完成,或者画面看似成功,配套动作却与视觉变化不一致,最终导致真实执行失败。

EVO-WAM的关键并不是盲目使用所有生成数据,而是建立一套筛选和验证机制:

  • 完善自回归生成能力:在WAM训练中加入状态预测,并使用锚定的多帧上下文,使模型能够在缺少外部执行反馈时完成更完整的连续 rollout。
  • 筛选任务完成片段:利用视觉语言模型判断生成轨迹中的前缀是否真正完成了目标,而非只依据局部画面或表面变化。
  • 核验视频—动作一致性:通过逆动力学模型检查生成视频中的运动是否与对应动作匹配,剔除视觉结果和动作指令不一致的样本。
  • 循环自训练:将验证通过的前缀加入训练,再用更新后的WAM生成新轨迹,形成“生成—验证—改进”的闭环。

实验表现

在七个未见过的RoboTwin 2.0任务上,EVO-WAM将Cosmos3的平均成功率从26.9%提升至68.0%,将DreamZero从28.5%提升至46.4%,分别约达到初始水平的2.5倍和1.6倍。对于真实世界的三个未见长时序组合任务,Cosmos3的平均成功率从20.0%提升至76.7%。

意义与边界

这项工作的重要价值在于,把世界模型的生成能力转化为一种可筛选的训练资源:机器人不必先把每条候选轨迹都执行一遍,模型可以先在内部空间中提出方案,再借助视觉和动力学验证降低错误样本的影响。它为“无新增专家示范”的任务适应提供了一个清晰范式,也说明视频质量与动作可靠性必须同时评估。

不过,EVO-WAM仍依赖视觉语言模型对任务完成度的判断,以及逆动力学模型对动作一致性的检验。生成轨迹是否能稳定覆盖真实世界中的长尾情况,仍需要更多任务和环境验证。更稳健的验证器、真实反馈与想象数据的结合,可能是后续提升泛化能力的关键。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章