WorldLine:让机器人先在视觉世界中验证动作
导语
机器人要学会抓取、推移或放置物体,通常需要大量真实交互数据:每一次动作都可能耗费时间、设备寿命和人工成本。相比之下,视觉模拟器可以在真正执行前预测某个动作会如何改变场景,从而帮助策略筛选和具身规划。但现有视频生成模型往往更擅长生成“看起来合理”的画面,不一定能准确遵循机器人动作,也难以稳定呈现机器人与物体之间的因果关系。
香港科技大学团队提出的 WorldLine,正是针对这一问题设计的动作驱动视觉模拟器。
核心方法
WorldLine的关键思路是把两个问题拆开:一方面,从大规模机器人视频中学习较为通用的操作动力学;另一方面,再学习不同机器人控制信号如何映射到这些动力学之中。这样可以避免为每一种机械臂、控制接口或 embodiment 都从头训练完整模拟器。
- 利用无动作视频学习动力学。 模型使用超过1万小时的无动作标注机器人视频,学习场景变化、机器人运动以及物体交互的视觉规律。
- 用动作轨迹完成控制对齐。 超过2000小时的动作轨迹来自十多种机器人形态,用于将具体控制信号接入共享的视觉动力学模型。
- 采用图像空间动作表示。 这一表示提供跨机器人形态的共同接口,减弱不同控制空间之间难以直接共享数据的问题。
- 强化交互敏感性。 多视角数据、失败轨迹和关系正则化被用于改善模型对机器人—物体关系的判断,而不只是追求单帧画面的逼真度。
- 通过少步蒸馏加速 rollout。 面向机器人运动进行的少步蒸馏,旨在减少因果预测所需的计算步骤,同时保留与动作相关的运动变化。
实验结果与意义
在留出测试和域外设置中,WorldLine同时考察了视觉质量与机器人运动一致性。对于失败轨迹,其机器人掩码 IoU 比最强基线高出0.1626;在 RoboTwin 和 AgiBot 上,轨迹成功预测的平均准确率达到74%,比最强基线高1个百分点。更值得注意的是,在没有使用 RoboTwin 训练数据或进行适配的情况下,基于其 rollout 的策略评估可使任务成功率相较直接执行策略最高提升21.4个百分点。
这些结果表明,WorldLine的价值不只是“生成更像真的机器人视频”,而是让视频预测承担动作评估功能:策略可以先在视觉世界中比较不同方案,再决定是否进行真实执行。其解耦式设计也为跨机器人数据复用提供了思路。不过,论文摘要主要报告了特定基准和设置下的结果,模拟预测与真实世界之间仍可能存在差距,实际部署还需要结合硬件安全机制和在线验证。
总体而言,WorldLine把机器人视频生成从被动的场景预测推进到面向动作结果的模拟,为降低实体机器人试错成本、支持策略筛选和具身规划提供了一个可扩展方向。
评论
正在确认登录状态……
正在加载评论……