返回文章列表
机器人与物理 AI

WorldLine:让机器人先在视觉世界中验证动作

阅读约 3 分钟

导语

机器人要学会抓取、推移或放置物体,通常需要大量真实交互数据:每一次动作都可能耗费时间、设备寿命和人工成本。相比之下,视觉模拟器可以在真正执行前预测某个动作会如何改变场景,从而帮助策略筛选和具身规划。但现有视频生成模型往往更擅长生成“看起来合理”的画面,不一定能准确遵循机器人动作,也难以稳定呈现机器人与物体之间的因果关系。

香港科技大学团队提出的 WorldLine,正是针对这一问题设计的动作驱动视觉模拟器。

核心方法

WorldLine的关键思路是把两个问题拆开:一方面,从大规模机器人视频中学习较为通用的操作动力学;另一方面,再学习不同机器人控制信号如何映射到这些动力学之中。这样可以避免为每一种机械臂、控制接口或 embodiment 都从头训练完整模拟器。

  • 利用无动作视频学习动力学。 模型使用超过1万小时的无动作标注机器人视频,学习场景变化、机器人运动以及物体交互的视觉规律。
  • 用动作轨迹完成控制对齐。 超过2000小时的动作轨迹来自十多种机器人形态,用于将具体控制信号接入共享的视觉动力学模型。
  • 采用图像空间动作表示。 这一表示提供跨机器人形态的共同接口,减弱不同控制空间之间难以直接共享数据的问题。
  • 强化交互敏感性。 多视角数据、失败轨迹和关系正则化被用于改善模型对机器人—物体关系的判断,而不只是追求单帧画面的逼真度。
  • 通过少步蒸馏加速 rollout。 面向机器人运动进行的少步蒸馏,旨在减少因果预测所需的计算步骤,同时保留与动作相关的运动变化。

实验结果与意义

在留出测试和域外设置中,WorldLine同时考察了视觉质量与机器人运动一致性。对于失败轨迹,其机器人掩码 IoU 比最强基线高出0.1626;在 RoboTwin 和 AgiBot 上,轨迹成功预测的平均准确率达到74%,比最强基线高1个百分点。更值得注意的是,在没有使用 RoboTwin 训练数据或进行适配的情况下,基于其 rollout 的策略评估可使任务成功率相较直接执行策略最高提升21.4个百分点。

这些结果表明,WorldLine的价值不只是“生成更像真的机器人视频”,而是让视频预测承担动作评估功能:策略可以先在视觉世界中比较不同方案,再决定是否进行真实执行。其解耦式设计也为跨机器人数据复用提供了思路。不过,论文摘要主要报告了特定基准和设置下的结果,模拟预测与真实世界之间仍可能存在差距,实际部署还需要结合硬件安全机制和在线验证。

总体而言,WorldLine把机器人视频生成从被动的场景预测推进到面向动作结果的模拟,为降低实体机器人试错成本、支持策略筛选和具身规划提供了一个可扩展方向。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
EmbodiedMemory-Bench:用长期交互检验具身智能的记忆能力
机器人与物理 AI
cctest.ai
机器人与物理 AI

EmbodiedMemory-Bench:用长期交互检验具身智能的记忆能力

EmbodiedMemory-Bench 将具身记忆从抽象能力变成可执行的长期交互评测,覆盖视觉细节、动态状态、交互结果和经验迁移四类挑战。研究同时提出结构化外部记忆系统 Embodied-Memorizer,以及能够管理和调用记忆的 EMem-8B 策略模型。

阅读全文
CCTest · Blog
让机器人像程序员一样工作:Physical Coding 如何推动具身智能自进化
机器人与物理 AI
cctest.ai
机器人与物理 AI

让机器人像程序员一样工作:Physical Coding 如何推动具身智能自进化

HexaFuture 提出 Physical Coding,把机器人所处的世界状态、执行策略和恢复流程表示为可检查、可修改的代码。实验显示,这种由工具、反馈和可复用轨迹组成的架构,有望缓解传统 VLA 模型对固定场景和动作序列的依赖。

阅读全文
CCTest · Blog
RoboFoundry:让机器人把执行经验沉淀为可进化系统
机器人与物理 AI
cctest.ai
机器人与物理 AI

RoboFoundry:让机器人把执行经验沉淀为可进化系统

RoboFoundry提出“系统即策略”的具身智能演化框架,不只优化模型或单项工具,而是让上下文、记忆、技能与执行接口共同形成可持续改进的系统。实验显示,该方法在多个具身任务与长期记忆基准上取得显著提升。

阅读全文