HuRo:把人类视频转成机器人可用的VLA预训练数据
导语
视觉-语言-动作模型(VLA)要在真实机器人上发挥作用,通常需要大量带有相机观测、语言指令和动作轨迹的数据。但机器人采集成本高、覆盖场景有限,网络上的人类操作视频却数量庞大、任务类型丰富。问题在于,人类的视角、身体结构和运动方式与机器人并不一致,视频不能直接当作机器人示范使用。
HuRo的核心问题是:经过适当转换的人类视频,能否成为可规模化利用的VLA预训练数据?论文给出的答案是肯定的,但前提是必须同时处理“看到了什么”和“机器人该如何行动”这两层对齐。
核心方法
HuRo构建了一套机器人化流水线,把来自不同来源的人类视频转换为机器人对齐的观测和动作轨迹。其主要思路包括:
- 视觉机器人化:将人类视频中的场景和交互信息处理为更接近机器人视角与感知形式的观察信号,减少人类第一视角和机器人摄像头之间的差异。
- 动作重定向:依据人类操作过程推断适用于机器人执行的动作轨迹,而不是只把视频当作静态视觉数据。
- 补全中间信号:面对不同视频来源在标注完整度上的差异,流水线尝试推断缺失的中间信息,使数据能够覆盖不同层级的监督。
基于这套流程,研究者从五类人类视频来源构建HuRo数据集,包含约63万条机器人化片段和1.42亿帧处理后的图像数据。这样的规模为考察机器人化数据是否能够支持VLA预训练提供了基础。
实验结果
论文在四项真实世界机器人操作任务上进行评估。随着机器人化预训练数据量增加,整体任务完成率从51.5%提升至80.3%;在空间位置和视觉外观发生变化的分布外场景中,完成率则从34.9%提升至72.2%。这说明HuRo的价值不只是提升熟悉场景下的拟合能力,也体现在对环境变化的适应上。
消融实验进一步指出,视觉机器人化对分布外鲁棒性尤其重要。不过,单纯迁移经过处理的视觉内容并不够。采用重定向动作进行端到端预训练,效果优于仅进行视觉迁移,说明动作监督仍是连接人类示范与机器人执行的关键环节。
意义与局限
HuRo提供了一条不同于大规模真实机器人采集的扩展路径:先利用丰富的人类视频学习任务结构、物体交互和操作变化,再通过机器人化处理缩小具身差距。对于VLA而言,这种方法有望降低数据获取成本,并扩大训练数据的任务和视觉覆盖范围。
不过,机器人化结果本质上仍依赖从视频中推断信息,数据质量、动作可执行性以及不同机器人形态之间的适配,都会影响最终收益。因而,HuRo更像是对真实机器人数据的补充,而不是完全替代。其重要贡献在于证明:只要观测与动作被共同对齐,人类视频可以从“旁观素材”转变为具有训练价值的机器人经验。
评论
正在确认登录状态……
正在加载评论……