Zero-WAM:让机器人通过观看人类视频泛化到未见任务
导语
机器人要真正进入开放环境,关键不只是把训练过的动作做得更稳定,而是面对新任务时能够快速理解“接下来要做什么”。语言可以作为大模型的任务说明,但对机械臂而言,一段人类操作视频往往包含更丰富的信息:物体关系、动作顺序、接触方式,以及任务如何逐步推进。Zero-WAM 试图把这种视频示范转化为机器人可直接利用的上下文。
核心方法
Zero-WAM 是一种因果视频—动作模型。执行任务时,模型接收人类视频作为上下文提示,并据此预测机器人后续动作;它的目标不是让机器人复现某个固定轨迹,而是从视频中提取任务演化信息,迁移到训练阶段没有见过的任务上。与需要微调参数的传统适配方式相比,这种设定更接近大语言模型的上下文学习:任务信息放在输入中,而不是写入模型参数。
研究中的一个现实难点是,公开数据里同时包含“人类如何完成任务”和“机器人如何执行对应任务”的配对样本并不充足。为此,团队提出自动化数据生成流程,将任务采样得到的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集。该数据集包含 7.42 万组人类—机器人上下文学习配对,覆盖 8600 个任务,为视频提示训练提供了更大的任务范围。
训练方面,作者引入 in-context future chunk prediction(IFP)目标。其作用是抑制模型从训练任务中记忆表面规律,迫使策略更多依赖上下文视频来预测未来动作片段。换言之,模型不仅要学会“如何动”,还要学会判断“这段视频说明了什么任务”。
实验结果与意义
在 RoboTwin 2.0 仿真环境的七项未见任务上,Zero-WAM 平均成功率为 47.0%,相较最强视频—动作基线绝对提升 29.5 个百分点。论文还报告了真实世界评估,表明系统可以依据人类视频指导尝试未见任务;不过,现有素材未提供该部分的具体任务数量和成功率,因此不能据此做更细的性能比较。
这项工作的价值在于重新定义了机器人任务泛化的“接口”:任务不一定要通过语言描述,也可以由一段具备时序和视觉细节的视频指定。HumanGen 与 IFP 分别回应了数据规模和训练捷径两个瓶颈,说明上下文机器人学习不仅是模型结构问题,也取决于如何构造任务配对与评估协议。
当然,视频中的人类动作与机器人自身的视角、形态和控制能力并不完全一致。Zero-WAM 是否能在更复杂的场景、更多样的物体和更长的任务链中稳定工作,还需要更充分的真实世界结果来验证。至少从当前实验看,观看示范而非重新训练,正在成为机器人跨任务泛化的一条值得关注的路线。
评论
正在确认登录状态……
正在加载评论……