返回文章列表
世界模型

ZimaBlue:用大规模视频预训练推动机器人世界动作模型泛化

阅读约 3 分钟

导语

机器人操作要走向更广泛的真实环境,关键瓶颈不只是模型规模,还在于能否获得足够丰富的物理世界经验。传统做法依赖带动作标签的机器人轨迹,但这类数据采集成本高、设备依赖强,也很难覆盖不同物体、工具、环境与长时序任务。ZimaBlue的核心思路是把规模更大的第一视角视频引入机器人学习,让视频成为获取具身经验的重要入口。

核心方法

ZimaBlue将World Action Model(WAM)视为连接视觉世界建模与机器人控制的中间层,并设计了三阶段训练流程:

  • 具身视频预训练:首先利用大规模人类和机器人第一视角视频,进行因果性的具身视频训练。模型从画面变化中学习物体交互、接触动力学、工具使用以及长时间行为的视觉规律。由于这一步不要求每段视频都配有机器人动作标签,因此数据来源可以更广。
  • 视频—动作中期训练:随后引入不同类型机器人的轨迹,通过统一动作表示,把视频中学到的视觉动态与可执行动作联系起来。该阶段的作用不是简单模仿某一台机器人的控制信号,而是建立跨机器人、跨形态的动作 grounding。
  • 目标机器人适配:最后针对部署平台进行专门化训练,使通用的世界模型能够转换为目标机器人的控制策略。

研究还提出Slow-Fast双系统架构。高容量的Slow分支负责提供更具泛化能力的时空表征,轻量级Fast分支则承担快速动作预测。按照论文摘要,在NVIDIA RTX 4090上,Fast分支可实现30 Hz动作预测,从而缓解生成式世界模型通常难以满足实时控制的问题。

结果与解读

论文给出的零样本真实机器人评测显示,当训练数据从目标机器人自身数据扩展到超过120,000小时的具身视频后,成功率从36.1%提升至77.8%。这一结果支持了一个重要判断:视频预训练并非只能改善视觉识别,也可能通过学习交互过程和环境变化,为机器人控制提供可迁移的先验。

但这一方向仍有边界。视频本身通常缺少精确动作、力反馈和机器人本体信息,如何把观察到的行为稳定地映射为另一种机器人的安全控制,仍依赖中期动作训练和目标平台适配。摘要也没有披露完整任务构成、数据来源细节或不同模块的消融结果,因此不能仅凭成功率断言视频规模与泛化能力之间存在普遍的线性关系。

意义与影响

ZimaBlue的价值在于重新定义机器人数据扩展路径:机器人专属轨迹负责动作落地,海量视频则负责补充广泛的物理经验。若这种分工能够在更多平台和任务上复现,机器人模型训练可能从“持续采集昂贵轨迹”转向“视频规模预训练加少量平台适配”。同时,Slow-Fast架构也说明,通用世界建模与实时控制不一定要由同一个计算分支独立完成,而可以通过异步协作兼顾能力与延迟。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章