Long-WAM:让机器人真正用上更长的视觉记忆
导语
机器人要完成叠放、抓取和移动等任务,往往不能只看当前一帧。物体此前如何运动、任务已经进行到哪一步、某个动作是否造成了遮挡,都需要通过连续视觉历史来判断。但历史越长,编码和推理成本越高,控制延迟也越容易让机器人错过关键时机。NVIDIA 团队提出的 Long-WAM,试图同时解决“看得更久”和“动得够快”这两个问题。
核心方法:让历史成为可用的预测能力
Long-WAM 是一个面向因果世界-动作模型的模型与系统框架。它首先利用机器人视频和第一视角视频,在没有动作标签的情况下进行自回归视频预测,让模型学习从过去推断未来的结构。随后,研究者在世界-动作模型适配阶段保留这种“历史到未来”的关系,而不是只把更长的视频片段当作额外输入。
这一区分非常关键。论文的主要发现是,拥有更长历史并不等于模型会有效使用历史。基于自回归视频预训练的模型,随着上下文从 0 秒扩展到 19.2 秒,RoboCasa GR-1 上的成功率从 63.3% 提升至 78.7%;相比之下,采用双向视频预训练初始化时,增加历史并没有带来净收益。进一步的机器人领域自回归预训练,还提升了 GR-1 和 LIBERO-Long 上的最佳表现。
实时部署:模型与系统共同提速
长上下文通常意味着更高的计算负担。为避免历史编码拖慢控制循环,Long-WAM 采用流式观测编码和异步执行,并针对不同硬件进行加速。在 RTX 5090 上,一个动作块连同未来视频的潜变量预测,耗时 107.4 毫秒;系统还实现了在 DGX Spark 和 Jetson AGX Thor 上的部署,而不会舍弃未来预测模块。
在评测方面,Long-WAM 在 LIBERO-Long、RoboTwin 2.0 和 DOMINO 的对比方法中取得最佳结果。真实机器人实验覆盖 Unitree G1 和 YAM,可处理动态及长时程操作。动态叠杯任务中,Long-WAM 达到 95% 成功率,而 Pi0.5 与 Fast-WAM 在 20 次试验中均未成功。
意义与边界
Long-WAM 的价值在于把“上下文扩展”从单纯的输入工程,转变为预训练目标、动作适配和推理系统的协同设计。它说明,机器人需要的不是更长但未经组织的记忆,而是能够帮助模型预测未来、判断进度并修正动作的因果记忆。作为一种记忆增强执行器,Long-WAM 也可以配合更高层规划器处理复合任务。
不过,现有结果主要来自论文列出的基准和特定硬件、机器人平台,不能直接等同于对所有开放环境的泛化能力。未来仍需观察长上下文在更多场景、任务和传感器配置下的稳定性,以及持续预测带来的算力和数据成本。
评论
正在确认登录状态……
正在加载评论……