返回文章列表
机器人与物理 AI

Long-WAM:让机器人真正用上更长的视觉记忆

阅读约 3 分钟

导语

机器人要完成叠放、抓取和移动等任务,往往不能只看当前一帧。物体此前如何运动、任务已经进行到哪一步、某个动作是否造成了遮挡,都需要通过连续视觉历史来判断。但历史越长,编码和推理成本越高,控制延迟也越容易让机器人错过关键时机。NVIDIA 团队提出的 Long-WAM,试图同时解决“看得更久”和“动得够快”这两个问题。

核心方法:让历史成为可用的预测能力

Long-WAM 是一个面向因果世界-动作模型的模型与系统框架。它首先利用机器人视频和第一视角视频,在没有动作标签的情况下进行自回归视频预测,让模型学习从过去推断未来的结构。随后,研究者在世界-动作模型适配阶段保留这种“历史到未来”的关系,而不是只把更长的视频片段当作额外输入。

这一区分非常关键。论文的主要发现是,拥有更长历史并不等于模型会有效使用历史。基于自回归视频预训练的模型,随着上下文从 0 秒扩展到 19.2 秒,RoboCasa GR-1 上的成功率从 63.3% 提升至 78.7%;相比之下,采用双向视频预训练初始化时,增加历史并没有带来净收益。进一步的机器人领域自回归预训练,还提升了 GR-1 和 LIBERO-Long 上的最佳表现。

实时部署:模型与系统共同提速

长上下文通常意味着更高的计算负担。为避免历史编码拖慢控制循环,Long-WAM 采用流式观测编码和异步执行,并针对不同硬件进行加速。在 RTX 5090 上,一个动作块连同未来视频的潜变量预测,耗时 107.4 毫秒;系统还实现了在 DGX Spark 和 Jetson AGX Thor 上的部署,而不会舍弃未来预测模块。

在评测方面,Long-WAM 在 LIBERO-Long、RoboTwin 2.0 和 DOMINO 的对比方法中取得最佳结果。真实机器人实验覆盖 Unitree G1 和 YAM,可处理动态及长时程操作。动态叠杯任务中,Long-WAM 达到 95% 成功率,而 Pi0.5 与 Fast-WAM 在 20 次试验中均未成功。

意义与边界

Long-WAM 的价值在于把“上下文扩展”从单纯的输入工程,转变为预训练目标、动作适配和推理系统的协同设计。它说明,机器人需要的不是更长但未经组织的记忆,而是能够帮助模型预测未来、判断进度并修正动作的因果记忆。作为一种记忆增强执行器,Long-WAM 也可以配合更高层规划器处理复合任务。

不过,现有结果主要来自论文列出的基准和特定硬件、机器人平台,不能直接等同于对所有开放环境的泛化能力。未来仍需观察长上下文在更多场景、任务和传感器配置下的稳定性,以及持续预测带来的算力和数据成本。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
RobotWorld:让多模态智能体接受真实机器人能力的系统考验
机器人与物理 AI
cctest.ai
机器人与物理 AI

RobotWorld:让多模态智能体接受真实机器人能力的系统考验

RobotWorld 提供了一个覆盖多种机器人形态与任务类型的仿真测试平台,用来评估多模态智能体能否把语言、视觉和代码能力转化为稳定的物理操作。研究显示,智能体已经能够搭建复杂的感知与控制流程,但距离可靠完成任务仍有明显差距。

阅读全文
CCTest · Blog
机器人没按指令行动,VLA如何在部署现场学会自我补偿?
机器人与物理 AI
cctest.ai
机器人与物理 AI

机器人没按指令行动,VLA如何在部署现场学会自我补偿?

机器人真实执行动作时,常会受到摩擦、回差、负载变化和机械磨损影响,导致动作偏离视觉语言动作模型的指令。来自浦项科技大学的研究提出一种无需任务标签或奖励的在线自补偿方法,并用 RoboStress 系统测试 VLA 的抗执行误差能力。

阅读全文