返回文章列表
机器人与物理 AI

UniWAM:把物理推理、世界建模与机器人动作统一起来

阅读约 3 分钟

导语

机器人要在真实世界中完成任务,不能只知道“看到了什么”,还要理解“接下来会发生什么”以及“应该如何行动”。现有视觉语言动作模型通常继承了大规模视觉语言模型的语义理解和推理能力,但如果训练主要依赖动作标签,模型对物理动态的掌握可能不够充分。另一方面,世界动作模型能够从视频生成或预测中学习时空规律,却可能在语义理解和分布外场景推理方面存在短板。

论文《UniWAM: Unified World-Action Model》提出了 UniWAM,尝试在一个统一架构中连接这两类能力。

核心设计

  • 三个功能模块协同工作:UniWAM 将物理推理器、世界生成器和动作预测器放在同一训练框架内,分别对应对环境的语义与物理理解、未来视觉状态建模,以及机器人动作生成。
  • 混合多源数据训练:研究使用超过 10,000 小时的人类第一视角数据和机器人数据,并结合视觉问答数据。人类视频能够提供更丰富的日常交互与动作线索,机器人演示则直接关联观测、控制与任务执行。
  • 用自然语言表达低层动作:为使视觉语言组件更自然地适应具身任务,研究者将低层动作表示为自然语言,同时尽量保留预训练模型原有的语言能力。
  • 按模块分配互补监督:预训练阶段并非让所有数据以同一种方式约束整个模型,而是根据 VQA、人类第一视角数据和机器人示范的特点,将监督信号分配给相应组件。
  • 面向推理效率的后训练策略:未来视觉噪声增强降低了模型对精确未来预测的依赖;历史条件流匹配则利用已经编码的动作历史初始化动作生成,从而在保持性能的同时减少去噪步骤。

意义与影响

UniWAM 的价值不只是把多个模块拼接起来,更在于它试图建立一条从“理解世界”到“预测世界”再到“采取行动”的统一路径。对具身智能而言,世界模型如果脱离动作,可能只能生成看似合理的未来;动作模型如果缺乏物理表征,则可能难以应对物体关系、接触变化或环境分布变化。将两者与视觉语言推理结合,有望让机器人在任务执行前进行更具语义的判断,并在不熟悉的场景中获得更稳健的迁移能力。

论文还强调了人类数据与机器人数据协同训练的作用,并称其对人—机器人联合训练的规模规律进行了刻画。不过,现有材料未提供具体规律形式、完整实验表格或各项基准的详细数值,因此“达到多项 SOTA”应理解为论文摘要中的总体结论,而不宜据此判断其在所有任务和硬件平台上都占优。总体来看,UniWAM 展示了具身模型从单一动作预测走向统一世界理解、视觉生成与控制的一种路线。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
RobotWorld:让多模态智能体接受真实机器人能力的系统考验
机器人与物理 AI
cctest.ai
机器人与物理 AI

RobotWorld:让多模态智能体接受真实机器人能力的系统考验

RobotWorld 提供了一个覆盖多种机器人形态与任务类型的仿真测试平台,用来评估多模态智能体能否把语言、视觉和代码能力转化为稳定的物理操作。研究显示,智能体已经能够搭建复杂的感知与控制流程,但距离可靠完成任务仍有明显差距。

阅读全文