返回文章列表
世界模型

ProWAM:用渐进式视觉子目标提升机器人长程控制

阅读约 3 分钟

机器人要完成“拿起物体并放到指定位置”这类任务,难点不只是决定下一步动作,还要判断一连串中间状态是否合理。世界动作模型(World Action Models,WAMs)试图同时预测未来视觉变化和动作,为控制策略提供对环境演化的预判。但当任务时间跨度变长时,逐帧生成完整视频会带来很高的计算开销,也容易让预测误差不断累积。

从完整视频转向视觉子目标

论文提出的 ProWAM(Progressive World Action Model)没有把未来想象成一段密集视频,而是预测一组按执行顺序排列的稀疏视觉子目标。它们可以被理解为任务过程中的“路标”:模型先规划若干关键视觉状态,再据此生成当前阶段的动作。

这一设计解决了单一未来帧方案的一个缺陷。只预测最终结果虽然节省计算,却没有明确说明机器人应如何逐步接近目标;而有序子目标为动作策略提供了更连续的视觉引导,使长程执行不再只依赖当前观测与最终指令之间的直接映射。

关键技术思路

  • 联合预测动作与子目标:模型同时考虑“要做什么”和“下一阶段应看到什么”,让视觉规划与动作生成相互约束。
  • 稀疏而非密集的未来表示:只保留对任务推进有帮助的关键视觉状态,避免完整视频 rollout 的高成本。
  • 缓存子目标特征:视频骨干网络只需进行一次前向计算,随后缓存稀疏子目标的特征;重新规划时主要进行轻量级动作去噪。
  • 利用无动作视频学习规划:子目标预测可以从大规模、没有动作标注的视频中学习,从而把复杂的视觉规划部分交给视频骨干网络,减轻动作策略的负担。

实验结果与意义

论文在多个仿真环境中评估了 ProWAM 的鲁棒性。报告结果显示,LIBERO-Plus 成功率为 85.8%,随机化 RoboTwin 为 75.7%;在 RoboCasa365 上,整体成功率为 48.1%,Composite-Unseen 划分为 18.2%。论文还指出,相比最强基线,ProWAM 的相对提升最高达到 35.9%。这些结果表明,稀疏视觉规划不仅能降低想象未来的成本,也可能帮助策略应对训练分布之外的物体、布局或任务组合。

需要注意的是,现有材料主要给出了方法概览与基准结果,尚未提供更完整的消融实验、硬件平台信息或真实机器人部署细节。因此,ProWAM 对实际机器人控制的计算延迟、感知误差和安全性影响,仍需要结合论文全文与后续实验判断。

从研究方向看,ProWAM 展示了一条清晰路线:世界模型不必持续生成细粒度视频,也可以通过少量、结构化的视觉状态为动作策略提供“进度感”。如果这一思路能够在真实环境中保持稳定,机器人控制模型或许可以在规划质量、推理效率与长程泛化之间取得更好的平衡。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章