返回文章列表
机器人与物理 AI

让视觉语言模型先“排练”再动手:World Action Agent如何改造机器人操作

阅读约 3 分钟

导语

视觉语言模型(VLM)拥有丰富的常识和空间推理能力,但把这些能力真正转化为机器人动作,仍存在明显断层。传统方案往往让模型预测约束、生成控制程序,或仅向模型提供一张场景图;模型“看到了什么”与机器人“如何在世界中行动”之间,仍需要大量额外接口。

论文提出的 World Action Agent(WAA)试图把这个接口本身做成一个可操作的世界。它不是让VLM一次性给出完整动作,而是让模型借助多个智能体和基础工具,在视觉行动工作区内观察、规划、修改并执行。

核心机制

  • 接触视角:系统根据场景几何关系,自动选择围绕当前交互点的观察视角。机器人要抓取、推移或接触物体时,模型看到的不是固定全景,而是与当前动作更相关的局部信息。
  • 动作排练:每个动作首先以可编辑提案的形式出现。模型可以直接预览并修改动作,也可以交给 Imagination Agent,根据规划反馈想象执行结果后再调整,避免未经检查就下发控制指令。
  • 视野内纠偏:低层执行产生残余偏移后,模型能够在同一观察视角中发现问题并进行修正。这样,观察、动作提案和执行反馈形成了连续闭环,而不是彼此割裂的阶段。

WAA还把工作区作为具身知识的积累接口。一方面,系统可以从专家视频和人类示教中演化多模态技能,并在基于证据的审查下通过 Skill Agent调用;另一方面,机器人与工作区的交互轨迹可以用于训练更小的VLM,使其学习如何驾驶同一套工具。

实验结果与解读

在LIBERO-Pro上,使用仅由LIBERO-90演化出的技能时,WAA取得75.6%的平均成功率,优于论文比较的端到端视觉语言动作模型、代码即策略方法,以及使用相同骨干模型的视觉工作区基线。相关技能在robosuite中无需进一步学习仍然有效,说明技能不完全依赖单一评测环境。另一个结果是,使用工作区交互轨迹微调Qwen3.5-9B后,其域外成功率从1.7%提升至43.3%。

这些结果的意义不只是“给VLM加了几个工具”。WAA将机器人控制拆成可观察、可检查、可纠正的行动过程,把VLM擅长的语义理解与低层执行反馈连接起来。对长时程任务而言,先排练再执行也可能降低单次错误对后续步骤的连锁影响。

意义与局限

WAA展示了一条不同于端到端策略学习的路线:不要求大模型直接承担全部控制,而是设计一个稳定的行动工作区,让通用模型在其中发挥规划和判断能力,再由技能、想象与纠偏模块提供支撑。其跨环境结果也表明,程序化的交互接口或许比单纯扩大训练数据更有利于迁移。

不过,现有材料主要报告了特定基准和系统设置下的结果,尚不能据此证明WAA已经解决了真实家庭或工业环境中的鲁棒性问题。接触视角选择、规划反馈质量、技能审查成本,以及复杂任务中的安全边界,仍是后续需要验证的问题。

总体而言,WAA把“让模型控制机器人”重新表述为“让模型在一个可反复排练的世界里行动”。这为VLM进入具身智能提供了更清晰的系统接口,也为技能积累和小模型训练提供了统一载体。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
机器人也能靠“自我对弈”学踢球:Skild AI展示具身智能新路线
机器人与物理 AI
cctest.ai
机器人与物理 AI

机器人也能靠“自我对弈”学踢球:Skild AI展示具身智能新路线

Skild AI让人形机器人在虚拟足球场中与自身历史版本反复对抗,仅以进球作为最终目标,逐渐学会盘带、护球、抢断和倒地起身。这个案例展示了强化学习从数字环境走向真实机器人的一种可能路径。

阅读全文
CCTest · Blog
华为大模型团队创业押注“物理基模”:具身智能需要Scaling Law吗?
机器人与物理 AI
cctest.ai
机器人与物理 AI

华为大模型团队创业押注“物理基模”:具身智能需要Scaling Law吗?

前华为大模型负责人李寅与多模态科学家张含望共同创办息壤开物,试图用大规模预训练构建面向物理世界的基础模型。其核心问题是:机器人能否像语言模型一样,通过规模化训练获得跨本体、跨任务的通用能力?

阅读全文