Grounded Action Model:让机器人先理解物体位置,再决定如何行动
导语
机器人要完成“拿起红色杯子”或“把目标物放到指定位置”这类任务,关键并不只是理解语言,还必须知道目标究竟是哪一个、位于空间中的什么位置,以及机械臂应当如何接近它。当前不少机器人基础模型建立在视觉语言模型或视频生成模型之上,空间度量信息往往不是预训练目标的一部分,最终只能依靠机器人示范数据隐式学会。新论文提出的 Grounded Action Model(GAM),试图把3D grounding从“隐含能力”变成动作模型的核心输入。
核心方法:围绕目标建立共享表示
GAM支持三种提示方式:自然语言、点提示和框提示。无论输入形式如何,系统都会先将提示转换为统一的对象中心表示,用于指明需要操作的物体。这一表示同时保留两类信息:一类是聚焦于目标的视觉特征,帮助模型辨认物体及其外观;另一类是度量几何信息,描述目标在三维空间中的位置和形状关系。
随后,目标表示会与机器人状态历史一起输入多流Transformer。模型不是只根据当前图像输出单个动作,而是预测连续的动作片段,从而更适合抓取、移动和放置等需要连贯控制的操作。GAM也可以脱离高层规划器自主运行,或作为低层控制器接受规划器的语言、点和框等不同形式的指令。这种组合为长时程、依赖记忆的任务提供了更灵活的控制接口。
实验表现:对变化中的目标更稳健
在RoboTwin 2.0的50项任务上,GAM平均成功率为55.3%,高于Spatial Forcing的52.0%。在场景随机化设置下,GAM达到47.6%,而Abot-M0为30.4%;值得注意的是,GAM的动作策略只使用干净场景示范进行训练。LIBERO-PRO的结果同样显示出目标级空间表示的价值:在16种扰动设置下,GAM平均成功率为61%,超过π₀.₅的53%,优势在目标位置改变或任务临时指定新目标时尤其明显。
真实机器人测试进一步考察了视觉分布变化。在双臂YAM上,GAM保留了20次测试中的17次成功,而π₀.₅为4次。在Franka平台上,GAM与Molmo2规划器组合后,在长时程和记忆依赖任务中取得64.7%的同分布步骤完成率,以及49.8%的分布外步骤完成率。
意义与限制
GAM的重点不只是提高一个基准分数,而是重新划分了高层规划与低层执行的职责:规划器负责决定“要操作什么”,GAM则利用显式的3D目标信息解决“目标在哪里、如何接近”。这使机器人更容易适应目标移动、场景变化和提示方式切换,也为多模态规划器连接实际控制系统提供了清晰接口。
不过,现有结果主要来自论文所报告的特定仿真任务和有限真实机器人测试,尚不足以证明模型已解决开放环境中的复杂操作。未来仍需验证其对遮挡、物体类别扩展、精细接触以及更大规模任务组合的适应能力。无论如何,GAM说明:对于具身智能而言,显式、可度量的空间 grounding 可能应当与语言和视觉表征处于同等基础地位。
评论
正在确认登录状态……
正在加载评论……