RoboFollow:高成功率,可能掩盖了具身智能的“听指令”短板
导语
在机器人论文中,“任务成功率”往往是最醒目的指标。但一个机器人完成了动作,并不代表它真正理解了人类指令:如果画面里只有一个物体、一个可行目标和一种操作方式,模型即使忽略语言,也可能得到不错的结果。RoboFollow 将这种现象称为指令遵循幻觉,并把它归因于训练与评测环境中的“低场景熵”。
核心问题:视觉线索太容易
所谓低场景熵,是指一个视觉场景几乎只对应一个有效任务。此时,语言信息没有真正参与决策,策略只需识别场景并执行默认动作。这样的设置可以测出动作能力,却难以回答一个关键问题:当指令改变时,机器人是否也会改变行为?
RoboFollow 的思路是让同一场景支持多个运动学上不同的任务分支。例如,机器人可能需要根据语言选择不同物体、判断空间关系、遵循特定轨迹约束,或执行不同的逻辑分支。这样一来,视觉本身不足以确定答案,模型必须把语言与场景状态对应起来。
基准如何诊断
- 高场景熵设计:多个任务共享相同或相近的场景配置,减少“看图猜答案”的可能。
- L0-L3 分层协议:测试逐步扰动视觉布局与语义,覆盖空间关系、属性、轨迹约束和逻辑条件,考察等价指令能否产生一致行为、不同指令能否被区分。
- Intent 与 Execution 分离:先判断模型是否选择了正确任务意图,再检查机器人是否完成物理执行,从而区分理解错误与控制失败。
- 受控交互设置:简化交互对象,并将动作限制在训练过的能力范围内,尽量降低无关的操作难度。
该基准基于 RoboTwin 构建,包含四类场景、专家示范数据以及配套代码和数据集。研究团队评估了九种 VLA 与 WAM 策略。结果显示,在能够取得较好 L0 表现的情况下,模型并不一定能把这种能力迁移到 L1-L3。更换更强的视觉语言模型、加入问答联合训练、使用 LangForce 或 Classifier-Free Guidance,也没有消除这一差距。
意义与影响
RoboFollow 的价值不只是提出一个新榜单,而是重新定义了“指令遵循”应当如何被测量。对具身智能而言,执行正确动作只是终点;在动作之前,系统还必须从多个可能任务中选出与语言匹配的那一个。若评测没有制造这种选择压力,模型的高分可能主要反映视觉识别和动作模仿能力。
这也给后续研究提出了更明确的方向:训练数据需要包含同场景、多任务和反事实指令;评测报告应同时呈现意图选择与物理执行结果;模型设计则需要强化语言、视觉状态和动作规划之间的绑定。RoboFollow 不能直接证明所有现有系统都缺乏指令理解,但它提供了一种更难被“默认策略”蒙混过关的诊断方式。
评论
正在确认登录状态……
正在加载评论……