返回文章列表
机器人与物理 AI

VABench:让多模态模型在真实空间中看、想、做与纠错

阅读约 3 分钟

导语

机器人要在现实环境中完成任务,不能只回答“物体在哪里”。当目标被遮挡、视角不足或场景布局发生变化时,系统还需要判断缺少什么信息,主动移动相机获取证据,将不同视角下的观察统一到同一个空间坐标系,并把推理结果转化为可执行的精确动作。VABench 正是围绕这条“观察—推理—行动—修正”闭环设计的评测基准。

VABench 测什么

VABench 让通用多模态大模型从 RGB 视觉示范中理解任务流程,随后自主选择相机视角,输出以米为单位的笛卡尔目标位置,再根据执行反馈调整后续动作。模型无法访问物体真实位姿、专家轨迹或专门训练的动作头;动作由固定的、与模型无关的控制器执行,控制器只负责到达模型指定的目标。

基准包含 14 类基础任务,其中 11 类为单臂操作、3 类为双臂操作;同时设置了 7 种留出的几何或布局变体,以及由 5 个物体组成的长时程任务。研究团队在每个基础任务上使用相同的 20 个经过物理验证的种子,针对 12 种主要模型条件进行 3 次独立运行,并同时报告最终成功率、9 项轨迹级行为指标和子任务进展。

关键结果

  • 模型的局部视觉能力并不等于完整的具身能力。标注运行中,最佳模型的目标定位得分达到 100.0%,空间关系得分为 78.9%,但其三次运行的宏平均任务成功率只有 53.93%±3.17%。
  • 主动感知的价值十分明显。在一次匹配比较中,允许模型主动控制相机后,任务成功率从 27.86% 提升至 57.50%,说明“先获取正确证据”可能比被动接收更多视图更重要。
  • 几何迁移仍是薄弱环节。在留出的几何布局上,任务成功率可能下降超过 30 个百分点,反映出模型对训练中见过的空间模式依赖较强。
  • 长时程组合任务更具挑战性。尽管模型能够取得相当程度的子任务进展,但没有模型完成严格定义的完整长时程回合。

意义与影响

VABench 的价值在于,它把空间智能从静态问答中分离出来,转而考察证据获取、坐标统一、度量级控制和失败后的修正。这样的设计更接近机器人实际工作中的困难:正确识别一个物体,并不意味着能够在变化的场景中稳定地抓取、放置或组合多个物体。

评测结果也提示,提升具身模型不能只依靠更强的图像描述或更大的语言模型。未来系统需要更可靠的主动视觉策略、更稳健的三维空间表示,以及能够利用执行反馈持续修正计划的控制机制。对于研究者而言,VABench 还提供了比单一终局成功率更细的诊断视角,有助于区分问题究竟出在看不见、想不对,还是动作控制不够精确。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
GPT-Policy:让机器人在部署现场从上下文中学习
机器人与物理 AI
cctest.ai
机器人与物理 AI

GPT-Policy:让机器人在部署现场从上下文中学习

GPT-Policy 将视觉语言模型、上下文编译器与受约束控制器结合,让机器人能够参考示范和交互反馈,在不更新梯度或任务参数的情况下适应新任务。研究显示,人类视频示范可以提升任务完成度,而带有动作对齐信息的参考对接触敏感任务更有帮助。

阅读全文
CCTest · Blog
小型AI模型如何让无人机在断网战场上自主识别目标
机器人与物理 AI
cctest.ai
机器人与物理 AI

小型AI模型如何让无人机在断网战场上自主识别目标

北约支持的Scaleout Systems正在把轻量级视觉模型部署到无人机、前线平板和指挥节点,使系统即使在通信受干扰时也能执行目标识别与任务更新。其参与的ALMA项目已展示无人机自主发现、定位并攻击指定目标的能力。

阅读全文