让机器人“按自己的坐标系看世界”:Robot-Centric Pointmaps 改进 VLA 泛化
导语
视觉-语言-动作模型(VLA)正在成为通用机器人策略的重要方向:模型接收图像和语言指令,然后输出机器人的动作。但这类系统中存在一个容易被忽视的坐标问题——机器人“看见”的通常是相机坐标系下的画面,而它真正执行的动作却定义在机器人自身的三维坐标系中。
KAIST AI 的论文 See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models 正是围绕这一错位展开。作者提出的 robot-centric pointmaps,并不是让 VLA 完全改造成复杂的 3D 网络,而是把机器人坐标系下的三维几何信息,以类似图像的密集网格形式输入模型。
核心要点
-
问题来自“观察坐标”与“动作坐标”的不一致
在固定相机视角下,模型可以通过数据记住某种从画面到动作的映射。但当大规模机器人数据集混合了不同相机位置、角度和安装方式时,同一个动作目标在图像中可能呈现出完全不同的位置关系,策略学习难度随之上升。 -
Pointmap 让像素携带机器人坐标系下的 3D 信息
传统 RGB 图像记录的是颜色;robot-centric pointmap 的每个像素则存储场景点在机器人坐标系中的三维坐标。这样一来,模型看到的不只是“相机里物体在哪里”,还包含“物体相对机器人在哪里”。 -
保留二维网格,降低接入成本
该方法的一个关键设计是继续使用 H×W 的密集图像网格。这意味着它可以较自然地适配已有基于 2D 视觉编码器的 VLA,而不是要求从头构建完全不同的 3D 架构。素材中提到,实现上只需增加一个额外编码器,并通过元素级加法融合。 -
实验显示对不同视角更稳健
在 RoboCasa 上,pointmaps 改进了 pi0.5 和 SmolVLA,并优于若干相机视角相关和 3D 感知基线。真实机器人实验中,当相机被移动到训练时未见过的位置时,它相对 RGB-only 策略的优势进一步扩大。
意义与影响
这项工作的价值不在于提出一个更大的机器人基础模型,而在于指出:VLA 的泛化瓶颈有时来自输入表示本身。对于人类来说,换个角度看桌面仍然能理解杯子相对手的位置;但对机器人策略而言,相机图像与执行坐标之间的转换可能需要在数据中被反复学习。
Robot-centric pointmaps 相当于把一部分几何对齐工作提前完成,让模型直接接触与执行更相关的空间表示。对于未来整合多来源机器人演示数据、跨实验室数据集或灵活部署相机的场景,这种表示方式可能比单纯扩大数据规模更高效。
当然,该方法仍依赖可获得的深度或三维几何信息,以及相机与机器人之间的标定关系。它更像是对现有 VLA 的工程友好型增强,而不是替代视觉、语言和动作联合建模本身。但在机器人走向更开放部署环境的过程中,“让模型按机器人自己的坐标系看世界”可能会成为一个重要的设计原则。
评论
正在确认登录状态……
正在加载评论……