返回文章列表
机器人与物理 AI

让机器人少看“捷径”:LIT如何提升视觉动作模型的泛化能力

阅读约 3 分钟

机器人基础模型正在从“看懂场景”走向“直接行动”,但一个容易被忽视的问题是:模型在训练环境中学到的,未必是真正有用的视觉理解。

如果训练数据里某种背景、相机角度或物体外观总是与特定动作同时出现,模型就可能把这些因素当作行动依据。这类视觉—动作捷径在分布内测试中不一定暴露问题,一旦更换摄像头、改变光照,或加入场景干扰物,原本有效的关联就可能失效。

新加坡国立大学 MAGIC Lab 等研究者提出的 Latent Interface Training(LIT),试图从动作生成的接口入手解决这一问题。它不是简单地增加数据增强,而是将训练拆成两个阶段。

第一阶段:先学习不依赖图像的动作先验。

研究者向动作专家提供语言指令、机器人状态,以及每个动作片段结束时末端执行器的三维位置和姿态,即 SE(3) 位姿。模型先学习如何朝向一个明确的空间目标生成动作片段。由于这一阶段不使用图像,动作专家建立的是相对清晰的“目标—动作”关系,而不是从背景或外观中寻找相关性。

第二阶段:用潜在接口限制视觉通路。

随后引入一个潜在接口,负责汇聚视觉和语义表征,并成为预训练动作专家接收视觉条件的唯一通道。这个接口还要重建第一阶段使用的终点位姿。这样的监督信号鼓励接口保留与空间目标相关的信息,同时减少把任务无关视觉细节直接传递给动作生成器的机会。

LIT的价值在于,它没有要求所有视觉信息都必须被舍弃。机器人仍然需要视觉来定位目标、理解空间关系和处理环境变化;关键是让视觉信息以更受约束、更接近任务目标的形式进入动作模块。换言之,方法关注的不是“看得更多”,而是“哪些视觉内容有资格影响行动”。

论文在 Pi0.5、MolmoAct2、FAST-WAM 和 ImageWAM 四种视觉—语言—动作或世界—动作架构上进行验证。根据论文摘要,LIT在 LIBERO-Plus 上带来 3.87 至 10.70 个百分点的整体成功率提升,同时保持或改善 LIBERO 平均表现。在真实机器人测试中,面对未见过的相机配置、光照变化和干扰物,三个任务的汇总成功率提升了 13.30 至 16.70 个百分点。

这项工作对机器人基础模型的启发是,泛化能力不仅取决于更大的视觉编码器或更多训练数据,也取决于视觉表征与动作专家之间如何连接。通过显式注入空间目标监督,LIT为缓解视觉—动作捷径提供了一种与具体模型架构相对无关的训练思路。不过,摘要未披露不同任务、模型和扰动条件下的完整拆分结果,因此其适用边界仍需结合论文全文和更多真实场景测试判断。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章