Spatial-Interactor:让视觉语言模型在交互中学会空间推理
导语
对一个视觉语言模型来说,看见桌上的物体只是空间理解的起点。真正要让模型在物理世界中行动,它还需要判断:物体被移动后发生了什么,视角变化是否改变了可见关系,连续几步操作之后场景状态又变成了什么。Spatial-Interactor 关注的正是这一类动态空间推理问题。
从静态问答转向状态转移
现有空间训练往往围绕静态图像展开,例如识别物体属性,或回答两个物体之间的左右、前后和远近关系。这类任务有助于建立空间概念,但对“动作导致了什么变化”的直接监督相对有限。
Spatial-Interactor 的核心思路是利用交互轨迹中的天然结构:前一时刻的观察、执行的动作,以及动作后的新观察,共同构成一个局部状态转移样本。将多个转移连接起来,模型还可以学习长期轨迹中前后状态的依赖,而不是每次都孤立地分析单张图像。
三层课程式训练
研究团队提出了由浅入深的三级学习框架:
- L1:被动世界状态转移。 模型学习物体运动、场景变化和视角变化带来的外部世界状态更新。
- L2:主动自状态转移。 模型进一步建模自身动作或视角改变后,观察状态如何发生变化。
- L3:长时交互轨迹。 模型需要整合连续的局部转移,在较长操作序列中维护相对一致的空间状态。
为匹配这三级目标,作者构建了 LSI-108K 数据集,数据来自模拟环境和真实交互轨迹,任务也分别对应局部转移理解与长程轨迹整合。
训练方法的关键变化
在前两个层级,Spatial-Interactor 使用监督微调,让模型先掌握较明确的局部状态转移模式。随后,在长轨迹学习阶段引入在线策略蒸馏:教师分支可以获得分段级的转移描述,再对学生模型基于自身策略生成的思维链进行监督。这样做的目的不是单纯增加解释文本,而是帮助模型把连续的局部变化组织成一条可持续更新的空间推理过程。
意义与局限
这项工作的价值在于,它把具身空间推理拆解为可学习的状态更新问题,并将“观察—动作—再观察”的交互闭环纳入训练目标。根据论文介绍,在多个视觉语言模型和空间基准上的实验显示,该方法在局部转移建模与长程整合方面带来一致性改进。
不过,材料并未提供完整的基准分数、模型规模或真实机器人部署结果,因此目前更适合将其理解为一种面向动态空间推理的训练框架,而不是已经解决通用物理世界建模的方案。其后续价值,仍取决于模型能否应对更复杂、更开放且更少受控的现实交互。
评论
正在确认登录状态……
正在加载评论……