StreamPI:让单帧视觉语言动作模型具备持续时序理解
导语
视觉语言动作(VLA)模型正在成为机器人理解指令、观察环境并执行操作的重要技术路线。不过,部分先进VLA模型仍主要依据单张图像做决策。这种方式推理链路简单、部署成本较低,却也容易丢失此前发生过的状态:物体刚才位于哪里、机器人是否已经完成某个动作,以及场景变化是由自身操作还是外部因素造成的。对于需要记忆和精确定位的操控任务,单帧输入因此存在明显限制。
论文提出的StreamPI,目标并不是重新训练一个更大的时序模型,而是把流式历史信息接入现有的单帧VLA框架,同时不引入额外参数。其重点在于如何组织视觉、语言与时间之间的关系。
核心要点
- 以语言指令为持续锚点。 StreamPI把每个“视觉观察+语言指令”组合成一个基本时序单元。单元内部允许视觉和语言进行双向注意力交互,使当前画面能够结合任务指令完成跨模态融合;不同时间单元之间则采用因果注意力,只让当前表示访问过去信息,从而保留流式、自回归的推理性质。
- 在时间维度上保留任务语义。 由于语言指令会随每个观察一同进入时序序列,它不只是初始化时提供一次条件,而是贯穿任务执行过程的语义参照。这一设计有助于模型判断历史观察与当前目标之间的关系。
- 用间隔训练连接实验室与真实机器人。 论文指出,训练阶段常使用同步采样,但真实机器人中的相机、控制器和执行动作未必严格同步。StreamPI采用随机间隔的流式训练,让模型接触不同的帧间距离;合适的间隔,例如每隔若干帧取一次观察,可在动作平滑性与执行速度之间取得平衡,而随机化则用于增强对时序扰动的鲁棒性。
- 兼容单帧与多帧推理。 方法利用语言模型骨干的长度外推能力,继承预训练单帧权重,并支持根据任务需要切换单帧或多帧输入。这意味着改造重点放在时序组织和训练策略,而不是增加新的参数模块。
意义与影响
StreamPI的价值在于,它把“让机器人记住过去”转化为模型接口和注意力掩码层面的改造。相比直接堆叠更大的网络或额外设计记忆模块,这种路径更强调对既有VLA能力的复用,也为单帧模型逐步升级到流式感知提供了思路。
从应用角度看,历史视觉信息对于需要确认状态、处理遮挡或完成精细对齐的任务尤其重要。随机间隔训练则回应了真实机器人部署中的工程问题:视觉观测到达时间、控制频率和动作持续时间可能存在波动。论文在涉及记忆依赖和精确感知的真实机器人任务,以及LIBERO仿真基准上进行评估,并报告StreamPI整体优于pi0.5。不过,素材未提供具体任务数量、成功率或计算开销,因此其优势幅度和不同场景下的成本仍需结合完整论文进一步判断。
总体而言,StreamPI展示了一条相对克制的升级路线:不改变单帧VLA的参数规模,通过指令锚定的时序注意力和面向异步部署的训练方式,扩展模型对连续观察的利用能力。它也提示,机器人模型的时序能力不只取决于更长上下文,还取决于如何让语言目标在历史信息中保持稳定。
评论
正在确认登录状态……
正在加载评论……