返回文章列表
机器人与物理 AI

StreamPI:让单帧视觉语言动作模型具备持续时序理解

阅读约 3 分钟

导语

视觉语言动作(VLA)模型正在成为机器人理解指令、观察环境并执行操作的重要技术路线。不过,部分先进VLA模型仍主要依据单张图像做决策。这种方式推理链路简单、部署成本较低,却也容易丢失此前发生过的状态:物体刚才位于哪里、机器人是否已经完成某个动作,以及场景变化是由自身操作还是外部因素造成的。对于需要记忆和精确定位的操控任务,单帧输入因此存在明显限制。

论文提出的StreamPI,目标并不是重新训练一个更大的时序模型,而是把流式历史信息接入现有的单帧VLA框架,同时不引入额外参数。其重点在于如何组织视觉、语言与时间之间的关系。

核心要点

  • 以语言指令为持续锚点。 StreamPI把每个“视觉观察+语言指令”组合成一个基本时序单元。单元内部允许视觉和语言进行双向注意力交互,使当前画面能够结合任务指令完成跨模态融合;不同时间单元之间则采用因果注意力,只让当前表示访问过去信息,从而保留流式、自回归的推理性质。
  • 在时间维度上保留任务语义。 由于语言指令会随每个观察一同进入时序序列,它不只是初始化时提供一次条件,而是贯穿任务执行过程的语义参照。这一设计有助于模型判断历史观察与当前目标之间的关系。
  • 用间隔训练连接实验室与真实机器人。 论文指出,训练阶段常使用同步采样,但真实机器人中的相机、控制器和执行动作未必严格同步。StreamPI采用随机间隔的流式训练,让模型接触不同的帧间距离;合适的间隔,例如每隔若干帧取一次观察,可在动作平滑性与执行速度之间取得平衡,而随机化则用于增强对时序扰动的鲁棒性。
  • 兼容单帧与多帧推理。 方法利用语言模型骨干的长度外推能力,继承预训练单帧权重,并支持根据任务需要切换单帧或多帧输入。这意味着改造重点放在时序组织和训练策略,而不是增加新的参数模块。

意义与影响

StreamPI的价值在于,它把“让机器人记住过去”转化为模型接口和注意力掩码层面的改造。相比直接堆叠更大的网络或额外设计记忆模块,这种路径更强调对既有VLA能力的复用,也为单帧模型逐步升级到流式感知提供了思路。

从应用角度看,历史视觉信息对于需要确认状态、处理遮挡或完成精细对齐的任务尤其重要。随机间隔训练则回应了真实机器人部署中的工程问题:视觉观测到达时间、控制频率和动作持续时间可能存在波动。论文在涉及记忆依赖和精确感知的真实机器人任务,以及LIBERO仿真基准上进行评估,并报告StreamPI整体优于pi0.5。不过,素材未提供具体任务数量、成功率或计算开销,因此其优势幅度和不同场景下的成本仍需结合完整论文进一步判断。

总体而言,StreamPI展示了一条相对克制的升级路线:不改变单帧VLA的参数规模,通过指令锚定的时序注意力和面向异步部署的训练方式,扩展模型对连续观察的利用能力。它也提示,机器人模型的时序能力不只取决于更长上下文,还取决于如何让语言目标在历史信息中保持稳定。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
GigaBrain-0.7:用三系统架构推动具身模型跨机器人泛化
机器人与物理 AI
cctest.ai
机器人与物理 AI

GigaBrain-0.7:用三系统架构推动具身模型跨机器人泛化

GigaBrain-0.7试图把理解、预测与行动统一到一个具身基础模型中,并通过三系统架构引入面向行动前模拟和评估的世界模型。论文称,该模型在超过3.7万小时异构具身数据上预训练,面向多种机器人展现出更强的任务适应性。

阅读全文
CCTest · Blog
PhysCaP:让机器人通过主动探索理解物体的隐藏物理属性
机器人与物理 AI
cctest.ai
机器人与物理 AI

PhysCaP:让机器人通过主动探索理解物体的隐藏物理属性

PhysCaP 为代码即策略机器人引入物理信息驱动的主动感知机制,使机器人不再只依赖视觉观察,而是通过有针对性的交互判断物体的质量与刚度。该方法在减少无效探索的同时,提升了复杂桌面操作任务中的决策能力。

阅读全文