PhysBrain 1.5:把看懂世界、生成动作与预测未来统一起来
导语
机器人要真正进入现实环境,仅仅“看懂图片”并不够。它还需要把视觉信息与任务目标联系起来,决定如何移动,并判断一次操作会让环境发生什么变化。PhysBrain 1.5 的核心思路,是把这几个环节放进同一个物理闭环:观察、交互,以及交互之后的环境变化。
核心方法
PhysBrain 1.5 以通用视觉语言模型为基础,但没有把机器人能力作为独立模块简单外挂。研究团队将语言回答、末端执行器的运动轨迹,以及用于描述未来场景的密集视觉目标,都转换为离散序列。模型随后采用统一的自回归下一 token 预测目标,学习在视觉和语言上下文中理解任务、生成动作,并推断后续状态。
这种设计的价值在于,不同形式的输出共享同一套序列建模机制。语言可以表达任务语义,运动序列承载空间操作信息,而 RGB、深度和机器人掩码等视觉目标则用于刻画环境变化。三者放在同一训练框架内,有助于减少“理解模型”和“控制模型”之间的割裂,不过它并不意味着模型已经解决了现实机器人部署中的全部安全、时延和泛化问题。
训练分为两个阶段。预训练阶段的具身监督完全来自人类交互视频,数据以任务为中心组织,将场景中的语义与空间上下文、从视频中恢复的运动信息,以及后续观测配对起来。之后,研究团队使用人类示范、机器人轨迹和仿真经验进行监督微调,使模型进一步适应机器人相关任务。
结果与意义
论文报告称,8B 版本在 28 项具身理解基准上的平均成绩为 72.5,在其中 14 项上取得开源模型最佳结果,并与论文列出的部分闭源模型表现相当。除基准测试外,作者还展示了模型生成末端执行器轨迹、以及预测未来 RGB、深度和机器人掩码的定性案例。
这一工作的重要性不只在于分数。它提出了一条较清晰的路线:具身模型可以从人类视频中学习“看见动作之间的关系”,再用机器人和仿真数据补足执行层面的信息。如果这种统一建模方式能够在更多机器人平台和真实环境中保持稳定,视觉语言模型就可能从回答问题进一步走向参与物理世界的决策。
但现有材料主要提供了方法概述、基准汇总和定性结果,没有给出各项任务的详细分数、真实机器人成功率或长期交互评测。因此,PhysBrain 1.5 更适合被看作一个统一具身建模方向的阶段性进展,而不是已经成熟的通用机器人控制方案。
评论
正在确认登录状态……
正在加载评论……