让机器人“像世界模型一样思考”,却以 VLA 的速度行动
导语
视觉-语言-动作(VLA)模型擅长把摄像头观察和任务指令直接转换为机器人动作,但它们通常只围绕“该做什么”进行训练,并没有显式学习“动作会如何改变世界”。这使得模型的鲁棒性很大程度上取决于训练数据是否覆盖了足够多的场景变化。世界模型能够通过预测环境未来状态获得更强的物理 grounding,却往往需要在每次决策时滚动生成未来,推理延迟难以满足机器人控制需求。
论文《Think Like a World Model, Act Like a VLA》提出了一种折中方案:让 VLA 在训练阶段吸收世界模型的内部表征,但在部署阶段完全摆脱世界模型。
核心方法
- 对齐内部特征,而非生成未来。 研究者认为,世界模型对物体、空间关系和场景变化的理解,主要已经编码在中间特征中;未来帧生成只是训练这些特征所采用的目标,并非部署时必须保留的能力。
- 只增加一个特征对齐项。 冻结的世界模型在训练数据上运行一次,将各帧特征缓存下来。VLA 学生模型在执行常规动作学习的同时,学习匹配这些缓存表示。
- 训练后移除教师组件。 世界模型不参与后续训练,投影器也会在训练结束后丢弃。因此,最终策略与未蒸馏的基线在结构和推理流程上保持一致。
- 不以额外推理换取性能。 论文报告称,部署模型在消费级 RTX 5090 上的运行时间为 32 毫秒、显存占用为 1.86 GB。
实验结果
一个 0.8B 参数的学生模型在 LIBERO 上达到 97.9% 的成功率。在 RoboCasa-GR1 人形机器人操作任务中,性能由 48.2% 提升到 50.5%。同一训练目标还被应用于真实硬件,包括单臂和双臂平台。研究者进一步改变学生模型规模、骨干网络、特征对齐层和教师模型,增益仍然存在,说明效果并不完全依赖某一组网络之间的偶然匹配。
意义与局限
这项工作提供了一条清晰的工程路径:世界模型负责在离线阶段提供更具物理意味的学习信号,VLA 则负责在在线阶段保持紧凑、快速的动作预测。相比把世界模型直接放进控制环路,特征蒸馏避免了持续预测未来的计算开销,也让性能提升更容易归因于表征质量,而不是新增参数或测试时计算。
不过,现有材料主要呈现了方法和结果摘要,尚未提供不同任务的完整统计、训练成本以及失败案例。因此,这种表征先验在更复杂、分布外或长时序操作中的稳定性,仍需要完整论文和更多真实机器人实验进一步验证。
评论
正在确认登录状态……
正在加载评论……