返回文章列表
机器人与物理 AI

让机器人“像世界模型一样思考”,却以 VLA 的速度行动

阅读约 3 分钟

导语

视觉-语言-动作(VLA)模型擅长把摄像头观察和任务指令直接转换为机器人动作,但它们通常只围绕“该做什么”进行训练,并没有显式学习“动作会如何改变世界”。这使得模型的鲁棒性很大程度上取决于训练数据是否覆盖了足够多的场景变化。世界模型能够通过预测环境未来状态获得更强的物理 grounding,却往往需要在每次决策时滚动生成未来,推理延迟难以满足机器人控制需求。

论文《Think Like a World Model, Act Like a VLA》提出了一种折中方案:让 VLA 在训练阶段吸收世界模型的内部表征,但在部署阶段完全摆脱世界模型。

核心方法

  • 对齐内部特征,而非生成未来。 研究者认为,世界模型对物体、空间关系和场景变化的理解,主要已经编码在中间特征中;未来帧生成只是训练这些特征所采用的目标,并非部署时必须保留的能力。
  • 只增加一个特征对齐项。 冻结的世界模型在训练数据上运行一次,将各帧特征缓存下来。VLA 学生模型在执行常规动作学习的同时,学习匹配这些缓存表示。
  • 训练后移除教师组件。 世界模型不参与后续训练,投影器也会在训练结束后丢弃。因此,最终策略与未蒸馏的基线在结构和推理流程上保持一致。
  • 不以额外推理换取性能。 论文报告称,部署模型在消费级 RTX 5090 上的运行时间为 32 毫秒、显存占用为 1.86 GB。

实验结果

一个 0.8B 参数的学生模型在 LIBERO 上达到 97.9% 的成功率。在 RoboCasa-GR1 人形机器人操作任务中,性能由 48.2% 提升到 50.5%。同一训练目标还被应用于真实硬件,包括单臂和双臂平台。研究者进一步改变学生模型规模、骨干网络、特征对齐层和教师模型,增益仍然存在,说明效果并不完全依赖某一组网络之间的偶然匹配。

意义与局限

这项工作提供了一条清晰的工程路径:世界模型负责在离线阶段提供更具物理意味的学习信号,VLA 则负责在在线阶段保持紧凑、快速的动作预测。相比把世界模型直接放进控制环路,特征蒸馏避免了持续预测未来的计算开销,也让性能提升更容易归因于表征质量,而不是新增参数或测试时计算。

不过,现有材料主要呈现了方法和结果摘要,尚未提供不同任务的完整统计、训练成本以及失败案例。因此,这种表征先验在更复杂、分布外或长时序操作中的稳定性,仍需要完整论文和更多真实机器人实验进一步验证。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Grounded Action Model:让机器人先理解物体位置,再决定如何行动
机器人与物理 AI
cctest.ai
机器人与物理 AI

Grounded Action Model:让机器人先理解物体位置,再决定如何行动

Grounded Action Model(GAM)将3D目标定位直接纳入机器人基础模型,使机器人能够根据语言、点或框提示锁定目标,并结合精确几何信息生成动作。实验显示,这种以对象为中心的设计在场景变化、目标移动和长程操作中具备更强的泛化能力。

阅读全文
CCTest · Blog
让3D扩散策略具备“趋势感”:无需显式轨迹也能预判操作方向
机器人与物理 AI
cctest.ai
机器人与物理 AI

让3D扩散策略具备“趋势感”:无需显式轨迹也能预判操作方向

一项新研究为3D扩散策略加入了轻量级的运动趋势表示,使机器人不仅依据当前观测生成动作,还能判断交互接下来可能如何发展。该方法无需显式规划轨迹,却在多个仿真和真实机器人基准上明显优于DP3。

阅读全文