WCM:把“世界模型”放进 VLA 强化学习的评论家
导语
视觉-语言-动作模型(VLA)正在成为机器人操作的重要路线:模型既要理解视觉场景和语言指令,又要输出可执行动作。近期强化学习后训练被证明能进一步提升这类模型的操作能力,但一个长期存在的问题是:critic,也就是价值估计器,往往仍以“单帧观察”或单帧 VLM 隐表示为主。
WCM(World Critic Model)的出发点正是这个错位:机器人控制本质上是部分可观测的动态过程,单张图像很难体现物体运动、接触状态、任务进度以及下一步可能发生什么。若价值函数看不见这些时序信息,它对动作好坏的判断就容易偏差。
核心要点
- 问题不是简单缺少历史帧:素材指出,直接把多帧观察堆叠起来会在高维视觉空间中带来很高复杂度,而且仅靠标量回报回归,监督信号过于稀疏,critic 可能只是把历史当成更大的静态特征,而非真正理解环境演化。
- 根因是状态近似不足:在部分可观测场景中,critic 需要构造一个能代表当前任务进展的内部状态。如果没有显式的世界建模目标,它很难学到足以支撑价值估计的时间结构。
- WCM 的做法是“预测未来 + 估计价值”:WCM 基于轻量 LeJEPA 架构,同时学习未来潜在状态预测和价值估计。换句话说,critic 不只是被要求拟合最终回报,还要在潜在空间中学习环境接下来如何变化。
- 可接入现有 VLA 强化学习流程:素材称 WCM 能无缝整合到 on-policy 和 off-policy 训练管线,并兼容 Pi0、Pi0.5、OpenVLA-OFT 等现有 VLA 骨干。
- 实验覆盖面较广:论文摘要称,其在四个基准的 149 个任务上进行了实验;补充材料还提到 ManiSkill、LIBERO-Plus 以及 7 个真实世界操作任务,包括布料折叠、传送带寿司抓取等场景。
意义与影响
WCM 的价值不在于提出一个更大的模型,而在于重新定义了 VLA 强化学习里 critic 应该学什么。传统 critic 常被当作“回报预测器”,WCM 则把它推向“带世界预测能力的状态表征器”。这对机器人尤其重要,因为真实操作中的成功往往取决于隐含过程:夹爪是否已经接触物体、物体是否即将滑落、布料是否处在可折叠状态,这些都不是单帧图像能稳定回答的问题。
如果素材中的实验结论能够在更多平台复现,WCM 可能会推动 VLA 后训练从单纯追求策略更新,转向更重视价值模型的时序理解能力。它也提示了一个更广泛方向:在具身智能中,世界模型未必只用于生成未来画面或规划轨迹,也可以成为强化学习 critic 的结构化监督来源。
当然,目前公开信息仍主要来自论文摘要和作者介绍,具体训练成本、消融设计、真实机器人任务的可迁移性边界,还需要阅读完整论文后进一步判断。但就思路而言,WCM 抓住了 VLA 机器人学习中的一个现实瓶颈:让模型不仅“看见现在”,还要理解“接下来会怎样”。
评论
正在确认登录状态……
正在加载评论……