世界模型训练完就“退场”,机器人为何反而更强?
导语:世界模型不必一直在线
在许多具身智能方案中,世界模型通常被视作机器人的“内部沙盘”:先预测动作会带来什么结果,再选择下一步策略。问题是,在线预测和搜索会增加时延、算力与系统复杂度,尤其是在需要长期连续运行的工业现场。
光象科技联合清华大学李升波教授课题组提出的 Phi-WM 1.0 ActEffect,采用了相反的安排:世界模型只在训练阶段工作,负责检查动作可能造成的后果;机器人真正执行任务时,它从部署链路中退出。
它是怎样训练机器人的?
ActEffect从模仿学习切入。传统策略往往根据动作与示范轨迹的接近程度进行学习,但机械臂动作“看起来相似”,并不意味着最终结果相同。夹爪闭合时机、手腕角度等细微差异,都可能决定抓取或插接是否成功。
为此,系统让策略产生三份完整动作提案:前馈分支给出的初始动作、MIP动作头生成的粗提案,以及进一步精修后的最终动作。受控世界模型分别预测三份动作执行后的场景变化,再与数据中真实的未来观测比较。
模型并不生成追求视觉逼真的未来画面,而是把未来状态映射到冻结的DINOv3视觉特征空间,重点关注物体位置、姿态和场景结构的变化。同时,语言指令仍由VLA负责理解,世界模型只处理当前视觉状态与动作带来的物理后果。这样,任务“要做什么”和动作“会造成什么”被分开建模。
训练时,系统要求精修提案比粗提案更接近真实未来,粗提案又优于初始提案,并通过排序损失把差异传回策略。梯度截断则用于避免模型通过故意拉低差答案来制造虚假的相对优势。
测试结果与局限
在LIBERO上,ActEffect平均成功率达到98.8%;面对相机视角、初始状态、语言表述、光照和噪声等变化的LIBERO-PLUS,成功率为80.3%;在29维动作空间的RoboCasa-GR1上,平均成功率为67.5%。消融实验显示,去掉后果反馈、替换DINOv3特征空间或移除排序损失,性能都会出现不同程度下降。
不过,这些结果主要来自仿真基准。素材中提到的Phi-Bot X1连续运行21.5小时、零失误零中断,是整套工业具身系统的真实场景验证,并不能直接等同于ActEffect模型本身已经完成了同等规模的真机验证。因此,模型能否在不同车型、零件和工位间稳定迁移,仍需进一步观察。
意义:把复杂推理留给训练
ActEffect的关键启发,是重新安排世界模型的位置。它不一定要成为机器人每一步动作都依赖的在线“大脑”,也可以作为训练阶段的后果评估器,把更多监督写入策略参数。部署时,机器人只保留动作头,理论上能够减少推理链路、降低延迟,并控制大规模复制时的算力和运维成本。
对汽车制造等场景而言,真正的考验不只是单次成功率,还包括节拍、故障率、安全性、部署周期和跨工位复制成本。ActEffect已经展示了一条“训练时多想、执行时少算”的路径,但它能否转化为稳定交付能力,还要靠长期产线运行和更多真机数据回答。
评论
正在确认登录状态……
正在加载评论……