GE-Act 2.0:从零预训练并扩展机器人世界动作模型
导语
机器人要在真实世界中完成操作,不能只识别“眼前有什么”,还要判断“采取动作后会发生什么”。世界动作模型(World-Action Model,WAM)正是围绕这一问题设计:它根据视觉观察、语言指令和候选动作,预测未来状态,再利用这些预测指导机器人执行。与只依赖带动作标注数据的策略模型相比,WAM有机会同时吸收无动作视频和交互轨迹。
GE-Act 2.0的重点,不只是提出一个新模型,而是探索世界动作模型能否像视觉生成模型一样进行预训练和规模化扩展。论文指出,现有方法往往继承已经训练好的视频生成模型,模型本身如何从机器人操作数据中学习,以及数据规模扩大后能否持续受益,仍缺少系统研究。
核心设计
GE-Act 2.0的可训练生成与动作组件全部从零开始初始化,整体由三个模块构成:
- 控制导向自动编码器(CoAE):在较强压缩下保留与动作和指令有关的信息,而不是单纯追求视觉重建质量。这使模型能够用更紧凑的状态表示支撑控制。
- 单步视觉规划器(SVP):用一次可微前向过程生成完整的未来状态。相比需要多步迭代生成的方案,它便于将视觉规划与逆动力学分开预训练。
- 逆动力学模型(IDM):根据当前状态和目标未来状态推断需要执行的动作,负责把视觉层面的“目标变化”转化为机器人控制信号。
三个组件先利用互补数据分别学习,再通过知识对齐选择性优化(KASO)联合训练。KASO不会无条件接受模型预测的未来,而是筛选那些在行为上与记录动作相容的预测结果,从而减少动作标签、视频状态和模型预测之间的监督错配。
实验结果
研究团队没有针对每项任务进行额外微调,而是直接使用预训练检查点,在100项任务、20个操作技能组上评估模型。测试场景更换了场景、背景、光照和物体实例,用于考察零样本泛化能力。
当协同训练数据从300小时扩大到30000小时时,G1-OP上的成功率由17.1%提升至44.1%,G2-90D上则由13.4%提升至31.1%。值得注意的是,G2-90D在协同数据中占比不到2%,但相关性能仍提升17.7个百分点,这为不同机器人本体之间的知识迁移提供了积极信号。性能提升覆盖20个技能组中的19个和18个。技能相关数据覆盖度与未见分布成功率之间也呈现较强相关性,Pearson相关系数为0.80,Spearman相关系数为0.85。
论文还报告,模型在至少90%的测试试验中能够定位物体、颜色、形状和位置等指代,并能遵循与既有行为或常见场景联想相冲突的明确指令。不过,这些结果仍属于论文设定下的离线预训练检查点评测,不能直接等同于在所有真实环境中的可靠部署能力。
意义与局限
GE-Act 2.0的价值在于把讨论重点从“是否使用视频生成器”转向“机器人世界动作模型本身如何预训练、如何扩展”。CoAE、SVP和IDM的拆分,让无动作视频、动作轨迹和机器人控制数据可以承担不同职责;KASO则试图缓解异构监督带来的训练噪声。
从结果看,扩大数据规模确实带来收益,但不同技能的数据覆盖仍是影响泛化的重要因素。这意味着机器人基础模型的下一步,不只是收集更多小时数,还要提升技能、实体和环境的覆盖质量。GE-Act 2.0为跨本体学习和零样本操作提供了一个可扩展方向,但其在长时序任务、失败恢复和真实部署安全性上的表现,还需要进一步验证。
评论
正在确认登录状态……
正在加载评论……