返回文章列表
世界模型

OpenWAM:把世界—动作模型预训练变成可控的开放实验

阅读约 3 分钟

导语

世界—动作模型(World-Action Model,WAM)希望把视频生成模型中的世界知识转化为机器人可以执行的控制信号。现有系统往往将生成骨干、视觉表示、动作接口、信息流、推理方式和数据配方紧密捆绑在一起。这样做可以构建一个可运行的系统,却很难回答一个基础问题:性能提升究竟来自哪项设计?

OpenWAM 的价值,首先不在于提出一个单一的模型结构,而在于把 WAM 预训练改造成一项可复现实验。项目包括三部分:OpenWAM-Infra、OpenWAM-Study 和 OpenWAM-α。

核心要点

  • 模块化基础设施。 OpenWAM-Infra 将 WAM 设计空间拆分成可组合模块,并为训练、推理、部署和评测提供统一流程,覆盖 8 个仿真基准,方便研究者进行受控比较。
  • 围绕三个问题展开研究。 OpenWAM-Study 关注应从上游模型继承什么知识、世界学习与动作学习怎样形成协同,以及这种协同如何随规模增长。
  • 提炼三项设计原则。 研究认为,上游知识要有效迁移,需要能力足够强的生成骨干,以及紧凑且信息密度高的潜空间;世界与动作的协同则需要专门的动作容量、清晰的世界到动作信息流和同步的联合去噪过程。
  • 强调具身数据的作用。 具身预训练的主要收益被归结为域外泛化能力提升。将第一视角人类数据与机器人数据进行一阶段联合训练,有助于同时覆盖更广泛的世界内容,并建立动作落地能力。
  • 发布开放基线。 OpenWAM-α 使用约 6400 小时、约 5.185 亿帧的第一视角人类和机器人数据进行预训练。在 5 种形态、8 个仿真基准上表现位居前列,并在移动双臂 EBench 上取得项目所称的最佳结果;在真实双臂 RoboDojo-Real 上排名第一,成功率约为 pi0.5 的两倍。项目还报告了其在单臂和灵巧手真实机器人任务上相对代表性 WAM 与 VLA 基线的稳定优势。

意义与影响

OpenWAM 的重要性在于,它把“更大的模型或更多的数据是否有效”转化为可以拆分、复验和讨论的问题。对于 WAM 领域,这种基础设施能够降低不同论文之间的比较成本,也有助于避免把架构、数据和训练流程的综合效果误认为某个单独组件的贡献。

当然,现有材料主要呈现项目摘要和结果概览,尚不足以独立判断各模块在不同任务上的具体贡献,也无法替代完整论文中的消融细节。更值得关注的是,OpenWAM 是否能在更多机器人形态、真实环境和不同数据规模下保持结论稳定。若其开放代码、预训练与后训练权重能够支持复现,它可能成为后续研究检验世界知识迁移和动作泛化的重要公共基线。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章