返回文章列表
世界模型

InternW0-Δ:用20K小时开放数据连接视觉预测与机器人动作

阅读约 3 分钟

导语

机器人要在开放环境中完成抓取、移动和整理等任务,不能只依赖“看到什么就执行什么”的反应式策略。它还需要理解场景如何变化、动作会带来什么后果,以及哪些视觉信息与当前任务真正相关。InternW0-Δ瞄准的正是这一问题:将视觉世界模型的预测能力与机器人动作生成统一起来,构建一个面向通用操作任务的World Action Model(WAM)。

核心要点

  • 多类先验协同进入一个模型。 InternW0-Δ采用Mixture-of-Transformers架构,把预训练视觉动态模型、场景级语义、4D几何与运动先验,以及动作生成模块组合起来。视频专家负责建模视觉变化,动作专家负责输出控制行为,冻结的视觉语言模型则提供语义层面的引导。
  • 用训练阶段监督提炼“未来相关”信息。 论文提出Causal Imprint,让模型利用训练数据中的未来观测学习哪些场景变化会影响后续动作。关键点在于,推理时动作专家可以直接使用预测性表征,而不必先滚动生成未来视频,从而避免把完整视频预测作为在线控制的必要步骤。
  • 数据来源更加异构。 研究团队整理了机器人示范、UMI数据、人类第一视角操作示范,以及Ego2Robot数据,并将其对齐到共同的状态—动作表示。论文称,处理后的训练语料超过2万小时,是同类开放语料中规模最大的项目之一。
  • 覆盖仿真与真实平台。 作者报告称,模型在多个仿真基准和真实机器人平台上优于此前方法。不过,素材没有提供具体任务、成功率、硬件配置或对比方法,因此这些结果仍需结合论文完整实验进一步核验。

意义与影响

InternW0-Δ的价值不只是扩大机器人训练数据规模,更在于尝试解决“预测模型”和“控制模型”长期相对分离的问题。视觉动态模型擅长描述世界如何变化,但未必知道下一步该怎样操作;动作策略能够输出控制信号,却可能缺少对未来状态的显式理解。通过让两类专家在统一框架中交互,研究者希望把“看懂变化”和“采取行动”连接起来。

Causal Imprint则体现了另一种工程取舍:训练时可以使用未来信息来塑造表征,部署时却不再反复生成未来画面。这种设计有望降低在线推理链路的复杂度,但它是否能在遮挡、分布变化和长时序任务中保持稳定,仍需要更多公开实验验证。

如果项目按计划开放训练代码、模型权重、基础设施、数据处理流程及许可允许的数据,将有助于研究者复现实验并比较不同数据来源的贡献。与此同时,超过2万小时并不自动等同于高质量泛化能力,数据动作标签的一致性、机器人形态差异和真实部署成本,仍是判断这类世界动作模型能否走向通用机器人的关键因素。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
给世界模型补上“物体恒存”:WROP如何训练视频模型理解遮挡与连续性
世界模型
cctest.ai
世界模型

给世界模型补上“物体恒存”:WROP如何训练视频模型理解遮挡与连续性

一项新研究把认知科学中的物体恒存任务引入视频生成模型训练,推出包含150类任务、150万样本的数据基础设施WROP。实验显示,经过训练的16B模型在连续生成模型中排名第一,但这仍主要反映特定测试集上的能力。

阅读全文
CCTest · Blog
HappyWorld-Bench:从“看起来真实”到“交互可靠”的世界模型评测
世界模型
cctest.ai
世界模型

HappyWorld-Bench:从“看起来真实”到“交互可靠”的世界模型评测

HappyWorld-Bench提出了一套覆盖视频、空间与具身系统的统一评测框架,重点检验世界模型在探索、交互和修改后的状态一致性与行为响应能力。结果显示,当前系统仍普遍存在长期一致性不足、编辑执行偏差和多步状态保持困难。

阅读全文