InternW0-Δ:用20K小时开放数据连接视觉预测与机器人动作
导语
机器人要在开放环境中完成抓取、移动和整理等任务,不能只依赖“看到什么就执行什么”的反应式策略。它还需要理解场景如何变化、动作会带来什么后果,以及哪些视觉信息与当前任务真正相关。InternW0-Δ瞄准的正是这一问题:将视觉世界模型的预测能力与机器人动作生成统一起来,构建一个面向通用操作任务的World Action Model(WAM)。
核心要点
- 多类先验协同进入一个模型。 InternW0-Δ采用Mixture-of-Transformers架构,把预训练视觉动态模型、场景级语义、4D几何与运动先验,以及动作生成模块组合起来。视频专家负责建模视觉变化,动作专家负责输出控制行为,冻结的视觉语言模型则提供语义层面的引导。
- 用训练阶段监督提炼“未来相关”信息。 论文提出Causal Imprint,让模型利用训练数据中的未来观测学习哪些场景变化会影响后续动作。关键点在于,推理时动作专家可以直接使用预测性表征,而不必先滚动生成未来视频,从而避免把完整视频预测作为在线控制的必要步骤。
- 数据来源更加异构。 研究团队整理了机器人示范、UMI数据、人类第一视角操作示范,以及Ego2Robot数据,并将其对齐到共同的状态—动作表示。论文称,处理后的训练语料超过2万小时,是同类开放语料中规模最大的项目之一。
- 覆盖仿真与真实平台。 作者报告称,模型在多个仿真基准和真实机器人平台上优于此前方法。不过,素材没有提供具体任务、成功率、硬件配置或对比方法,因此这些结果仍需结合论文完整实验进一步核验。
意义与影响
InternW0-Δ的价值不只是扩大机器人训练数据规模,更在于尝试解决“预测模型”和“控制模型”长期相对分离的问题。视觉动态模型擅长描述世界如何变化,但未必知道下一步该怎样操作;动作策略能够输出控制信号,却可能缺少对未来状态的显式理解。通过让两类专家在统一框架中交互,研究者希望把“看懂变化”和“采取行动”连接起来。
Causal Imprint则体现了另一种工程取舍:训练时可以使用未来信息来塑造表征,部署时却不再反复生成未来画面。这种设计有望降低在线推理链路的复杂度,但它是否能在遮挡、分布变化和长时序任务中保持稳定,仍需要更多公开实验验证。
如果项目按计划开放训练代码、模型权重、基础设施、数据处理流程及许可允许的数据,将有助于研究者复现实验并比较不同数据来源的贡献。与此同时,超过2万小时并不自动等同于高质量泛化能力,数据动作标签的一致性、机器人形态差异和真实部署成本,仍是判断这类世界动作模型能否走向通用机器人的关键因素。
评论
正在确认登录状态……
正在加载评论……