Masked Visual Actions:用“可见轨迹”把视频模型变成机器人世界模型
阅读约 2 分钟
导语
视频模型已经从大量视频中学到物体如何移动、接触和相互影响的视觉先验,但机器人要利用这些先验并不容易:传统机器人动作通常是关节、末端执行器或控制量,而视频模型更熟悉的是像素中的运动。论文《Masked Visual Actions for Unified World Modeling》尝试用一种更“视觉化”的方式打通两者。
核心要点
- 动作被表示成像素轨迹:Masked Visual Actions 将动作描述为视频里任意实体被部分揭示的运动轨迹,而不是直接输入抽象控制指令。这样做让控制信号与视频模型原本学习的视觉空间保持一致。
- 同一模型支持正向与反向建模:当揭示的是机器人自身运动时,模型相当于正向动力学模型,可预测场景对低层机器人动作的响应;当揭示的是期望物体运动时,模型则尝试生成与该结果一致的机器人行为。
- 训练成本相对克制:论文称,模型只用 15 小时来自真实视频和仿真的遮罩样本进行微调,就能用单一 checkpoint 覆盖多种场景和多种具身形态,并保持较强的视觉保真度和可控性。
- 可用于下游操作决策:在机器人操作任务中,模型生成的“想象 rollout”结果与真实执行存在相关性,可用于策略评估;它还可在基于模型的规划中对候选未来排序,并支持从目标物体运动合成机器人动作。
意义与影响
这项工作的关键不在于提出更复杂的机器人控制器,而在于重新设计视频模型与动作之间的接口。如果动作能以视觉轨迹的形式被表达,视频模型已有的世界知识就可能更自然地转化为机器人世界模型能力。它也提示了一个方向:未来的具身智能系统或许不必为每种机器人单独训练完整动力学模型,而可以在统一视频模型上,通过不同的可见轨迹条件完成预测、规划和反向控制。当然,摘要尚未说明其在更长时序、更高精度接触或开放环境中的边界,但该方法为“视频生成模型如何服务机器人决策”提供了一个清晰且可复用的接口思路。
评论
正在确认登录状态……
正在加载评论……