RealtimeWAM:让世界动作模型从多步推理走向异步实时执行
导语
世界动作模型(World Action Models,WAMs)试图把视频生成模型学到的视觉表征用于机器人动作预测。与只依赖当前图像或状态的策略不同,WAM能够借助视频模型对环境变化和未来运动的建模能力,为动作生成提供更丰富的视觉先验。但这类模型通常面临一个现实问题:预测质量提升的同时,推理链路也变得更长、更慢。
论文《RealtimeWAM: One-Step Asynchronous World Action Models》把优化重点放在两个环节:动作专家内部的多步去噪,以及视频专家和动作专家之间的串行等待。作者提出RealtimeWAM,目标是在尽量保持控制性能的前提下,使WAM更接近实时执行。
核心要点
- 用TACD压缩动作生成步骤。 传统扩散式动作生成往往需要多次去噪。RealtimeWAM提出“教师锚定一致性蒸馏”(Teacher-Anchored Consistency Distillation,TACD),不只约束相邻步骤之间的一致性,还让一步模型直接对齐冻结教师模型多步滚动后的最终结果。
- 针对局部与全局误差的差异。 论文指出,仅降低局部一致性误差,并不能保证最终动作准确。TACD加入教师多步推理终点的显式监督,试图让学生模型学习“最终应到达哪里”,而不只是学习每一步如何变化。
- 用CEWP减少专家间空等。 视频专家负责生成视觉表征,动作专家据此预测控制信号。以往流程通常要等视频专家整体完成后,动作专家才能开始。跨专家波前流水线(Cross-Expert Wavefront Pipelining,CEWP)按模块共享视频KV缓存,只在对应的动作注意力即将使用缓存时同步,从而重叠两类专家的计算。
- 覆盖多项机器人评测。 实验涉及LIBERO、LIBERO-Plus和RoboTwin,并测试Fast-WAM、Faster-WAM等模型变体。摘要显示,RealtimeWAM在这些设置下保持接近无损的表现,准确率下降低于1%,在H100上端到端速度最高提升25倍。
意义与影响
RealtimeWAM的价值不只是把模型“蒸馏得更小”,而是同时处理了模型内部迭代和模型组件协同两个层面的延迟。TACD面向计算量较大的多步动作生成,CEWP则重新安排视频表征与动作预测的依赖关系。两者结合,说明机器人模型的实时化不仅依赖更快的单个算子,也依赖对完整推理图进行重构。
如果论文中的结果能够在更多硬件和真实机器人环境中复现,这种思路有望降低视觉世界模型用于闭环控制时的延迟门槛。不过,现有材料主要披露了基准测试和方法概要,尚不足以判断其在不同机器人形态、传感器延迟或长时任务中的稳定性。代码和检查点已随项目公开,后续社区复现将有助于评估其通用性。
评论
正在确认登录状态……
正在加载评论……