返回文章列表
世界模型

WorldCycle:让视频世界模型学会“走回起点”

阅读约 2 分钟

长视频世界模型常常能生成局部连贯的画面,但一旦把动作链拉长,状态就会慢慢漂移,最后连“回到起点”这种最基本的要求都做不到。WorldCycle 的核心想法很直接:如果一个动作序列和它的逆序组合在一起,理论上就应该回到初始状态,那么这个闭环本身就可以成为训练信号,而不必依赖人工标注的真实未来轨迹。

它解决了什么问题?

  • 验证瓶颈:长时程动作没有现成真值,模型错了也难以发现。
  • 闭环监督:把可逆动作做成循环,用“是否回到原状态”来检验模型。
  • 两类奖励:空间闭合奖励检查前后镜像是否对称;时间一致性奖励检查重复执行时同一动作是否稳定。

这种训练方式的关键,不是让模型记住某个时序模板,而是学会把动作当作“状态算子”来理解:执行一次会怎样,反向执行又会怎样,重复执行是否仍然一致。论文还指出,这套方法对组合动作也有帮助,比如更复杂的移动与转向混合操作,基座模型在这类任务上往往更容易出错。

另一个值得注意的地方,是作者同步发布了 CycleBench。它不是单纯看生成画面好不好看,而是专门测模型在可逆、重复和复合动作下的状态回归能力。换句话说,评测重点从“像不像视频”转向“能不能当模拟器”。

从结果上看,WorldCycle 把状态回归漂移最高降低了 44%,并将复合动作准确率提升到接近 4 倍。这说明视频世界模型的下一步,不只是更会生成,而是要更可靠地维护物理状态与动作后果的一致性。对于长时程规划、具身智能和交互式模拟来说,这种能力可能比短期画质提升更关键。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章