返回文章列表
世界模型

ForgeWM:让动作条件视频世界模型以一到四步实时生成

阅读约 3 分钟

导语

实时交互式视频世界模型的难点,不只是“生成得像不像”,还在于能否及时响应玩家输入,并让后续画面符合此前的动作和状态。对于游戏场景,键盘输入通常是离散状态,鼠标移动则是连续信号;当视频被压缩为较大的潜变量时间块后,动作与画面之间很容易错位。ForgeWM针对这一问题,提出了一套面向少步生成的渐进式因果训练框架。

核心方法

ForgeWM的起点是一个双向动作条件视频生成器。研究者没有直接把它压缩成单步模型,而是分阶段完成转换:

  • 领域适配:先让基础生成器更好地适应交互式游戏视频与动作信号。
  • 教师强制因果训练:在训练时使用真实历史状态,建立符合自回归运行方式的因果生成能力。
  • 因果一致性蒸馏:让少步学生模型在不同时间状态下保持与教师相近的预测关系,减少时间压缩带来的不稳定。
  • 在策略分布匹配:利用双向教师进一步对齐模型实际运行时会遇到的状态分布,缓解训练与部署之间的偏差。

最终得到的学生模型分别对应1步、2步和4步去噪预算。这样的预算专门化设计,使系统能够在低延迟交互和更高质量生成之间进行取舍,而不必让一个模型覆盖所有运行条件。

双路径部署

ForgeWM还设计了交互与回放相结合的部署方式。实时操作阶段,1步模型可以快速生成一个“草稿”画面,优先保证控制响应;在需要复盘或提升视觉质量时,系统会对已保存的草稿重新加噪,再进行细化,而不是从纯噪声重新生成。论文报告称,这种回放式细化可以达到4步参考模型的质量,并且与玩家实际经历的轨迹距离约为从噪声重新生成方案的三分之一。

评估与意义

在配对的Minecraft轨迹上,ForgeWM在论文所评估的系统中取得了较好的综合结果,覆盖图像质量、与参考运动轮廓的一致性、动作符号准确率和鼠标控制准确率,同时获得更低的参考LPIPS。相同的四阶段训练流程也被用于手柄控制的FPS游戏,显示出一定的控制形式迁移能力。

这项工作的价值在于,它把视频生成中的少步蒸馏问题与世界模型的交互闭环结合起来:速度、动作对齐和自回归稳定性被放进同一套训练流程中。ForgeWM并不意味着少步生成已经解决长期世界建模的全部问题,但其开放且可复现的实现,以及对键盘、鼠标和手柄输入的支持,为构建可实时游玩的游戏世界模型提供了更具体的工程路径。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
StateFlow:把视频预演从“一次生成”改成可编辑的3D世界状态
世界模型
cctest.ai
世界模型

StateFlow:把视频预演从“一次生成”改成可编辑的3D世界状态

StateFlow 提出一种以“持久3D世界状态”为核心的生成式预演框架,用于电影、游戏、建筑和城市设计等场景。它不再把视频一次性生成完,而是先构建可编辑世界,再围绕状态演化和相机访问进行迭代。

阅读全文