返回文章列表
世界模型

World in World:让冻结的视频世界模型获得更灵活的视角与时间控制

阅读约 3 分钟

导语

视频世界模型的目标,不只是生成下一帧画面,还要让用户能够在一个持续演化的环境中探索、转动视角并反复回到曾经到过的位置。自回归视频模型已经具备较长时间范围的生成能力,但当控制信号变得复杂时,画面是否仍与原始事件同步、已观察内容能否出现在正确视角、被遮挡区域能否合理补全,都会成为难题。

论文《World in World》提出了一种训练-free 的推理接口,试图在不重新训练冻结的视频模型的前提下,扩展其可控性。

核心方法

  • 统一视觉证据:系统将源视频观测、目标视角下的场景投影、用于补全新暴露区域的几何渲染,以及滚动缓存之外的历史生成状态,转换为带相机和时间标记的干净视觉状态。
  • 通过原生注意力读取信息:这些证据并非由多个任务专用模块分别处理,而是通过冻结因果视频模型自身的自注意力机制参与生成。
  • 建立跨视角对应关系:对应关系路由器结合持久点身份与几何信息,寻找不同证据中的令牌对应关系,并将受到支持的查询引向匹配的源视频令牌。这有助于保留物体和场景内容在视角变化中的一致性。
  • 按证据类型调节影响:证据级注意力 CFG 会根据同一次去噪前向计算中的注意力响应,分别控制每个辅助通道的额外贡献,而不是把所有控制信号混成一个整体。

它解决了什么问题

从新视角观察一段源视频,本质上同时包含几项要求:相机移动要符合指令,真实观测到的内容要被准确放置,原本不可见的区域要被合理推断,生成过程还要记住此前已经出现过的外观。传统方案往往为每种任务增加专门模块或额外训练,扩展到新的控制方式时成本较高。World in World 的思路则是设计一个共享接口,让不同证据按照可用时间表和令牌级支持程度进入同一个生成过程。

论文将该接口用于相机控制视频重渲染、长时回访和人体动作迁移,并在相机变化下的感知质量、时间一致性与相机跟随准确度方面进行评估。摘要并未给出具体数值,因此更适合将其理解为一种通用的推理期控制框架,而不是已经全面取代专用训练方案的结论。

意义与局限

这项工作的价值在于,它把“如何控制视频世界模型”从重新训练模型,部分转移到如何组织和路由视觉证据。若这一接口能够稳定工作,开发者可以在保留基础模型能力的同时组合视角、时间、几何和记忆信号,为交互式模拟、视频重构和可探索环境提供更灵活的控制方式。

不过,这种方法的效果仍依赖源视频、几何信息、点对应关系以及冻结模型本身的生成能力。对于大幅度视角变化、长期累积误差和新区域的真实细节,摘要没有提供更深入的定量结论。后续仍需观察其在更广泛场景和更长交互链路中的稳定性。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章