WorldCrafter:用隐式3D记忆保持视频世界的长期一致性
导语
视频世界模型的目标,不只是生成几段看起来合理的画面,而是让用户能够在一个持续存在的环境中自由移动、观察和探索。现实中的摄像机一旦转身,刚才看到的建筑、物体和空间关系仍然应该保持不变。但对现有模型而言,长时间生成和跨视角切换往往会带来内容漂移:物体位置改变、场景细节被重写,甚至同一空间在不同镜头下不再像同一个世界。
腾讯ARC团队提出的WorldCrafter,试图从“如何记住已经看过的世界”入手解决这一问题。论文的核心设计,是为视频生成器建立一种可以根据摄像机查询的隐式3D感知记忆。
核心方法
- 让目标视角参与记忆读取。 模型不会简单地把所有历史帧堆叠到上下文中,而是根据用户请求的摄像机位置或视角,从历史多视图证据中提取与当前画面最相关的信息。
- 把历史信息压缩为固定令牌。 由于视频生成器能够处理的令牌数量有限,WorldCrafter使用记忆编码器和姿态条件化的读取模块,将历史观察整理成固定数量、面向目标视角的令牌,再在去噪前注入生成流程。
- 不依赖显式深度对应。 该方法并没有建立传统意义上的深度匹配或显式三维点对应,而是通过与视频生成器联合训练,学习如何在隐式空间中保存和调用多视角信息。
- 结合近期上下文与快速推理。 历史记忆负责较长期的场景一致性,近期时序上下文则帮助维持短期运动和外观连续性;同时,少步蒸馏用于支持更适合流式探索的生成速度。
WorldCrafter可以从单张输入图像或文本提示开始工作,并在探索过程中持续整合新的观测。这意味着它的工作方式更接近一个不断更新的环境模型,而不是一次性生成固定长度视频。
意义与影响
这项工作的价值在于重新定义了视频世界模型中的“记忆”问题。与其无差别保存越来越长的历史,不如让未来要观察的视角决定哪些信息值得被保留和读取。这样的设计既回应了上下文容量有限的工程约束,也更贴近摄像机控制任务的实际需求。
论文在静态和动态场景上的实验表明,WorldCrafter在长时一致性和摄像机控制准确性方面取得了明显提升,同时保持了视觉质量,并支持分钟级探索。对于可交互视频、虚拟环境生成、游戏内容制作以及具身智能模拟而言,稳定的空间记忆是从“会生成画面”走向“能维护世界状态”的关键一步。不过,现有素材未提供具体基准数值,模型在更复杂动态交互和真实环境中的泛化能力仍需进一步验证。
评论
正在确认登录状态……
正在加载评论……