返回文章列表
世界模型

Adobe 提出 Wonder:可实时操控镜头的视频世界模型

阅读约 2 分钟

导语

Adobe 相关研究者在 Hugging Face Daily Papers 上提交了论文《Wonder: Video World Model Done Better》。这项工作关注的不是单次生成一段漂亮视频,而是构建一个可以被摄像机“驾驶”的视频世界模型:给定一张图片或一段条件视频,模型生成一个可交互探索的视觉世界,用户能够移动镜头、发现未见过的区域,并在较长时间后重新回到此前观察过的地方。

这类能力对视频生成提出了更高要求。模型不仅要补全画面,还要理解镜头运动、维护空间关系,并在上下文越来越长时依然记住关键场景信息。

核心要点

  • 相机控制更像视觉条件:Wonder 引入稠密坐标场作为相机条件。其渲染结果提供与画面对齐的运动和朝向线索,让模型把镜头移动直接当作可见的视觉证据来理解,而不只是接受抽象参数。
  • 面向长时生成的记忆机制:随着视频持续生成,上下文会不断增长。论文提出基于稀疏注意力的高效记忆机制,使模型在推理时只关注少量相关上下文 token,而不是被完整历史拖慢。
  • 改进蒸馏训练流程:研究者还对 self-forcing 风格的蒸馏管线做了修正,目标是让学生模型更好遵守控制信号,同时保留教师模型的多样生成模式和长期记忆能力。
  • 支持多种输入方式:Wonder 不只做图像到视频,也能在已有动态视频条件下继续生成,相当于对已有场景进行实时“重拍”。

意义与影响

Wonder 的价值在于把视频生成从“线性片段”推向“可导航场景”。论文称,该系统能够以 16 FPS 合成分钟级视频,并在长时间 rollout 中维持几何、外观和动态的一致性。这对虚拟拍摄、交互式内容创作、游戏原型、空间预览等方向都有启发意义。

当然,从摘要信息看,Wonder 仍主要展示的是研究系统能力,距离通用、稳定、可产品化的实时世界模拟还有待更多公开评测验证。尤其是复杂物理交互、精确可控性、跨场景泛化和成本效率,仍会是世界模型走向应用的关键问题。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
World in World:让冻结的视频世界模型获得更灵活的视角与时间控制
世界模型
cctest.ai
世界模型

World in World:让冻结的视频世界模型获得更灵活的视角与时间控制

World in World 提出一种无需重新训练的推理接口,将视频观测、目标视角投影、几何线索和历史生成结果统一送入冻结的视频世界模型。它试图解决视角切换、长时探索和回访一致性之间的协调难题。

阅读全文