返回文章列表
世界模型

Adobe 提出 Wonder:可实时操控镜头的视频世界模型

阅读约 2 分钟

导语

Adobe 相关研究者在 Hugging Face Daily Papers 上提交了论文《Wonder: Video World Model Done Better》。这项工作关注的不是单次生成一段漂亮视频,而是构建一个可以被摄像机“驾驶”的视频世界模型:给定一张图片或一段条件视频,模型生成一个可交互探索的视觉世界,用户能够移动镜头、发现未见过的区域,并在较长时间后重新回到此前观察过的地方。

这类能力对视频生成提出了更高要求。模型不仅要补全画面,还要理解镜头运动、维护空间关系,并在上下文越来越长时依然记住关键场景信息。

核心要点

  • 相机控制更像视觉条件:Wonder 引入稠密坐标场作为相机条件。其渲染结果提供与画面对齐的运动和朝向线索,让模型把镜头移动直接当作可见的视觉证据来理解,而不只是接受抽象参数。
  • 面向长时生成的记忆机制:随着视频持续生成,上下文会不断增长。论文提出基于稀疏注意力的高效记忆机制,使模型在推理时只关注少量相关上下文 token,而不是被完整历史拖慢。
  • 改进蒸馏训练流程:研究者还对 self-forcing 风格的蒸馏管线做了修正,目标是让学生模型更好遵守控制信号,同时保留教师模型的多样生成模式和长期记忆能力。
  • 支持多种输入方式:Wonder 不只做图像到视频,也能在已有动态视频条件下继续生成,相当于对已有场景进行实时“重拍”。

意义与影响

Wonder 的价值在于把视频生成从“线性片段”推向“可导航场景”。论文称,该系统能够以 16 FPS 合成分钟级视频,并在长时间 rollout 中维持几何、外观和动态的一致性。这对虚拟拍摄、交互式内容创作、游戏原型、空间预览等方向都有启发意义。

当然,从摘要信息看,Wonder 仍主要展示的是研究系统能力,距离通用、稳定、可产品化的实时世界模拟还有待更多公开评测验证。尤其是复杂物理交互、精确可控性、跨场景泛化和成本效率,仍会是世界模型走向应用的关键问题。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
UniWorld-View登顶WorldScore:国产世界模型如何从一张图生成可控新视角视频
世界模型
cctest.ai
世界模型

UniWorld-View登顶WorldScore:国产世界模型如何从一张图生成可控新视角视频

兔展智能联合北大、鹏城实验室推出的 UniWorld-View 登顶李飞飞团队 WorldScore 榜单,并已开源代码与权重。它的关键看点在于:用统一模型处理单图 3D 与视频 4D 新视角生成,并强化相机位姿控制。

阅读全文