Adobe 提出 Wonder:可实时操控镜头的视频世界模型
导语
Adobe 相关研究者在 Hugging Face Daily Papers 上提交了论文《Wonder: Video World Model Done Better》。这项工作关注的不是单次生成一段漂亮视频,而是构建一个可以被摄像机“驾驶”的视频世界模型:给定一张图片或一段条件视频,模型生成一个可交互探索的视觉世界,用户能够移动镜头、发现未见过的区域,并在较长时间后重新回到此前观察过的地方。
这类能力对视频生成提出了更高要求。模型不仅要补全画面,还要理解镜头运动、维护空间关系,并在上下文越来越长时依然记住关键场景信息。
核心要点
- 相机控制更像视觉条件:Wonder 引入稠密坐标场作为相机条件。其渲染结果提供与画面对齐的运动和朝向线索,让模型把镜头移动直接当作可见的视觉证据来理解,而不只是接受抽象参数。
- 面向长时生成的记忆机制:随着视频持续生成,上下文会不断增长。论文提出基于稀疏注意力的高效记忆机制,使模型在推理时只关注少量相关上下文 token,而不是被完整历史拖慢。
- 改进蒸馏训练流程:研究者还对 self-forcing 风格的蒸馏管线做了修正,目标是让学生模型更好遵守控制信号,同时保留教师模型的多样生成模式和长期记忆能力。
- 支持多种输入方式:Wonder 不只做图像到视频,也能在已有动态视频条件下继续生成,相当于对已有场景进行实时“重拍”。
意义与影响
Wonder 的价值在于把视频生成从“线性片段”推向“可导航场景”。论文称,该系统能够以 16 FPS 合成分钟级视频,并在长时间 rollout 中维持几何、外观和动态的一致性。这对虚拟拍摄、交互式内容创作、游戏原型、空间预览等方向都有启发意义。
当然,从摘要信息看,Wonder 仍主要展示的是研究系统能力,距离通用、稳定、可产品化的实时世界模拟还有待更多公开评测验证。尤其是复杂物理交互、精确可控性、跨场景泛化和成本效率,仍会是世界模型走向应用的关键问题。
评论
正在确认登录状态……
正在加载评论……