返回文章列表
世界模型

EchoWM:让世界模型同时看见、听见并响应连续移动

阅读约 3 分钟

导语

许多视频生成模型擅长根据文字或图像生成片段,却很难让用户真正“走进”场景:当观察者持续移动、改变方向或切换视角时,画面需要保持空间连续,声音也要随着环境变化而演化。EchoWM瞄准的正是这一问题。论文将其定义为一种可进入式全模态世界模型,试图让视频、环境音、音乐和语音在连续导航过程中共同生成。

核心要点

  • 从单次生成转向连续交互。 EchoWM不只接受一个静态提示,而是响应持续的导航输入。用户的移动意图被转化为相对的6自由度轨迹,涵盖位置与姿态变化。
  • 统一离散指令与连续姿态。 键盘式或符号化命令,以及更细粒度的连续相机姿态,都被映射到共享的度量尺度轨迹空间。论文还引入数据集级校准,以减少异构数据在运动幅度上的不一致。
  • 同时覆盖第一人称和第三人称。 在第一人称场景中,相机意图直接描述观察者的运动;在第三人称场景中,模型从数据中学习相机与角色之间的动态关系,而不是依赖针对特定视角设计的控制器。
  • 视听内容共同演化。 模型的目标不只是生成更清晰的视频,还包括保持环境声音、音乐和语音与视觉场景及运动过程同步。
  • 分阶段训练长时生成。 研究团队构建了互补式数据引擎,并采用渐进式训练,随后进行自回归后训练,以支持更长时间范围的世界展开。

方法意义

EchoWM的价值在于,它把“世界模型”从可预测的视频序列进一步推向可操控的生成环境。对交互式媒体而言,连续轨迹比单个动作标签更接近真实使用方式;而统一的6自由度表示,则为不同来源、不同视角的数据提供了共同接口。全模态输出也意味着场景的真实性不再只由画面决定,空间移动、声音变化和角色语音需要共同维持一致的时间关系。

论文报告称,EchoWM在公开世界模型基准上展现出较强的轨迹跟随能力和视觉质量,并支持多种主体的第一人称、第三人称交互,同时能够在长时生成中维持环境音和语音同步。不过,当前素材没有给出具体基准分数、模型规模、推理成本或开放权重信息,因此更适合将其视为方法方向和系统设计的概览,而不是完整性能复现指南。

如果这一范式继续发展,未来的生成式游戏、虚拟拍摄、沉浸式叙事和具身智能模拟,都可能从“生成一段内容”转向“生成一个可以持续探索的世界”。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
StateFlow:把视频预演从“一次生成”改成可编辑的3D世界状态
世界模型
cctest.ai
世界模型

StateFlow:把视频预演从“一次生成”改成可编辑的3D世界状态

StateFlow 提出一种以“持久3D世界状态”为核心的生成式预演框架,用于电影、游戏、建筑和城市设计等场景。它不再把视频一次性生成完,而是先构建可编辑世界,再围绕状态演化和相机访问进行迭代。

阅读全文