返回文章列表
世界模型

AlayaWorld:面向可交互长时程虚拟世界的视频世界模型

阅读约 2 分钟

导语

传统游戏或虚拟场景开发通常需要资产制作、动画、物理系统和程序逻辑等多环节协作,周期长且门槛高。AlayaWorld 所瞄准的是另一条路线:让视频世界模型根据文本、图像或视频输入,快速生成可交互、可探索,并且能持续演化的虚拟世界。

这篇技术报告的重点不只是“生成一段好看的视频”,而是把视频生成推向更接近世界模拟的方向。一个可用的交互式世界模型,需要在用户移动视角、切换提示词、持续探索时,仍能维持空间与时间上的稳定性,并且以足够低的延迟给出响应。

核心要点

  • 面向长时程交互生成:AlayaWorld 可生成 24fps 视频,分辨率覆盖 540p 与 720p。它基于 15B 参数级别的视频扩散 Transformer,以短 latent chunk 的形式自回归生成后续画面。
  • 支持相机轨迹与提示词切换:模型不是单纯续写视频,而是在相机运动轨迹和可切换文本提示的约束下生成环境,使用户交互成为生成过程的一部分。
  • 有界视觉上下文设计:为避免上下文无限增长,系统组合了持久 sink frame、压缩时间历史、几何对齐空间记忆和近期帧条件。这样的设计用于在有限上下文中保留关键场景信息。
  • 降低长程漂移:长视频生成常见问题是细节逐渐偏移、空间结构失真。报告称,AlayaWorld 在训练中引入被破坏的历史信息,并使用来自自身 roll-out 的预测残差,以提升对错误累积的鲁棒性。
  • 推理加速:团队提出离散自回归蒸馏方法,结合 distribution-matching distillation、self-forcing++ 与 consistency distillation,将每个 chunk 的推理采样步数从约 30 步减少到 4 步。

意义与影响

AlayaWorld 的价值在于,它把视频生成、交互控制、空间记忆和推理效率放进同一个系统目标中考虑。对于虚拟世界、游戏原型、具身智能仿真和交互式内容创作来说,这类模型可能降低环境构建成本,并让用户以更自然的方式“生成并探索”场景。

不过,报告所展示的仍是研究系统,而不是传统游戏引擎的完整替代品。真正可生产化的世界模型还需要解决更复杂的物理一致性、可控性、实时响应和可编辑性问题。AlayaWorld 作为开源、全栈、长期项目,更像是为后续研究提供一个可扩展基座。报告称其在 iWorld-Bench 的长时程生成表现达到最佳,这也说明评测体系正在成为推动世界模型发展的关键环节。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
UniWorld-View登顶WorldScore:国产世界模型如何从一张图生成可控新视角视频
世界模型
cctest.ai
世界模型

UniWorld-View登顶WorldScore:国产世界模型如何从一张图生成可控新视角视频

兔展智能联合北大、鹏城实验室推出的 UniWorld-View 登顶李飞飞团队 WorldScore 榜单,并已开源代码与权重。它的关键看点在于:用统一模型处理单图 3D 与视频 4D 新视角生成,并强化相机位姿控制。

阅读全文