WorldRover:用可控合成视频训练可探索世界模型
导语
训练能够“看懂并走遍”环境的世界模型,难点不只是获得更多视频。模型还需要知道相机如何移动、场景的几何结构是否稳定、同一物体在不同时间出现在哪里,以及哪些信号可以对应到可执行动作。现实采集往往难以同时提供这些信息,几何和长距离对应关系还常常依赖后处理估计。
WorldRover 的思路是把这项工作前移到渲染阶段。论文提出的 WorldRover-Engine 基于 Unreal Engine,在艺术家制作的环境中执行分钟级探索路线,并进行离线渲染。由于路线、相机运动和场景几何都由引擎直接控制,生成的视频可以在同一套空间基础上配套多种监督信号。
核心要点
- 视频与几何同步生成:WorldRover-10M 将 RGB 与度量深度、相机轨迹和由轨迹推导出的动作信号对齐到探索过程的各帧。
- 支持长时探索:引擎保存完整路线,而不是只生成彼此独立的短片段,因此更适合研究持续导航、场景记忆和长期一致性。
- 多视角重放:同一次探索可从第一人称、第三人称和 360 度全景相机呈现,便于比较视角变化对模型学习的影响。
- 更丰富的第三人称标注:相关子集还提供稠密光流、带可见性信息的长程二维/三维点轨迹,以及区别于相机轨迹的角色轨迹。
- 可控外观与环境:路线和几何保持不变时,可以切换环境状态,或采用中性白色材质,从而将运动、结构和外观因素拆开研究。
意义与限制
WorldRover 的价值不在于单纯扩大视频规模,而在于把探索过程组织成可重复、可重放、带多层标注的实验对象。对世界模型而言,这意味着训练数据可以同时覆盖观测、空间结构、时间对应和行动线索;对研究者而言,同一条路线的多视角和多状态版本也有助于开展更可控的对照实验。
当然,合成环境并不等同于现实世界。艺术家制作的场景、引擎中的运动与环境变化,能否充分代表真实采集中的复杂性,仍需要后续验证。因此,WorldRover 更适合作为现实数据的补充:它降低了密集标注和长程对应的获取成本,也为构建和评估可探索世界表示提供了统一的数据生成基础。
评论
正在确认登录状态……
正在加载评论……