返回文章列表
世界模型

ReWorld:用分层注意力与地标记忆破解交互式世界模型的长程难题

阅读约 3 分钟

导语

交互式世界模型不仅要生成看起来合理的视频,还要真正理解用户的动作,并记住此前展示过的地点。两者存在明显的系统矛盾:动作控制更依赖最近几帧,历史记忆却希望覆盖尽可能长的轨迹。Hugging Face Daily Papers 收录的 ReWorld,尝试从训练机制和推理架构两端同时处理这一问题。

核心要点

  • 让不同注意力头分工协作。 ReWorld 为大多数注意力头设置较短的历史窗口,使模型更专注于近期动作与画面变化;少量全局头则可以访问完整历史。训练时加入随机头路由,避免“控制能力”或“记忆能力”固化到某些特定头上;随机丢弃历史片段,则让模型适应不完整、稀疏的上下文。
  • 用固定预算承载长期记忆。 推理阶段并不无限扩大 KV 缓存,而是将完整历史限制在固定容量内,并配合一个按照相机位姿索引的地标库。模型可检索距离当前位姿最近的地标,把与当前位置相关的旧信息重新引入上下文。这样既控制了显存和计算开销,也为回到旧地点提供了记忆线索。
  • 从数据层统一动作语义。 论文构建的数据引擎整合了虚幻引擎飞行、游戏场景漫游和真实世界视频等八类来源,并将它们对齐到同一物理动作尺度。也就是说,相同按键在不同数据源中对应相近的相机移动距离。数据中加入“去程—回程”的回文轨迹,为训练模型识别重访场景提供了直接证据。
  • 一套骨干网络兼顾质量与速度。 ReWorld 使用限制在 LoRA 适配器中的分布匹配蒸馏,将采样压缩到四步,同时保留多步采样的高保真模式。论文称,模型可输出 704×1280 视频,覆盖写实、游戏风格和风格化世界。

评测与意义

论文从动作跟随、长程回忆和视频质量三个维度,与六个近期交互式世界模型进行比较。报告结果显示,ReWorld 获得了最佳的控制保真度,旋转误差为 11.95°,并在相机运动一致性和生成质量方面处于领先位置。在持续 64 秒、包含 384 个潜变量的往返轨迹中,固定的 12 个分块缓存仍能重新生成起始视角;相比之下,单纯滑动窗口会较早丢弃相关证据,而完整 KV 缓存的成本会持续增长。

ReWorld 的价值不只在于“记住更多”。它把长期记忆从无限上下文问题,转化为有限缓存与空间检索的组合问题;同时又用统一动作尺度减少跨数据源训练时的语义错位。这种设计对可玩视频生成、虚拟环境导航和具身智能都有启发。不过,摘要并未提供完整的硬件配置、延迟细节或所有基准结果,因此实时性能与跨场景泛化仍需结合论文全文和实际测试判断。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章