LOCI:让视频世界模型记住“回到原地时看见了什么”
导语
对视频世界模型而言,真正困难的不只是生成下一帧,而是理解一个持续存在的世界:镜头转向别处后再次回到原区域,模型仍应呈现与此前一致的物体、布局和视觉细节。现有记忆机制通常在细节保留与计算成本之间取舍,LOCI 则尝试把两者结合起来。
核心思路:两种记忆协同工作
LOCI 的名称来自其空间化的线性记忆设计。它没有完全依赖单一记忆结构,而是在 Transformer 的不同模块中分配两类功能:
- 一半模块保留历史观测的键值缓存。这样的缓存能够直接访问过去的信息,因而有利于保存视觉细节,但传统做法会随着视频长度增长而持续占用更多内存。
- 另一半模块将注意力范围限制在当前视频块,并加入循环线性注意力记忆。该记忆将历史压缩为更紧凑的状态,适合连续处理长视频。
- 记忆的读写受到相机投影几何条件控制。也就是说,模型不只根据外观寻找历史内容,还把当前视角与空间位置纳入寻址和写入过程。
- 循环记忆产生的读取结果会传递给后续使用缓存的模块,为这些模块的查询提供累积的场景上下文。
这种设计试图解决两个相互关联的问题:模型是否记得过去看过什么,以及它能否在当前视角下找到正确的历史观测。与将全部历史压缩到固定状态的循环记忆相比,LOCI 保留了部分可直接访问的内容;与完整键值缓存相比,它又减少了对无限增长历史的依赖。
实验观察
根据素材,LOCI 在公开的 MIND memory benchmark 和保留的 Unreal Engine 记录轨迹上进行了评估。结果表明,在重复访问场景时,它比若干代表性世界模型以及采用相同方案的全 Softmax 基线更能忠实复现此前内容。
在保留完整历史的设置下,LOCI 在相同序列长度下将峰值内存降低约 30%。当系统只保留一个有界观测库时,它还能够以恒定内存处理更长视频,并在相同内存预算下保持比全 Softmax 方法更好的复现效果。这里的结果重点并非单纯压缩缓存,而是通过空间几何让有限记忆更有针对性地服务于检索。
意义与局限
LOCI 展示了一条面向长时程视频生成的折中路线:让精确缓存负责保存高保真细节,让线性循环记忆负责提供紧凑、持续的场景上下文,再用相机几何帮助两者定位正确内容。对于交互式模拟、游戏环境建模以及需要长期一致性的世界模型,这种架构具有参考价值。
不过,现有素材主要披露了基准和相对表现,尚不足以判断其在更复杂真实环境、不同相机噪声或更大模型规模下的泛化能力。LOCI 团队同时发布了包含游戏引擎视频、相机位姿、深度和重复访问配对的数据集,并开放项目页面与代码,为进一步复现和比较提供了条件。
评论
正在确认登录状态……
正在加载评论……