返回文章列表
世界模型

HLA-WM:用可寻址记忆缓解长视频世界模型遗忘

阅读约 2 分钟

导语

让视频世界模型持续生成几十秒甚至更长的视频,难点并不只是画面质量,还在于模型能否记住早先出现过的空间布局、物体位置和相机运动。当镜头重新回到旧场景时,模型如果无法找回相关历史,画面就容易出现几何漂移、物体不一致或视角控制失真。

论文《HLA-WM》针对这一问题,提出一种无需额外训练的混合线性注意力框架。它试图在完整 KV 缓存的高记忆成本与递归线性注意力的长期遗忘之间取得平衡。

核心要点

  • 问题来自两种记忆机制的取舍。 Softmax 注意力保留完整生成历史,但 KV 缓存会随视频长度增长。Gated DeltaNet(GDN)把历史压缩到固定大小状态,效率更高,却可能在后续状态更新中逐步削弱远处但仍然重要的信息。
  • 先粗检索,再细计算。 HLA-WM 按时间将历史划分为多个块,利用 GDN 的仿射结构缓存紧凑的分块转移摘要;生成新内容时,再根据相机几何关系寻找与当前视角相关的历史块。
  • 重组查询相关状态。 被检索到的历史并非简单拼接,而是被重新组合成面向当前查询的递归线性状态,从而让模型只恢复与当前场景有关的记忆。
  • 实验结果覆盖一致性和控制。 在 60 秒的 SANA-WM-Bench 上,HLA-WM 提升了基础自回归生成器的六项综合回访一致性与相机控制指标,其中 PSNR 提升 0.74 dB,旋转误差降低 28.5%。改进在后续 refinement 后仍然存在,并在 MBench-A 的 547 个样本、四个子集及不同推理模式中保持一致。
  • 效率代价有限。 在 60 秒上下文下,相较完整 KV 缓存,历史状态内存减少 12 倍,推理吞吐最多下降 1.6%。

意义与影响

HLA-WM 的关键启发是:长时记忆不一定要在“全部保留”和“固定压缩”之间二选一。对于具有明显空间结构的视频生成任务,相机几何可以充当一种记忆地址,帮助系统优先恢复可能被再次访问的场景。这样既保留了线性注意力的存储优势,也为远距离历史提供了选择性回读能力。

这项工作尤其适合需要长时间滚动生成、反复回访场景或执行相机控制的世界模型。不过,论文结果主要围绕给定基座模型、数据集与评测协议展开,几何检索质量以及分块摘要的设计仍可能影响泛化效果。总体而言,HLA-WM 展示了一条无需重新训练、通过改造推理期记忆组织方式提升长期一致性的路径。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章