返回文章列表
视觉与视频

让生成视频“记得来过”:无需训练的自回归渲染一致性方法

阅读约 3 分钟

导语

条件视频生成正在被用于把 3D 引擎输出的深度图、无纹理几何等中间结果转成接近真实摄影的视频。这对游戏、虚拟制作和沉浸式内容很有吸引力:引擎负责稳定的几何与相机轨迹,生成模型负责补上材质、光照和细节。但一旦生成过程拉长,一个非常实际的问题就会出现——镜头绕一圈回到老地方时,模型可能“忘了”之前生成过什么。

论文《Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering》正是围绕这个问题展开。作者关注的是自回归式视频生成:模型按片段逐段生成视频,并依赖有限大小的 KV cache 保存上下文。当早期片段被挤出缓存后,即使 3D 引擎提供的深度与几何仍然严格对齐,模型也可能在重访同一区域时生成不同的墙面纹理、物体外观或局部风格,破坏长期世界一致性。

核心要点

  • 问题定位清晰:长程生成式渲染不是只要每一小段好看就够了。对于可漫游的 3D 世界,重访同一位置时外观应保持稳定,否则会削弱空间可信度。
  • 无需后训练:作者没有要求重新训练或微调视频模型,而是利用 3D 引擎天然可得的对应关系,在推理阶段改进记忆与注意力。
  • 时间对应作为闭环记忆:当相机接近曾经到过的位姿时,系统检索与当前姿态匹配的历史潜变量片段,并把它们重新放入 KV cache,作为 loop-closure memory。
  • 空间对应引导注意力:仅取回历史片段还不够。方法进一步利用相机位姿和深度重投影,建立当前 token 与历史片段中几何对应区域的关系,从而让注意力更偏向真正对应的图像位置。
  • 面向真实长轨迹验证:论文在从 TartanAir 和 TartanGround 数据集中挖掘出的闭环轨迹上评估,以模拟更复杂的实际应用场景。结果显示,该方法在重访一致性上优于已有无需训练的基线,同时没有明显牺牲整体视频质量。

意义与影响

这项工作的价值在于,它把传统 3D 系统中的“闭环”思想引入生成式视频渲染。对 SLAM 或机器人领域而言,闭环意味着发现“我又回到了同一个地方”;而在生成式渲染中,闭环则意味着模型不仅要认出同一几何位置,还要复用此前生成的视觉外观。

对于游戏和虚拟世界生成,这类方法可能比单纯扩大上下文窗口更务实。长视频的上下文成本很高,KV cache 不可能无限增长;如果能按需找回与当前视角相关的历史记忆,并通过深度和位姿约束注意力,就能在计算资源受限时获得更稳定的世界表现。

当然,素材并未显示该方法已经解决所有长程一致性难题。它依赖引擎提供可靠的相机位姿、深度和几何对应,主要面向有结构化 3D 条件输入的生成式渲染场景。但从方向上看,这说明未来的视频生成系统可能不会只依赖模型内部记忆,而会更积极地接入外部几何、历史缓存与可检索记忆,让生成内容真正具备“可回访”的空间连续性。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
SANA-Video 2.0:用混合注意力加速高分辨率视频生成
视觉与视频
cctest.ai
视觉与视频

SANA-Video 2.0:用混合注意力加速高分辨率视频生成

SANA-Video 2.0 试图在视频扩散 Transformer 中兼顾画质与效率:大部分层使用线性注意力,周期性插入 softmax 注意力作为“锚点”。论文称,该方案可在单张 H100 上实现最高 720p 的高质量视频生成,并显著降低长视频推理成本。

阅读全文
CCTest · Blog
Self Gradient Forcing:让自回归视频模型学会写好长期记忆
视觉与视频
cctest.ai
视觉与视频

Self Gradient Forcing:让自回归视频模型学会写好长期记忆

Self Gradient Forcing 针对自回归视频扩散模型中的“历史上下文梯度缺口”,尝试让未来帧的损失反向监督早期生成内容如何写入更有用的 KV 记忆。该方法以两阶段训练在不完整回传长序列 rollout 的前提下,提升长视频外推的一致性。

阅读全文