返回文章列表
视觉与视频

让生成视频“记得来过”:无需训练的自回归渲染一致性方法

阅读约 3 分钟

导语

条件视频生成正在被用于把 3D 引擎输出的深度图、无纹理几何等中间结果转成接近真实摄影的视频。这对游戏、虚拟制作和沉浸式内容很有吸引力:引擎负责稳定的几何与相机轨迹,生成模型负责补上材质、光照和细节。但一旦生成过程拉长,一个非常实际的问题就会出现——镜头绕一圈回到老地方时,模型可能“忘了”之前生成过什么。

论文《Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering》正是围绕这个问题展开。作者关注的是自回归式视频生成:模型按片段逐段生成视频,并依赖有限大小的 KV cache 保存上下文。当早期片段被挤出缓存后,即使 3D 引擎提供的深度与几何仍然严格对齐,模型也可能在重访同一区域时生成不同的墙面纹理、物体外观或局部风格,破坏长期世界一致性。

核心要点

  • 问题定位清晰:长程生成式渲染不是只要每一小段好看就够了。对于可漫游的 3D 世界,重访同一位置时外观应保持稳定,否则会削弱空间可信度。
  • 无需后训练:作者没有要求重新训练或微调视频模型,而是利用 3D 引擎天然可得的对应关系,在推理阶段改进记忆与注意力。
  • 时间对应作为闭环记忆:当相机接近曾经到过的位姿时,系统检索与当前姿态匹配的历史潜变量片段,并把它们重新放入 KV cache,作为 loop-closure memory。
  • 空间对应引导注意力:仅取回历史片段还不够。方法进一步利用相机位姿和深度重投影,建立当前 token 与历史片段中几何对应区域的关系,从而让注意力更偏向真正对应的图像位置。
  • 面向真实长轨迹验证:论文在从 TartanAir 和 TartanGround 数据集中挖掘出的闭环轨迹上评估,以模拟更复杂的实际应用场景。结果显示,该方法在重访一致性上优于已有无需训练的基线,同时没有明显牺牲整体视频质量。

意义与影响

这项工作的价值在于,它把传统 3D 系统中的“闭环”思想引入生成式视频渲染。对 SLAM 或机器人领域而言,闭环意味着发现“我又回到了同一个地方”;而在生成式渲染中,闭环则意味着模型不仅要认出同一几何位置,还要复用此前生成的视觉外观。

对于游戏和虚拟世界生成,这类方法可能比单纯扩大上下文窗口更务实。长视频的上下文成本很高,KV cache 不可能无限增长;如果能按需找回与当前视角相关的历史记忆,并通过深度和位姿约束注意力,就能在计算资源受限时获得更稳定的世界表现。

当然,素材并未显示该方法已经解决所有长程一致性难题。它依赖引擎提供可靠的相机位姿、深度和几何对应,主要面向有结构化 3D 条件输入的生成式渲染场景。但从方向上看,这说明未来的视频生成系统可能不会只依赖模型内部记忆,而会更积极地接入外部几何、历史缓存与可检索记忆,让生成内容真正具备“可回访”的空间连续性。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
ShallowStream:先浅层建索引,再深层理解连续视频
视觉与视频
cctest.ai
视觉与视频

ShallowStream:先浅层建索引,再深层理解连续视频

ShallowStream 将多模态大模型的浅层计算用于持续视频编码和检索索引构建,查询时再调用深层能力完成回答。在保持接近现有流式方法效果的同时,论文报告其单帧预填充延迟最高降低 52.1 倍,10 秒端到端延迟最高降低 11.9 倍。

阅读全文
CCTest · Blog
视频生成对齐与蒸馏不必二选一:DM-Align尝试单阶段优化
视觉与视频
cctest.ai
视觉与视频

视频生成对齐与蒸馏不必二选一:DM-Align尝试单阶段优化

一项发表于 arXiv 的研究提出 DM-Align,将视频生成模型的分布蒸馏与人类偏好对齐放进同一优化框架。该方法借鉴 DPO 与 GRPO,从样本分布差异中直接构造偏好梯度,以降低传统强化学习流程的计算与稳定性成本。

阅读全文