返回文章列表
视觉与视频

Self Gradient Forcing:让自回归视频模型学会写好长期记忆

阅读约 3 分钟

导语

长视频生成的难点不只是“生成下一帧”,而是让几秒、几十秒甚至更长时间里的主体、场景布局和运动节奏保持稳定。近期自回归视频扩散方法常采用 Self Forcing:模型在训练时不再只依赖真实历史帧,而是使用自己 rollout 出来的历史上下文,从而更接近推理阶段的真实状态,减少曝光偏差。

但这篇论文指出,Self Forcing 仍存在一个被忽视的问题:早期生成的潜变量虽然会被写入历史 key-value 缓存,供后续帧读取,但未来帧的损失通常无法有效反向指导“这些早期内容应该如何被编码成更好的记忆”。作者将其称为 historical context-gradient gap,也就是历史上下文的梯度缺口。

核心要点

  • 问题定位:记忆被使用,却没有被充分训练。 在自回归视频扩散中,历史 KV 缓存决定未来帧能看到什么上下文。如果缓存只是冻结的 rollout 状态,未来生成出错时,训练信号很难回到“上下文写入”这一环节。
  • 方法:Self Gradient Forcing(SGF)。 SGF 采用两阶段训练。第一阶段执行与推理一致的无梯度自回归 rollout,并在采样的去噪退出步记录模型自己生成的上下文和输入模型的噪声潜变量。
  • 第二阶段:重建可训练的上下文梯度。 模型在并行过程中重新计算上下文的 KV 表示以及未来对上下文的因果注意力。生成的上下文作为 stop-gradient 的干净潜变量输入,而未来视频潜变量的损失则用于训练模型如何把上下文写成更有效的因果记忆。
  • 避免完整长链路反传。 SGF 的目标不是对整个串行 rollout 做昂贵的端到端反向传播,而是在选定退出步恢复关键的上下文梯度信号,兼顾训练可行性与长期一致性。

意义与影响

从结果描述看,SGF 在长时域帧级和块级实验中,相比 Self Forcing 展现出更强的原生长视频外推能力,尤其体现在主体身份、背景/布局一致性和时间稳定性上。论文还强调,即使训练窗口只有 5 秒,模型也能外推到数分钟长度的视频,这对长视频生成研究具有启发意义。

更重要的是,这项工作把长视频生成中的“记忆写入”从工程细节提升为训练目标的一部分。对于自回归视频模型而言,未来竞争可能不只在单帧质量或短片段连贯性,而在于模型能否把早期生成内容压缩成可靠、可读、可延续的因果记忆。SGF 提供了一种不完全依赖超长反传的路径,可能成为后续长视频扩散模型训练中的重要参考。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
SANA-Video 2.0:用混合注意力加速高分辨率视频生成
视觉与视频
cctest.ai
视觉与视频

SANA-Video 2.0:用混合注意力加速高分辨率视频生成

SANA-Video 2.0 试图在视频扩散 Transformer 中兼顾画质与效率:大部分层使用线性注意力,周期性插入 softmax 注意力作为“锚点”。论文称,该方案可在单张 H100 上实现最高 720p 的高质量视频生成,并显著降低长视频推理成本。

阅读全文