FlashForward:用在途 KV 缓存加速长视频扩散生成
长视频扩散生成的瓶颈,往往不只是单帧画质,而是如何在不断延长的时间轴上保持人物、物体和运动轨迹的一致。现有少步自回归视频扩散方法通常把长视频切成多个时间块,再逐块执行若干去噪阶段。为了让后续时间块记住已经生成的内容,系统需要维护注意力中的键值(KV)缓存。但传统做法常常要额外运行模型,重建较干净的历史缓存;这些前向计算不会推进输出潜变量,却会带来可观的开销。
核心思路:复用“正在生成”的缓存
FlashForward 的出发点很直接:每一次去噪前向本来就会计算当前时间块的 KV。与其等待生成结束后再额外重算,不如直接把这份“在途”缓存交给后续时间块使用。当当前块完成某个去噪阶段后,与该阶段对应的缓存已经可用,因此不同时间块可以同时处在不同阶段。论文将不同阶段分配给不同 GPU,形成一种流水线式并行执行,减少缓存更新专用前向带来的浪费。
这种设计也带来新的质量风险。较早可用的阶段匹配缓存仍然包含噪声,若系统只依赖它,视频在跨块衔接时可能出现外观变化、运动漂移或长期结构不稳定。为此,FlashForward 额外生成稀疏的干净锚点潜变量,并在对应区域真正生成之前建立辅助的干净锚点 KV。
两种记忆各司其职
- 阶段匹配历史:密集且更贴近当前时间,保留近期运动和细节演化,但噪声更大。
- 干净锚点 KV:数量稀疏、时间跨度更长,为生成轨迹提供较粗粒度的结构与外观参照。
- 双向约束:锚点从更长时间范围提供稳定方向,近期历史则补充局部连续性,二者共同缓解长视频滚动生成中的误差积累。
论文在 1.3B 和 14B 主干模型、480p 与 720p 设置,以及 20 秒以上的 16 FPS 视频上进行比较。最多使用四张 GPU 时,FlashForward 相较 HiAR 的加速范围为 1.16 至 1.69 倍,相较 Self-Forcing 为 1.42 至 2.92 倍。以 1.3B、480p 设置为例,作者还报告其在 VBench 上取得更高分数,并在 20、35 和 65 秒时长上保持稳定表现。
意义与限制
FlashForward 的价值不在于简单减少某一个算子,而是重新审视了 KV 缓存的生命周期:缓存不必等到“干净”后才有用,带有阶段信息的中间结果也可以服务于流水线调度。再配合少量高质量锚点,系统在效率与一致性之间取得折中。这为长视频生成的多 GPU 推理提供了一个具有工程可行性的方向。
不过,论文给出的优势依赖于特定的少步自回归扩散流程、并行硬件配置和缓存设计。锚点的稀疏程度、阶段划分以及显存通信成本,仍可能影响不同模型和部署环境中的实际收益。因此,FlashForward 更适合被理解为一种面向长时序视频推理的缓存与调度方案,而不是对所有视频生成模型都普遍适用的加速结论。
评论
正在确认登录状态……
正在加载评论……