返回文章列表
视觉与视频

InfinityEdit:让视频编辑从固定片段走向无限流式生成

阅读约 2 分钟

导语

现有的视频编辑模型大多默认输入是一段已经拍摄完成的固定视频,编辑结果需要在原有时间范围内与源视频逐帧对应。这种方式适合改变风格、对象或局部内容,却不适合直播游戏、持续拍摄的镜头,或“从现在开始改变摄像机运动”这类开放式场景。因为在这些任务中,模型不仅要修改当前画面,还要不断生成尚未出现的未来帧。

InfinityEdit 将这一问题定义为“无限视频编辑”。给定此前的一段视频和编辑指令,模型需要生成接下来的片段,并让视频在时间上自然延续;当新的指令到达时,流程可以继续重复。研究重点因此从固定片段的重写,转向可持续的流式生成。

核心要点

  • 编辑对象从静态视频变为视频流。 模型要生成未来内容,而不是只在已知帧上做对应变换,因此连续性和编辑忠实度同时重要。
  • 轻量级适配器承担编辑控制。 InfinityEdit 由三个注意力模块组成:历史交叉注意力利用输入帧引导去噪,时间因果自注意力限制信息从早期帧流向后续帧,编辑交叉注意力则把文本指令注入生成过程。
  • 只在编辑发生时激活适配器。 在推理阶段,适配器主要作用于收到编辑请求的片段。后续片段由原始流式视频生成模型继续生成,并使用重置后的锚定帧,以保留基础模型原有的无限生成能力。
  • 数据收集流程是方法的一部分。 论文先设计了面向无限视频编辑的数据构建流程,再基于这些数据训练适配器,目标是应对编辑不断累积后可能出现的质量衰减。

意义与影响

InfinityEdit 的价值不只是增加一个编辑模块,而是改变了视频编辑任务的时间边界。对于直播内容、交互式游戏画面和持续生成的虚拟场景,用户往往无法提前提供完整视频,也不希望每次修改都重新处理整段素材。流式编辑如果能够保持稳定,就有机会让编辑指令成为生成过程中的连续控制信号。

不过,这类系统仍需在实际应用中面对编辑冲突、长时间一致性和复杂指令组合等问题。现有材料说明论文通过实验验证了在连续编辑序列下的延续性与稳定性,但未提供完整的指标和规模信息。因此,InfinityEdit 更适合作为一种面向开放式视频生成的架构探索:它展示了如何用较小的适配层,把编辑能力接入原有的流式生成器,同时尽量不破坏其持续生成机制。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章