返回文章列表
视觉与视频

FrameMorrow:让视频生成模型提前思考该记住什么

阅读约 3 分钟

导语

长视频生成面临一个越来越明显的矛盾:生成过程越长,可供参考的历史越多,但模型不可能无限制地保留和处理全部内容。简单地压缩历史,可能丢失人物身份、场景布局或即将重新出现的关键物体;只根据当前画面选择相关内容,也未必能满足后续生成的需要。

FrameMorrow的出发点正是这一问题。论文认为,历史信息是否有价值,不应只由它与当前内容的相似度决定,还应考虑它对未来生成的潜在用途。

核心方法

  • 从“当前相关”转向“未来有用”:传统历史选择机制通常观察当前状态,再挑选与当前画面最匹配的内容。但某些暂时不显眼的历史帧,可能在未来剧情、动作或场景变化中重新变得重要。
  • 用前瞻性令牌概括需求:FrameMorrow并不尝试完整生成遥远未来,而是预测一组紧凑的 prospective tokens,用来表示接下来可能需要关注的视觉信息。
  • 依据令牌筛选显式历史帧:这些令牌被用于检索和选择历史视频帧,让生成模型获得更有针对性的上下文。方法选择的是可见的历史帧,而不是特定模型内部的隐状态。
  • 强调跨模型兼容性:由于输入形式是显式帧,FrameMorrow可以接入不同的视频生成器,包括无法访问内部结构的闭源模型,并且额外推理开销较小。

评估与意义

根据摘要,研究团队在五个基准、十一种生成模型上进行了测试,覆盖长视频生成、交互式生成以及动作条件世界模型。结果显示,FrameMorrow在这些场景中带来了较一致的长程一致性和视觉质量提升。不过,现有素材没有提供具体指标、基线差异或消融实验细节,因此更适合将其理解为一种具有普适性的历史选择框架,而不是已经被量化证明适用于所有视频任务的通用方案。

这项工作的价值在于重新定义了视频生成中的“记忆”。记忆不只是保存更多过去,也不是单纯压缩上下文,而是围绕未来的信息需求进行动态取舍。对于长叙事视频,模型可能需要维持人物和场景的长期一致性;对于交互式生成,则需要根据用户下一步动作及时找回相关历史;对于世界模型,过去的视觉状态可能在较晚时刻影响动作结果。前瞻性选择为这些任务提供了共同的接口。

当然,未来需求本身是预测出来的,预测错误仍可能导致关键帧遗漏。如何控制选择偏差、处理多种可能未来,以及在更长时间跨度上保持稳定,仍是值得继续研究的问题。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章