返回文章列表
视觉与视频

JoyAI-Video-Edit:面向实时、开放式视频编辑的自回归扩散框架

阅读约 3 分钟

在视频生成与编辑赛道里,真正难的并不是“能不能改”,而是“能不能一边改、一边稳”。很多离线方法可以在完整视频上反复迭代,但一旦进入实时场景,就会受到延迟、算力和上下文长度的同时约束。JoyAI-Video-Edit 的核心目标,就是让模型在不看未来帧不预设长度的前提下,仍然能连续输出可编辑、可控且尽量忠于源视频的结果。

这项工作的关键点

  • 16B 参数的自回归扩散框架:把视频编辑放进流式生成范式中处理,更适合实时场景。
  • Chunk-wise autoregressive adaptation:按片段进行自回归适配,降低长视频中逐步累积的失真。
  • SA-DMD(Source-Anchored Distribution Matching Distillation):强调对源内容的锚定,减少两步生成中的源图像偏移。
  • Long-Horizon Autoregressive Distillation:针对长时间编辑中的时间漂移做蒸馏,缓解越看越“跑偏”的问题。

从论文摘要来看,JoyAI-Video-Edit 试图同时解决三类常见矛盾:第一,实时性与质量的矛盾;第二,局部编辑与全局一致性的矛盾;第三,训练时看到的短片段与推理时面对的长视频之间的分布差异。作者把这些问题拆开,再用不同的蒸馏与适配策略分别处理,这也是它相比传统流式编辑方法更有工程价值的地方。

为什么值得关注

这类系统的意义不只在于“更快”。如果实时视频编辑足够稳定,它可能会影响很多下游应用:直播画面处理、创作软件中的交互式修片、短视频内容生产,甚至是面向长视频的半自动后期工具。尤其是“开放式编辑”这个设定,意味着模型不是只会做某个固定任务,而是可以在连续交互中持续响应用户意图,这比单次生成更接近真实工作流。

论文还给出了比较亮眼的系统层面结果:完整系统在单张 Nvidia B200 GPU 上实现了端到端 720p 编辑,速度约 30 FPS。对视频模型来说,这种指标通常比单纯的视觉效果更难达成,因为它要求模型既要有扩散模型的细节能力,又要具备流式推理的效率。

需要注意的地方

这类结果仍然带有明显的系统依赖:性能不仅取决于模型结构,也取决于算力平台、工程实现和评测设置。换句话说,JoyAI-Video-Edit 展示的是一种“把实时编辑做得更接近可用产品”的路径,但是否能在更广泛硬件上复制,还需要后续验证。

总体来看,这篇论文的价值在于,它把视频编辑从“离线离散修图”推进到“持续、实时、开放式交互”的方向,并且给出了一个相对完整的技术组合。对于关注视频生成、实时推理和多模态创作工具的人来说,这是一个很值得跟进的方向。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
跨越形态差异的视频运动迁移:MBM 尝试摆脱“骨架对应”依赖
视觉与视频
cctest.ai
视觉与视频

跨越形态差异的视频运动迁移:MBM 尝试摆脱“骨架对应”依赖

Motion Beyond Morphology(MBM)提出一种新的运动迁移思路:不再要求参考对象与目标对象拥有固定结构对应,而是学习可跨形态保留的抽象运动。该方法面向同类、近类与远类对象的视频生成任务,强调运动一致性与目标外观保持。

阅读全文