返回文章列表
扩散模型

PDD:用并行解码蒸馏加速图像与视频生成

阅读约 3 分钟

导语

扩散模型和流匹配模型已经成为图像、视频生成的重要技术底座,但它们的一个老问题始终存在:采样通常需要多轮迭代。对静态图像来说,这会带来等待时间;对视频来说,成本会进一步放大,因为模型不仅要生成空间细节,还要维持时间一致性和运动变化。

论文《Parallel Decoding Distillation for Fast Image and Video Generation》提出的 PDD(Parallel Decoding Distillation,并行解码蒸馏),就是围绕这一瓶颈展开。它希望在不重新设计整个生成模型的前提下,把现有扩散或流匹配模型蒸馏成更快的少步生成器。

核心要点

  • 目标是减少 NFE:NFE 指函数评估次数,可近似理解为模型在采样过程中被调用的次数。PDD 的目标是在 4-8 NFE 这类少步设置下仍保持较强生成质量。
  • 一次预测多个去噪步骤:传统采样通常一步步推进,PDD 则让模型在一次网络评估中预测多个去噪阶段,从而把串行采样改造成更高效的“并行解码”。
  • 避开复杂蒸馏损失的训练难题:现有先进加速方案常依赖 VSD 或对抗损失。它们能带来不错质量,但优化难度高,并可能出现模式坍塌,导致视频多样性下降、运动不足。PDD 采用更简化的轨迹蒸馏思路,强调稳定性和可扩展性。
  • 兼容不同预训练模型:论文称该架构和训练流程可适配任意预训练模型,并支持不同 NFE 的采样设置。
  • 不依赖导数回归技巧:从概念上看,PDD 学习的是平均速度的表示,而不是通过 JVP 或有限差分近似去回归其导数。

意义与影响

视频生成的体验很大程度上取决于推理速度。如果一个模型质量很高但生成太慢,它在交互式创作、产品化部署和规模化服务中都会受到限制。PDD 的价值在于,它把“少步生成”从依赖复杂损失的路线,转向更直接的轨迹蒸馏框架。

更值得注意的是,论文特别强调了视频多样性的提升。少步蒸馏经常会牺牲分布覆盖,让生成结果变得相似,甚至缺少动态变化。若 PDD 确实能在加速的同时缓解这一问题,它对文本到视频、文本到图像以及视频/音频联合生成都会有实际意义。

根据论文摘要,PDD 已在 LTX-2.3 Text-to-Video/Audio、Wan 14B Text-to-Video 和 Qwen-Image Text-to-Image 上取得 4-8 NFE 的 SOTA 表现。这说明它并非只针对单一模型结构,而是更像一种可迁移的推理加速与蒸馏方法。

当然,最终影响仍取决于更多公开评测、训练成本和社区复现情况。但从方向上看,PDD 抓住了生成模型落地的关键矛盾:不是只追求更大模型,而是让已有强模型更快、更稳、更可用。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章