视频生成对齐与蒸馏不必二选一:DM-Align尝试单阶段优化
导语
让视频生成模型既能快速采样,又能更符合人的审美和指令,是当前模型落地中的一项关键挑战。传统方案往往把“能力压缩”和“偏好对齐”拆成两个阶段:先通过蒸馏减少采样步骤,再用强化学习优化结果,或者先对齐、后蒸馏。前一种顺序计算开销较大,后一种则可能在压缩模型时破坏已经获得的偏好能力,甚至引发模型退化。
来自 arXiv 的论文《Joint Alignment and Distillation for Video Generation via Sample-Guided Distribution Matching》提出了一个单阶段思路:不再把蒸馏与对齐视为彼此独立的流水线,而是用统一的分布匹配目标共同更新视频生成模型。
核心方法
- 保留标准分布匹配的蒸馏方向。 传统 DM 通过缩小真实模型与生成模型之间的分布差距,使更轻量的模型尽量继承原模型的清晰度和保真度。
- 加入 DM-Align 偏好方向。 论文从样本层面的分布差异出发,构造一个补充性的梯度,引导生成结果靠近人类更偏好的样本,而不是仅仅追求接近教师模型。
- 兼容两类偏好信号。 对于成对偏好数据,方法借鉴 DPO 的思路;对于同一组中的探索结果,则参考 GRPO,通过组内样本关系形成偏好引导。
- 减少强化学习中的复杂环节。 该框架不依赖多步奖励评估,也不需要传统 RL 流程中常见的 ODE-SDE 转换,从而试图降低训练的工程复杂度。
研究意义
这项工作的重点不只是提出一个新的损失项,而是重新安排了视频生成模型的训练接口:蒸馏负责维持生成质量和效率,偏好梯度负责改变输出分布,二者在同一阶段协同工作。这样的设计有望避免“先对齐后压缩”导致的能力损失,也减少“先压缩后强化学习”带来的训练成本与崩溃风险。
从应用角度看,如果这一思路能够在更多模型和偏好数据上保持稳定,它可能适用于需要低延迟生成、同时又重视运动连贯性、画面质量和用户偏好的场景。不过,现有材料主要披露了方法框架与总体实验结论,未给出具体数据集、指标和开销对比。因此,DM-Align 的实际收益仍需结合完整论文中的实验设置、消融结果及不同偏好信号下的表现进一步判断。
总体而言,该研究把视频生成中的“加速”和“对齐”从串行流程转向联合优化,为降低 RL 依赖、缓解蒸馏后的模型退化提供了一条值得关注的技术路线。
来源:arXiv
评论
正在确认登录状态……
正在加载评论……