返回文章列表
视觉与视频

视频生成对齐与蒸馏不必二选一:DM-Align尝试单阶段优化

阅读约 2 分钟

导语

让视频生成模型既能快速采样,又能更符合人的审美和指令,是当前模型落地中的一项关键挑战。传统方案往往把“能力压缩”和“偏好对齐”拆成两个阶段:先通过蒸馏减少采样步骤,再用强化学习优化结果,或者先对齐、后蒸馏。前一种顺序计算开销较大,后一种则可能在压缩模型时破坏已经获得的偏好能力,甚至引发模型退化。

来自 arXiv 的论文《Joint Alignment and Distillation for Video Generation via Sample-Guided Distribution Matching》提出了一个单阶段思路:不再把蒸馏与对齐视为彼此独立的流水线,而是用统一的分布匹配目标共同更新视频生成模型。

核心方法

  • 保留标准分布匹配的蒸馏方向。 传统 DM 通过缩小真实模型与生成模型之间的分布差距,使更轻量的模型尽量继承原模型的清晰度和保真度。
  • 加入 DM-Align 偏好方向。 论文从样本层面的分布差异出发,构造一个补充性的梯度,引导生成结果靠近人类更偏好的样本,而不是仅仅追求接近教师模型。
  • 兼容两类偏好信号。 对于成对偏好数据,方法借鉴 DPO 的思路;对于同一组中的探索结果,则参考 GRPO,通过组内样本关系形成偏好引导。
  • 减少强化学习中的复杂环节。 该框架不依赖多步奖励评估,也不需要传统 RL 流程中常见的 ODE-SDE 转换,从而试图降低训练的工程复杂度。

研究意义

这项工作的重点不只是提出一个新的损失项,而是重新安排了视频生成模型的训练接口:蒸馏负责维持生成质量和效率,偏好梯度负责改变输出分布,二者在同一阶段协同工作。这样的设计有望避免“先对齐后压缩”导致的能力损失,也减少“先压缩后强化学习”带来的训练成本与崩溃风险。

从应用角度看,如果这一思路能够在更多模型和偏好数据上保持稳定,它可能适用于需要低延迟生成、同时又重视运动连贯性、画面质量和用户偏好的场景。不过,现有材料主要披露了方法框架与总体实验结论,未给出具体数据集、指标和开销对比。因此,DM-Align 的实际收益仍需结合完整论文中的实验设置、消融结果及不同偏好信号下的表现进一步判断。

总体而言,该研究把视频生成中的“加速”和“对齐”从串行流程转向联合优化,为降低 RL 依赖、缓解蒸馏后的模型退化提供了一条值得关注的技术路线。

来源:arXiv

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
ShallowStream:先浅层建索引,再深层理解连续视频
视觉与视频
cctest.ai
视觉与视频

ShallowStream:先浅层建索引,再深层理解连续视频

ShallowStream 将多模态大模型的浅层计算用于持续视频编码和检索索引构建,查询时再调用深层能力完成回答。在保持接近现有流式方法效果的同时,论文报告其单帧预填充延迟最高降低 52.1 倍,10 秒端到端延迟最高降低 11.9 倍。

阅读全文
CCTest · Blog
Gemini推出Agentic Video Understanding:让模型自己决定“看哪里”
视觉与视频
cctest.ai
视觉与视频

Gemini推出Agentic Video Understanding:让模型自己决定“看哪里”

Google DeepMind为Gemini引入Agentic Video Understanding,使模型能够动态搜索视频片段,并按需调用画面、音频和字幕信息。官方称,该能力在部分基准上可将Token消耗降低最多88%,成本降低最多66%,准确率提升最多7%。

阅读全文