返回文章列表
多模态

AV-GRPO:把音视频扩散模型的强化学习拆成两个更易优化的问题

阅读约 2 分钟

导语

联合音视频生成正在从“能同时生成画面和声音”走向“画面、声音与文本彼此匹配”。但在扩散模型上进行强化学习后训练时,视频质量、音频质量、文本一致性和时间同步往往会同时影响奖励,模型很难判断一次更新究竟改善了哪一项。AV-GRPO 试图从训练机制上拆开这些信号,为联合音视频模型提供更明确的优化路径。

核心方法

论文提出的 AV-GRPO 是一种面向联合音视频生成的模态锚定在线扩散强化学习框架,主要包含三项设计:

  • 模态锚定 rollout:在生成和比较样本时固定一个模态作为参照,减少不同样本难度和异构奖励对训练的干扰,让音频或视频的改进信号更加清晰。
  • 轨迹锁定的冻结塔优化:更新其中一个模态分支时,冻结另一模态塔,并锁定相关生成轨迹。这样既能降低同时优化两套动态差异明显的模态塔所带来的计算开销,也能改善奖励归因。
  • 模态自适应目标:针对音频与视频在生成动态、扰动敏感度和学习节奏上的差异,分别调整训练目标与扰动强度,而不是使用完全相同的优化配置。

配套的 5DAV 数据集则将训练样本按五个维度进行解耦,并支持控制样本难度。其目标不是简单扩大数据量,而是为不同模态能力和同步能力提供更系统的训练与分析条件。

实验与意义

论文在 JavisBench 和 VABench 上评估 AV-GRPO,并以 LTX-2.3 作为基础模型进行 LoRA 和全参数微调。根据论文摘要,AV-GRPO 在生成质量、语义对齐以及音视频跨模态同步方面均取得优于基线的结果,消融实验也用于验证各个设计模块的作用。相关材料还显示,该方法面向 22B 规模的 LTX-2.3,支持在有限 GPU 配置下进行训练。

这项工作的关键价值在于,它没有把音视频强化学习简单理解为“把多个奖励相加”,而是将信用分配和评估公平性视为核心问题。模态锚定思路可以降低同步评价对成对样本的依赖所带来的不稳定影响,也为后续构建更细粒度的音频、视频和同步奖励模型提供了接口。

不过,现有素材主要披露了方法框架和总体实验结论,未给出各项指标的具体数值。因此,AV-GRPO 的提升幅度、不同奖励模型的敏感性,以及其向更长视频、更复杂声音场景的泛化能力,仍需结合论文全文和公开代码进一步核验。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章