AV-GRPO, 공동 오디오·비디오 생성의 강화학습을 분리하다
문제의 배경
공동 오디오·비디오 생성은 화면과 소리를 동시에 만드는 것에서 끝나지 않습니다. 입력 텍스트와의 의미적 일치, 영상의 품질, 음향의 자연스러움, 두 모달리티 사이의 시간적 동기화가 함께 맞아야 합니다. 강화학습 후처리는 이런 요소를 개선할 수 있지만, 서로 다른 보상을 한꺼번에 사용하면 모델이 어떤 업데이트가 영상과 음향 중 어느 부분을 개선했는지 파악하기 어려워집니다.
AV-GRPO는 이 문제를 학습 과정의 분해로 다루는 온라인 확산 강화학습 프레임워크입니다. 두 모달리티 타워를 항상 함께 최적화하지 않고, 한쪽 모달리티를 기준점으로 삼아 샘플 생성과 보상 비교를 구성합니다. 이를 통해 결합된 다중 모달 선호학습을 더 다루기 쉬운 단일 모달리티 하위 문제로 바꾸는 것이 핵심입니다.
핵심 설계
- 모달리티 앵커 롤아웃: 한 모달리티를 기준으로 삼아 샘플 난도와 비교 조건을 안정화합니다. 서로 다른 보상 신호가 뒤섞이는 것을 줄여 어떤 학습 신호가 중요한지 더 분명하게 만듭니다.
- 궤적 고정형 동결 타워 최적화: 한 모달리티를 업데이트할 때 다른 타워를 동결하고 관련 생성 궤적을 고정합니다. 서로 다른 동역학을 가진 두 타워를 동시에 최적화하는 비용을 낮추고, 보상을 실제 업데이트 대상에 더 정확히 배분하려는 방식입니다.
- 모달리티 적응형 목표와 섭동: 오디오와 비디오는 확산 섭동에 대한 민감도와 학습 속도가 다릅니다. AV-GRPO는 동일한 설정을 강제하지 않고 각 모달리티에 맞춰 목표와 섭동 강도를 조정합니다.
5DAV 데이터셋도 함께 제안됩니다. 이 데이터셋은 샘플을 다섯 가지 차원으로 분리하고 난도를 조절할 수 있도록 설계돼, 모달리티별 능력과 오디오·비디오 동기화를 체계적으로 학습하고 분석하는 데 초점을 둡니다.
평가와 의미
논문은 JavisBench와 VABench에서 AV-GRPO를 평가하고, LTX-2.3을 기반으로 LoRA와 전체 파라미터 미세조정을 비교합니다. 제공된 초록에 따르면 AV-GRPO는 생성 품질, 의미 정렬, 오디오·비디오 동기화에서 LTX-2.3 기준선보다 나은 결과를 보였으며, 제거 실험을 통해 주요 설계의 기여도도 확인했습니다.
이 연구의 중요한 점은 멀티모달 강화학습을 단순히 보상 항목을 더하는 문제로 보지 않는다는 데 있습니다. 동기화 평가는 짝을 이루는 샘플의 난도에 영향을 받을 수 있으므로, 모달리티를 기준으로 삼는 전략은 보상 비교를 더 공정하게 만들 가능성이 있습니다. 또한 다른 타워를 동결하면 계산량과 모달리티 간 간섭을 동시에 줄일 수 있습니다.
다만 제공된 자료에는 세부 지표 수치, 보상 모델의 구성, 긴 영상이나 복잡한 음향 환경에서의 일반화 결과가 제시되지 않았습니다. 실제 개선 폭을 판단하려면 논문 전문과 공개 코드에 대한 추가 검토가 필요합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…