아티클 목록으로
비전·비디오

DM-Align, 동영상 생성의 증류와 선호 정렬을 한 번에 수행

약 3분 소요

들어가며

실용적인 동영상 생성 모델은 높은 화질과 충실도뿐 아니라 사용자 지시와 인간의 선호를 반영하면서도 낮은 샘플링 비용을 유지해야 한다. 지금까지는 모델을 가볍게 만드는 증류와 출력 결과를 사람의 평가에 맞추는 정렬을 서로 다른 단계로 나누는 경우가 많았다.

하지만 이런 순차적 구성에는 한계가 있다. 증류 전에 강화학습을 수행하면 학습 비용이 커지고, 증류 뒤에 강화학습을 적용하면 이미 얻은 선호 정렬 능력이 약해지거나 모델이 불안정해질 수 있다. arXiv 논문 「Joint Alignment and Distillation for Video Generation via Sample-Guided Distribution Matching」은 이 두 목표를 하나의 최적화 과정에서 처리하는 DM-Align을 제시한다.

핵심 아이디어

  • 증류 방향을 유지한다. 표준 분포 매칭은 참조 모델과 생성 모델 사이의 분포 차이를 줄인다. 이를 통해 더 가벼운 생성기가 선명도와 높은 충실도를 유지하도록 한다.
  • 선호 유도 방향을 추가한다. DM-Align은 샘플 수준의 분포 차이에서 보완적인 그래디언트를 만들고, 단순히 참조 모델을 모방하는 대신 사람이 더 선호하는 출력 쪽으로 생성 분포를 이동시킨다.
  • 두 종류의 선호 신호를 활용한다. 선호 쌍이 있는 경우에는 DPO에서 아이디어를 얻고, 하나의 그룹 안에서 여러 결과를 탐색하는 경우에는 GRPO와 유사하게 상대적인 샘플 정보를 이용한다.
  • 강화학습 절차를 단순화한다. 논문에 따르면 이 방식은 여러 단계의 보상 평가와 기존 강화학습 과정에서 필요한 ODE-SDE 변환을 요구하지 않는다.

의미와 영향

이 연구의 핵심은 단순히 새로운 손실 함수를 추가하는 데 있지 않다. 증류 그래디언트는 생성 품질과 효율을 지키고, 정렬 그래디언트는 출력 분포를 인간이 선호하는 방향으로 조정한다. 서로 다른 역할을 하는 두 방향을 같은 단계에서 결합함으로써, 먼저 정렬한 뒤 압축할 때 생기는 능력 손실이나 압축 후 강화학습에 따르는 비용과 불안정성을 줄일 가능성이 있다.

낮은 지연시간과 높은 품질을 동시에 요구하는 동영상 생성 서비스라면 이 접근법이 특히 주목할 만하다. 또한 보상 모델과 반복적인 궤적 평가에 의존하는 긴 학습 절차 대신, 샘플에서 직접 얻은 분포 정보를 활용한다는 점도 장점으로 볼 수 있다.

다만 제공된 자료에는 구체적인 데이터셋, 평가 지표, 학습 비용, 세부적인 절제 실험 결과가 포함되어 있지 않다. 여러 기반 동영상 모델에서 단독 방식과 순차적 2단계 파이프라인을 앞섰다는 보고가 다른 모델 계열과 선호 데이터에서도 유지되는지는 본문 전체를 통한 확인이 필요하다.

종합하면 DM-Align은 동영상 생성의 ‘가속’과 ‘인간 선호 정렬’을 직렬 과정에서 공동 최적화로 전환하려는 시도다. 강화학습 의존도를 낮추고 증류 이후의 성능 저하를 완화할 수 있는 하나의 유망한 방향을 제시한다.

출처: arXiv

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
ShallowStream: 얕은 층으로 색인하고 깊은 층으로 답하는 영상 이해
비전·비디오
cctest.ai
비전·비디오

ShallowStream: 얕은 층으로 색인하고 깊은 층으로 답하는 영상 이해

ShallowStream은 MLLM의 얕은 층을 활용해 스트리밍 영상의 프레임 인코딩과 검색 색인 구축을 수행하고, 질의가 들어올 때만 깊은 층을 사용합니다. 논문은 프레임별 프리필 지연을 최대 52.1배, 10초 엔드투엔드 지연을 최대 11.9배 줄였다고 보고합니다.

더 보기
CCTest · Blog
장시간 동영상 모델은 시각 토큰을 어떻게 배분해야 할까
비전·비디오
cctest.ai
비전·비디오

장시간 동영상 모델은 시각 토큰을 어떻게 배분해야 할까

장시간 동영상 멀티모달 모델에서 프레임 선택, 공간 압축, 절약한 예산의 재투자를 분리해 비교한 연구가 나왔다. 결과적으로 중요한 것은 프레임을 무조건 선명하게 만드는 것이 아니라, 질문과 관련된 시간적 증거를 더 넓게 확보하는 것으로 나타났다.

더 보기
CCTest · Blog
Gemini, 볼 곳을 스스로 찾는 에이전틱 동영상 이해 기능 공개
비전·비디오
cctest.ai
비전·비디오

Gemini, 볼 곳을 스스로 찾는 에이전틱 동영상 이해 기능 공개

Google DeepMind가 Gemini에 Agentic Video Understanding을 도입했습니다. 모델이 영상, 오디오, 자막을 상황에 맞게 검색하고 다시 확인하며, 공식 벤치마크에서 토큰 사용량은 최대 88%, 비용은 최대 66% 줄고 정확도는 최대 7% 향상됐다고 밝혔습니다.

더 보기