아티클 목록으로
멀티모달

DreamX-Creator, 7B 모델로 네이티브 오디오·비디오 생성

약 3분 소요

들어가며

최근 영상 생성 모델 가운데는 오디오를 아예 생성하지 않거나, 영상을 만든 뒤 별도의 단계에서 음향을 합성하는 경우가 많습니다. 이런 분리 방식은 구현에는 유리하지만 화면의 움직임과 음향 이벤트가 발생하는 시점을 생성 과정에서 서로 제약하기는 어렵습니다. DreamX-Creator 1.0은 오디오와 비디오를 하나의 생성 과정에서 다루는 방향을 택했습니다. 7B 규모의 생성기를 중심으로 첫 프레임과 텍스트 프롬프트를 입력받아 두 모달리티를 함께 생성합니다.

핵심 기술

  • 네이티브 공동 생성. 오디오와 비디오에 각각 특화된 스트림을 두되, 동일한 디노이징 과정에서 함께 업데이트합니다. 오디오를 영상 생성 이후에 추가하는 후처리 요소로만 보지 않는다는 점이 핵심입니다.
  • 통제된 모달리티 결합. 네트워크 전반부에서는 두 스트림을 독립적으로 처리하고, 후반부에서 Gated Cross-Modal Attention으로 정보를 교환합니다. 토큰과 어텐션 헤드 단위의 출력 게이트가 교차 모달 신호를 조절해 불필요한 간섭을 줄이는 역할을 합니다.
  • 통합 데이터 시스템. 시간적으로 일치하는 클립을 구성하고 필터링하며, 구조화된 멀티모달 주석을 생성합니다. 또한 능력별 데이터 풀을 구성해 모델 구조뿐 아니라 학습 데이터 측면에서도 오디오·비디오 동기화를 지원합니다.
  • 단계적 학습과 모달리티별 피드백. 두 단계의 오디오·비디오 사전학습 뒤 고품질 파인튜닝을 수행합니다. 이후 강화학습에서는 비디오, 오디오, 두 모달리티의 관계를 평가하는 피드백을 각각 해당 스트림으로 전달합니다.
  • 2K 추론 효율화. 양방향 다단계 교사 모델을 자기회귀형 다단계 리파이너로 바꾸고, 시간 청크마다 한 번의 디노이징 평가만 필요한 학생 모델로 증류합니다.

의미와 한계

DreamX-Creator의 의미는 2K 해상도 자체보다 음향과 시각의 관계를 생성기 내부에서 모델링하려는 데 있습니다. 충돌, 악기 연주, 기계 작동, 사람의 동작처럼 움직임과 소리가 시간적으로 긴밀하게 연결된 장면에서는 두 모달리티의 공동 생성이 유용한 표현 공간을 제공할 수 있습니다. 영상과 음향을 각각 만든 뒤 맞추는 방식보다, 생성 단계에서 서로의 정보를 참조할 수 있는 구조를 직접 마련한 셈입니다.

이 프로젝트는 네이티브 멀티모달 생성이 단일 아키텍처만의 문제가 아니라는 점도 보여줍니다. 시간 일관성이 있는 데이터, 단계별 학습, 모달리티별 평가 신호, 고해상도 추론 최적화가 함께 설계되어야 합니다. 7B 생성기와 2K 리파이너를 공개하면 연구자들이 통합형 오디오·비디오 생성을 실험할 수 있는 진입 장벽을 낮출 가능성이 있습니다.

다만 제공된 자료는 최신 오픈소스 시스템과 경쟁력 있는 성능을 보인다고만 설명하며, 구체적인 벤치마크와 데이터 규모, 점수는 제시하지 않습니다. 따라서 모든 지표에서 앞선다고 단정해서는 안 됩니다. 장시간 동기화, 크로스모달 평가의 신뢰성, 실제 하드웨어에서의 계산 비용은 앞으로 확인해야 할 과제입니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
JoyAI-Echo-1.5, 지속형 스토리와 인터랙티브 월드를 위한 장기 오디오·비주얼 생성
멀티모달
cctest.ai
멀티모달

JoyAI-Echo-1.5, 지속형 스토리와 인터랙티브 월드를 위한 장기 오디오·비주얼 생성

JoyAI-Echo-1.5는 장편 영상에서 인물의 외모와 목소리를 유지하고, 사용자 조작에 반응하는 인터랙티브 월드 생성을 목표로 하는 통합 오디오·비주얼 시스템입니다.

더 보기
CCTest · Blog
‘보는 것’에서 ‘행동하는 것’으로: 1인칭 지능 플랫폼이 되는 스마트 안경
멀티모달
cctest.ai
멀티모달

‘보는 것’에서 ‘행동하는 것’으로: 1인칭 지능 플랫폼이 되는 스마트 안경

새로운 서베이는 스마트 안경을 단순한 카메라나 디스플레이가 아니라 1인칭 지능 플랫폼으로 재정의한다. 핵심은 인식부터 행동까지의 고리를 실제 제약 속에서도 신뢰성 있고 교정 가능하게 유지하는 데 있다.

더 보기
CCTest · Blog
LAION-BVD, 멀티모달 사전학습을 위한 1천만 시간 공개 동영상 데이터셋
멀티모달
cctest.ai
멀티모달

LAION-BVD, 멀티모달 사전학습을 위한 1천만 시간 공개 동영상 데이터셋

LAION-BVD는 웹에서 수집한 동영상 URL을 바탕으로 약 8천만 개의 영상과 총 1천만 시간 분량을 제공하는 공개 데이터셋입니다. 장면 분할, 합성 캡션, 장면 전환 프레임 추출을 통해 영상·음성·이미지 사전학습을 지원합니다.

더 보기