Kandinsky 6.0 Video, 영상·음성·립싱크를 한 번에 생성
들어가며
영상 생성 모델의 경쟁력은 더 이상 화면의 선명도만으로 결정되지 않습니다. 인물이 말하는 장면이라면 대사와 목소리, 얼굴 움직임과 입 모양이 같은 시간축에서 맞아야 합니다. Kandinsky Lab이 공개한 Kandinsky 6.0 Video는 이 문제를 영상 생성 후 음성을 덧붙이는 방식이 아니라, 음성과 영상을 함께 생성하는 문제로 다룹니다.
제품군은 30억 개 파라미터의 Kandinsky 6.0 Video Lite와 290억 개 파라미터의 Pro로 구성됩니다. 두 모델 모두 텍스트 또는 이미지를 입력으로 받아 약 5초 길이의 영상과 동기화된 44kHz 음성을 만들며, 립싱크도 지원합니다. 내장 초해상도 모델을 활용하면 결과를 Full HD, 즉 1920×1080 해상도까지 높일 수 있습니다.
핵심 구조: 서로 정보를 주고받는 두 스트림
Kandinsky 6.0 Video의 핵심은 듀얼 스트림 CrossDiT 아키텍처입니다. 사전 학습된 영상 스트림과 새로 학습한 음성 스트림을 분리해 두고, 양방향 크로스 어텐션으로 연결합니다. 음성을 단순한 후처리 트랙으로 취급하지 않고, 생성 과정에서 영상과 상호작용시키는 설계입니다.
이 접근이 중요한 이유는 동기화가 단순히 시작 시점을 맞추는 작업이 아니기 때문입니다. 말의 리듬과 내용은 얼굴과 몸의 움직임에 영향을 주고, 장면의 시각 정보는 어떤 소리와 대사가 어울리는지에 대한 단서가 됩니다. 두 스트림이 서로의 정보를 활용하면, 생성이 끝난 뒤 별도 도구로 입 모양이나 타임라인을 수정하는 부담을 줄일 수 있습니다.
학습 과정도 단계적으로 구성됩니다. 먼저 대규모 음성 데이터로 음성 스트림을 처음부터 학습한 뒤, 음성과 영상이 쌍으로 구성된 데이터에서 두 스트림을 함께 훈련합니다. 이 과정에서는 음성 단독과 영상 단독 품질을 유지하는 것도 목표로 삼았습니다. 이후 지도 미세 조정, 강화학습 기반 후처리, 지식 증류를 적용합니다. 제공된 자료는 10단계 생성이 가능한 증류 설정도 언급하고 있어, 대형 Pro 모델의 추론 부담을 낮추려는 방향을 보여줍니다.
평가에서 나타난 장점
자료에 포함된 VABench 결과에 따르면 Kandinsky 6.0 Video Pro는 비교 대상으로 제시된 LTX 2.5, Kandinsky Lite, Kandinsky Pro 가운데 음성 품질, 오디오 미학, 음영상 정렬, 립싱크, 비동기 정도, 시각적 사실성에서 가장 높은 결과를 기록했습니다.
사람이 직접 비교한 평가에서는 이전 세대인 Kandinsky 5.0 Video Pro보다 분명히 높은 선호를 얻었습니다. LTX 2.5와 비교했을 때도 시각 품질, 동작의 현실감, 프롬프트 반영, 아티팩트 감소, 종합 과제 해결력에서 Pro가 더 선호됐으며, 음성 품질에서는 통계적으로 유의한 우위가 보고됐습니다. 또한 강화학습 기반 후학습으로 Pro의 음성 단어 오류율이 47% 감소했다고 자료는 설명합니다.
초해상도와 오픈소스 공개
별도로 14억 개 파라미터의 영상 초해상도 확산 트랜스포머도 공개됐습니다. 이 모델은 KVAE 잠재 공간에서 영상을 처리하며 ×2, ×2.25, ×4 확대를 지원합니다. 증류된 π-Flow DX 버전은 타일마다 두 번의 모델 평가만 필요하다고 소개됐습니다.
코드, 체크포인트, Diffusers 통합은 MIT 라이선스로 제공됩니다. 짧은 영상, 캐릭터 대화, 교육용 콘텐츠, 미디어 프로토타이핑에서는 별도 더빙과 립싱크 보정 작업을 줄일 여지가 있습니다. 다만 공개 설명의 중심은 약 5초 클립입니다. 긴 영상의 서사 일관성, 여러 인물의 대화, 음성과 인물 정체성의 안정성, 실제 서비스에 필요한 계산 비용은 추가 검증이 필요합니다. 이 프로젝트의 의미는 단일 화질 지표를 넘어, 소리와 움직임과 의미를 하나의 생성 프레임 안에서 다루려 했다는 데 있습니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…