아티클 목록으로
비전·비디오

Vidu S2, 실시간 아바타·영상 편집·공간 영상 생성으로 확장

약 4분 소요

들어가며

기존 영상 생성 모델은 대체로 프롬프트를 입력한 뒤 처리를 기다리고, 완성된 클립을 받는 오프라인 작업 흐름에 맞춰져 있다. 이 방식에서는 생성 도중 캐릭터나 장면을 바꾸기 어렵고, 실시간 상호작용에도 한계가 있다. Vidu S2는 디지털 아바타 생성과 영상 편집을 모두 실시간 처리 문제로 다룬다. 사용자의 지시, 참고 이미지, 입력 영상이 변하면 결과도 계속 조정하는 방식이다.

두 가지 모델

Vidu S2는 서로 다른 작업을 담당하는 두 모델로 구성된다.

  • Vidu S2-Avatar: 대화형 디지털 캐릭터를 위한 모델이다. 공개된 설명에 따르면 720p 영상을 25~42 FPS로 실시간 생성하며, 춤과 같은 동작 지시를 더 잘 따르고 전신 움직임도 표현한다. 상호작용 중 새로운 참고 이미지를 추가해 의상과 물체, 장면을 바꿀 수 있다.
  • Vidu S2-Editing: 입력되는 영상 스트림을 실시간으로 변환한다. 원본 영상의 움직임과 타이밍을 유지하면서 스타일 렌더링, 가상 착용, 인물 교체, 배경 교체를 수행하는 것이 목표다.

두 모델이 해결해야 하는 문제는 다르다. 아바타 모델은 인물의 정체성, 동작의 연속성, 지시 이해가 중요하다. 반면 편집 모델은 원본의 동작과 시간 구조를 유지한 채 영상 요소를 바꿔야 한다. 따라서 실시간 영상 모델의 발전은 단순히 해상도를 높이는 문제로만 볼 수 없다.

일회성 생성에서 지속적인 제어로

S2-Avatar의 주요 특징은 생성 도중 참고 정보를 업데이트할 수 있다는 점이다. 일반적인 작업에서는 캐릭터의 옷이나 배경을 바꾸려면 전체 영상을 다시 생성해야 할 수 있다. 동적 참고 기능이 안정적으로 작동한다면 사용자는 세션을 종료하지 않고도 외형과 환경을 수정할 수 있다.

S2-Editing은 완성된 파일뿐 아니라 입력 중인 영상도 대상으로 삼는다. 실시간 가상 진행자, 라이브 공연, 가상 착용, 대화형 콘텐츠 제작 등이 가능한 활용 사례다. 다만 제공된 자료에는 세부 지연 시간, 요구 하드웨어, 상용 배포 조건이 제시되지 않았다. 따라서 소개된 기능을 모든 실제 제작 환경에서 이미 충분히 검증된 기능으로 해석해서는 안 된다.

공간 영상으로의 확장

Vidu S2는 아바타와 편집 영상 모두에서 실시간 공간 영상 생성 가능성도 탐색한다. 입체 영상은 좌우 시점의 이미지를 만드는 것뿐 아니라 깊이, 움직임, 장면 구조를 일관되게 유지해야 한다. 일반적인 2D 영상 생성보다 기하학적 안정성이 더 중요하다.

이 방향은 VR 캐릭터, 몰입형 라이브, 공간 콘텐츠 제작으로 이어질 가능성이 있다. 그러나 공개된 설명만으로는 지원 기기, 깊이 품질, 사용자 평가에 대한 구체적인 내용을 확인하기 어렵다. 현재로서는 완전히 검증된 제품 사양이라기보다 연구 및 제품 확장을 위한 방향으로 보는 편이 적절하다.

평가 결과를 어떻게 볼 것인가

개발 측은 아바타 생성과 영상 편집을 아우르는 5개 공개 벤치마크에서 Vidu S2가 모든 비교 기준을 앞섰다고 설명한다. 이는 특정 오프라인 지표 하나가 아니라 생성 품질, 편집, 실시간 상호작용을 함께 최적화하려는 접근으로 볼 수 있다. 다만 제공된 자료에는 벤치마크 이름, 점수, 실험 조건이 포함되어 있지 않으므로 자세한 성능 비교는 기술 보고서를 확인해야 한다.

Vidu S2의 의미는 영상을 한 번 만들고 끝내는 생성기에서, 계속 지시하고 수정할 수 있는 미디어 도구로 이동하려는 데 있다. 실제 활용 가능성은 인물 일관성, 동작 안정성, 화질, 지연 시간, 비용을 현실적인 조건에서 함께 만족할 수 있는지에 달려 있다. 이 과제가 해결된다면 실시간 아바타와 편집 가능한 영상 스트림은 창작 도구와 몰입형 서비스의 새로운 인터페이스가 될 수 있다.

온라인 데모: Vidu Stream

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
ShallowStream: 얕은 층으로 색인하고 깊은 층으로 답하는 영상 이해
비전·비디오
cctest.ai
비전·비디오

ShallowStream: 얕은 층으로 색인하고 깊은 층으로 답하는 영상 이해

ShallowStream은 MLLM의 얕은 층을 활용해 스트리밍 영상의 프레임 인코딩과 검색 색인 구축을 수행하고, 질의가 들어올 때만 깊은 층을 사용합니다. 논문은 프레임별 프리필 지연을 최대 52.1배, 10초 엔드투엔드 지연을 최대 11.9배 줄였다고 보고합니다.

더 보기
CCTest · Blog
DM-Align, 동영상 생성의 증류와 선호 정렬을 한 번에 수행
비전·비디오
cctest.ai
비전·비디오

DM-Align, 동영상 생성의 증류와 선호 정렬을 한 번에 수행

arXiv 연구가 동영상 생성 모델의 증류와 인간 선호 정렬을 단일 단계에서 결합하는 DM-Align을 제안했다. 샘플 분포 차이로 선호 유도 그래디언트를 구성해 기존 강화학습 파이프라인의 계산량과 불안정성을 줄이는 것이 목표다.

더 보기
CCTest · Blog
장시간 동영상 모델은 시각 토큰을 어떻게 배분해야 할까
비전·비디오
cctest.ai
비전·비디오

장시간 동영상 모델은 시각 토큰을 어떻게 배분해야 할까

장시간 동영상 멀티모달 모델에서 프레임 선택, 공간 압축, 절약한 예산의 재투자를 분리해 비교한 연구가 나왔다. 결과적으로 중요한 것은 프레임을 무조건 선명하게 만드는 것이 아니라, 질문과 관련된 시간적 증거를 더 넓게 확보하는 것으로 나타났다.

더 보기