Vidu S2, 실시간 아바타·영상 편집·공간 영상 생성으로 확장
들어가며
기존 영상 생성 모델은 대체로 프롬프트를 입력한 뒤 처리를 기다리고, 완성된 클립을 받는 오프라인 작업 흐름에 맞춰져 있다. 이 방식에서는 생성 도중 캐릭터나 장면을 바꾸기 어렵고, 실시간 상호작용에도 한계가 있다. Vidu S2는 디지털 아바타 생성과 영상 편집을 모두 실시간 처리 문제로 다룬다. 사용자의 지시, 참고 이미지, 입력 영상이 변하면 결과도 계속 조정하는 방식이다.
두 가지 모델
Vidu S2는 서로 다른 작업을 담당하는 두 모델로 구성된다.
- Vidu S2-Avatar: 대화형 디지털 캐릭터를 위한 모델이다. 공개된 설명에 따르면 720p 영상을 25~42 FPS로 실시간 생성하며, 춤과 같은 동작 지시를 더 잘 따르고 전신 움직임도 표현한다. 상호작용 중 새로운 참고 이미지를 추가해 의상과 물체, 장면을 바꿀 수 있다.
- Vidu S2-Editing: 입력되는 영상 스트림을 실시간으로 변환한다. 원본 영상의 움직임과 타이밍을 유지하면서 스타일 렌더링, 가상 착용, 인물 교체, 배경 교체를 수행하는 것이 목표다.
두 모델이 해결해야 하는 문제는 다르다. 아바타 모델은 인물의 정체성, 동작의 연속성, 지시 이해가 중요하다. 반면 편집 모델은 원본의 동작과 시간 구조를 유지한 채 영상 요소를 바꿔야 한다. 따라서 실시간 영상 모델의 발전은 단순히 해상도를 높이는 문제로만 볼 수 없다.
일회성 생성에서 지속적인 제어로
S2-Avatar의 주요 특징은 생성 도중 참고 정보를 업데이트할 수 있다는 점이다. 일반적인 작업에서는 캐릭터의 옷이나 배경을 바꾸려면 전체 영상을 다시 생성해야 할 수 있다. 동적 참고 기능이 안정적으로 작동한다면 사용자는 세션을 종료하지 않고도 외형과 환경을 수정할 수 있다.
S2-Editing은 완성된 파일뿐 아니라 입력 중인 영상도 대상으로 삼는다. 실시간 가상 진행자, 라이브 공연, 가상 착용, 대화형 콘텐츠 제작 등이 가능한 활용 사례다. 다만 제공된 자료에는 세부 지연 시간, 요구 하드웨어, 상용 배포 조건이 제시되지 않았다. 따라서 소개된 기능을 모든 실제 제작 환경에서 이미 충분히 검증된 기능으로 해석해서는 안 된다.
공간 영상으로의 확장
Vidu S2는 아바타와 편집 영상 모두에서 실시간 공간 영상 생성 가능성도 탐색한다. 입체 영상은 좌우 시점의 이미지를 만드는 것뿐 아니라 깊이, 움직임, 장면 구조를 일관되게 유지해야 한다. 일반적인 2D 영상 생성보다 기하학적 안정성이 더 중요하다.
이 방향은 VR 캐릭터, 몰입형 라이브, 공간 콘텐츠 제작으로 이어질 가능성이 있다. 그러나 공개된 설명만으로는 지원 기기, 깊이 품질, 사용자 평가에 대한 구체적인 내용을 확인하기 어렵다. 현재로서는 완전히 검증된 제품 사양이라기보다 연구 및 제품 확장을 위한 방향으로 보는 편이 적절하다.
평가 결과를 어떻게 볼 것인가
개발 측은 아바타 생성과 영상 편집을 아우르는 5개 공개 벤치마크에서 Vidu S2가 모든 비교 기준을 앞섰다고 설명한다. 이는 특정 오프라인 지표 하나가 아니라 생성 품질, 편집, 실시간 상호작용을 함께 최적화하려는 접근으로 볼 수 있다. 다만 제공된 자료에는 벤치마크 이름, 점수, 실험 조건이 포함되어 있지 않으므로 자세한 성능 비교는 기술 보고서를 확인해야 한다.
Vidu S2의 의미는 영상을 한 번 만들고 끝내는 생성기에서, 계속 지시하고 수정할 수 있는 미디어 도구로 이동하려는 데 있다. 실제 활용 가능성은 인물 일관성, 동작 안정성, 화질, 지연 시간, 비용을 현실적인 조건에서 함께 만족할 수 있는지에 달려 있다. 이 과제가 해결된다면 실시간 아바타와 편집 가능한 영상 스트림은 창작 도구와 몰입형 서비스의 새로운 인터페이스가 될 수 있다.
온라인 데모: Vidu Stream
댓글
로그인 상태 확인 중…
댓글 불러오는 중…