아티클 목록으로
비전·비디오

4DAnyone: 일반 단안 영상에서 동적 4D 인물 재구성

약 4분 소요

들어가며

일반 카메라로 촬영한 한 편의 인물 영상만으로 자유로운 시점에서 볼 수 있는 동적 3D 인물을 만드는 것은 4D 비전의 중요한 목표입니다. 하지만 단안 영상에는 하나의 관찰 방향만 담겨 있습니다. 시스템은 보이지 않는 영역을 추정하는 동시에 인물의 정체성, 의상과 질감, 신체 구조, 움직임을 시점과 시간에 걸쳐 일관되게 유지해야 합니다. 4DAnyone은 보정되지 않은 단안 영상에서 다중 시점 영상을 생성한 뒤, 이를 4D Gaussian Splatting(4DGS)으로 변환하는 접근을 제시합니다.

왜 다중 시점 확장이 어려운가

카메라 제어형 비디오 확산 모델은 그럴듯한 새로운 시점의 영상을 만들 수 있습니다. 그러나 4D 재구성에는 수십 개의 목표 시점이 필요할 수 있어, 보기 좋은 결과만으로는 충분하지 않습니다. DiT의 한 번의 순전파에서 모든 시점을 처리하기 어렵기 때문에 목표 시점을 여러 그룹으로 나누면 두 가지 문제가 생깁니다.

  • 참조 컨텍스트가 계속 커집니다. 새로 생성된 모든 시점을 다음 생성의 참조로 사용하면 컨텍스트가 시점 수에 따라 증가합니다. 규모가 커질수록 외관 안내가 약해져 의상, 텍스처, 인물의 고유한 모습이 흔들릴 수 있습니다.
  • 목표 그룹이 서로 고립됩니다. 별도로 처리되는 그룹은 직접 정보를 주고받기 어렵습니다. 그 결과 신체 비율, 표면 형태, 전체 구조에서 작은 차이가 누적될 수 있습니다.

4DAnyone은 두 문제를 서로 보완하는 방식으로 다룹니다. Reference Context Packing(RCP)은 증가하는 참조 시점을 고정 길이의 혼합 해상도 컨텍스트로 압축합니다. 이를 통해 참조 측 컨텍스트 복잡도를 시점 수에 대해 O(1)로 유지하면서 여러 해상도의 외관 단서를 보존하려 합니다.

Target Context Routing(TCR)은 디노이징 과정에서 목표 시점의 그룹 구성을 회전시킵니다. 노이즈가 큰 초기 단계에서는 서로 다른 그룹이 구조 정보를 폭넓게 공유하도록 하고, 노이즈가 낮은 후반 단계에서는 세부 정보를 안정화하는 데 집중합니다. 고정된 그룹 분할이 만드는 단절을 완화해 전체적인 구조 일관성을 높이려는 설계입니다.

생성된 다중 시점 영상은 최종 결과라기보다 4DGS 재구성을 위한 중간 단계입니다. 따라서 이 접근에서 비디오 확산 모델은 단순히 다른 각도의 영상을 합성하는 역할을 넘어, 단안 촬영에서 빠진 공간 정보를 보충하는 연결 고리로 사용됩니다.

데이터와 평가

연구진은 자체 게임 엔진으로 MVGameHuman 데이터셋을 구축하고, 라이트 스테이지 데이터와 실제 환경 영상 데이터셋을 함께 학습에 사용했습니다. DNA-Rendering과 DyMVHumans에서의 실험 결과, 4DAnyone이 기존 방법보다 새로운 시점 영상 품질과 후속 4DGS 재구성 모두에서 더 나은 성능을 보였으며 실제 환경 영상에도 견고하게 일반화했다고 보고합니다. 제공된 자료에는 구체적인 수치가 없으므로 향상 폭을 정량적으로 평가할 수는 없습니다.

의미와 남은 과제

이 연구의 핵심 의미는 다중 시점 일관성을 단순한 생성 품질 문제가 아니라 컨텍스트 관리 문제로 다뤘다는 데 있습니다. RCP는 참조 정보가 늘면서 발생하는 외관 안내 약화를 줄이고, TCR은 그룹 분할로 생기는 전역 조정 부족을 보완합니다. 두 설계는 확산 모델의 컨텍스트 용량과 동적 재구성에 필요한 많은 시점 사이의 간극을 겨냥합니다.

이 방식은 디지털 휴먼, 가상 피팅, 게임 캐릭터 제작, 영상 프리비주얼라이제이션, 원격 상호작용의 촬영 부담을 낮출 가능성이 있습니다. 다만 단안 입력에 따른 가림, 깊이 모호성, 빠른 움직임 문제는 여전히 남아 있습니다. 생성 모델이 실제 인물과 다른 내용을 보완할 가능성도 있으므로, 4DAnyone은 단안 비전의 불확실성을 완전히 없애는 해법이라기보다 4D 인물 재구성에 대한 접근성을 높이는 생성 기반 경로로 이해하는 편이 타당합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
JoyAI-Video-Edit: 실시간 개방형 비디오 편집을 위한 자기회귀 확산
비전·비디오
cctest.ai
비전·비디오

JoyAI-Video-Edit: 실시간 개방형 비디오 편집을 위한 자기회귀 확산

미래 프레임 없이, 길이도 미리 정하지 않은 상태에서 비디오를 편집하는 것은 쉽지 않습니다. JoyAI-Video-Edit는 자기회귀 확산과 증류 전략을 결합해 실시간성과 원본 보존을 함께 노립니다.

더 보기
CCTest · Blog
InfiniSplat: 단일 이미지 3DGS를 표면 정렬 표현으로 확장하다
비전·비디오
cctest.ai
비전·비디오

InfiniSplat: 단일 이미지 3DGS를 표면 정렬 표현으로 확장하다

InfiniSplat은 한 장의 이미지에서 큰 시점 변화에도 더 일관된 3D Gaussian Splatting 표현을 생성하려는 프레임워크입니다. 픽셀 격자 중심 예측 대신 기하 기반 샘플링과 암시적 가우시안 디코딩을 사용합니다.

더 보기