GAE, 3D 일관성 있는 세계 생성을 위한 기하 네이티브 잠재공간 제안
들어가며
최근 영상 생성 모델은 한 장면을 사실적으로 만드는 데 매우 강력하지만, 카메라가 움직일 때도 하나의 3D 장면을 일관되게 유지한다고 보기는 어렵습니다. 프레임마다 물체의 형태나 공간적 관계가 조금씩 달라질 수 있기 때문입니다. GAE(Geometry-Native Autoencoder)는 이 문제의 원인이 생성기뿐 아니라 생성이 이루어지는 잠재공간의 설계에도 있다고 봅니다.
핵심 내용
- 잠재공간에 기하를 직접 반영합니다. 일반적인 시각 생성 모델의 잠재 표현은 색상, 질감, 국소적 외관을 중심으로 구성되는 경우가 많습니다. GAE는 기하 기반 모델의 특징을 재매개변수화해 의미 정보와 시점 간 구조를 담은 압축 표현을 만듭니다.
- 하나의 상태에서 여러 결과를 복원합니다. GAE의 잠재 표현은 RGB 외관, 깊이, 카메라 정보, 3D 포인트 맵으로 함께 디코딩될 수 있습니다. 서로 독립적인 프레임을 생성하는 대신 여러 관측을 설명하는 통합 장면 상태를 다루는 방식입니다.
- 조건부 생성 모델과 결합됩니다. 연구진은 이 기하 네이티브 표현 위에 조건부 플로 모델을 사용하고, 카메라 궤적을 조건으로 제공합니다. 생성된 영상의 시점 변화와 장면 기하 사이의 관계를 입력 단계에서 명시할 수 있게 한 것입니다.
- 시각적 품질과 3D 구조를 함께 평가합니다. 생성기와 학습 프로토콜을 고정한 비교에서 GAE를 사용하면 RealEstate10K의 FVD가 12.7%, DL3DV의 FVD가 23.1% 낮아졌습니다. RealEstate10K에서는 카메라 궤적 오차도 절반으로 감소했습니다.
의미와 영향
GAE의 핵심은 영상 모델에 깊이 예측 출력을 하나 더 붙이는 데 있지 않습니다. 생성기가 사용하는 내부 표현 자체를 기하 정보를 포함하는 형태로 바꾸는 데 있습니다. 잠재변수가 시점 간 관계를 이미 담고 있다면, 생성기는 사실적인 외관을 합성하는 동시에 물체와 카메라의 공간적 관계를 더 안정적으로 유지할 수 있습니다. 따라서 GAE는 기하를 추정하는 인식 모델과 다양한 결과를 만드는 생성 모델 사이를 연결하는 공통 인터페이스로 볼 수 있습니다.
이 접근은 월드 모델, 제어 가능한 영상 생성, 새로운 시점 합성에 적용될 가능성이 있습니다. 다만 더 긴 영상과 복잡한 장면에서도 같은 잠재공간이 확장될 수 있는지, 여러 정보를 공동으로 복원하는 과정이 질감의 세부 표현이나 생성 다양성을 제한하지 않는지는 추가 검증이 필요합니다. 그럼에도 GAE는 3D 일관성을 높이려면 생성기 구조뿐 아니라 잠재공간 자체를 재설계해야 한다는 점을 분명히 보여줍니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…