WorldRover, 탐색 가능한 세계 모델을 위한 풍부한 합성 영상 엔진
들어가며
탐색 가능한 세계를 이해하거나 재구성하는 모델을 학습하려면 RGB 영상만으로는 부족합니다. 카메라가 어떻게 움직였는지, 장면의 기하 구조가 어떻게 유지되는지, 시간 간격이 긴 영상에서 같은 점과 물체를 어떻게 대응시킬지, 관측을 어떤 행동 신호와 연결할지까지 필요합니다. 실제 촬영은 일부 정보를 제공하지만, 조밀한 기하와 장거리 대응 관계는 추정 과정이나 전문 장비에 의존하는 경우가 많습니다.
WorldRover는 이 문제를 렌더링 단계에서 해결하려는 접근입니다. 핵심 구성 요소인 WorldRover-Engine은 Unreal Engine 기반으로 동작하며, 아티스트가 제작한 환경에서 분 단위 탐색 경로를 실행한 뒤 오프라인으로 렌더링합니다. 경로와 카메라 움직임, 장면 기하를 엔진이 직접 보존하기 때문에 하나의 탐색 과정에서 여러 종류의 주석을 정렬해 생성할 수 있습니다.
핵심 내용
- 영상과 기하 정보의 결합: WorldRover-10M은 RGB 프레임에 계측 깊이, 카메라 궤적, 궤적에서 도출한 행동 신호를 대응시킵니다.
- 장기 탐색 지원: 완전한 경로를 보존하므로 서로 무관한 짧은 클립보다 지속적인 내비게이션과 장면 기억 연구에 적합합니다.
- 다중 시점 재생: 동일한 이동을 1인칭, 3인칭, 360도 파노라마 시점에서 다시 렌더링할 수 있습니다.
- 추가적인 3인칭 주석: 일부 데이터에는 조밀한 광류, 가시성 정보가 포함된 장거리 2D·3D 점 궤적, 카메라와 구분되는 캐릭터 궤적이 제공됩니다.
- 통제 가능한 외관: 경로와 기하를 고정한 채 환경 상태를 바꾸거나 중립적인 흰색 재질을 적용할 수 있습니다.
의미와 과제
WorldRover의 핵심 가치는 단순히 영상 수를 늘리는 데 있지 않습니다. 탐색을 반복하고 재생할 수 있는 데이터 생성 단위로 만들고, 관측, 공간 구조, 시간적 대응, 행동 관련 신호를 동일한 과정에서 제공한다는 점입니다. 같은 경로를 다른 시점이나 환경 상태로 비교할 수 있어 조건을 통제한 실험에도 유리합니다.
다만 합성 환경은 현실 세계의 대체물이 아닙니다. 아티스트가 만든 장면과 엔진 내부의 환경 변화가 실제 환경의 복잡한 변동을 얼마나 잘 반영하는지는 추가 검증이 필요합니다. 따라서 WorldRover는 현실 데이터를 완전히 대신하기보다, 조밀한 주석과 장거리 대응 정보를 낮은 비용으로 확보하고 탐색 가능한 세계 표현을 개발·평가하는 보완적 기반으로 보는 것이 적절합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…