아티클 목록으로
월드 모델

WorldRover, 탐색 가능한 세계 모델을 위한 풍부한 합성 영상 엔진

약 3분 소요

들어가며

탐색 가능한 세계를 이해하거나 재구성하는 모델을 학습하려면 RGB 영상만으로는 부족합니다. 카메라가 어떻게 움직였는지, 장면의 기하 구조가 어떻게 유지되는지, 시간 간격이 긴 영상에서 같은 점과 물체를 어떻게 대응시킬지, 관측을 어떤 행동 신호와 연결할지까지 필요합니다. 실제 촬영은 일부 정보를 제공하지만, 조밀한 기하와 장거리 대응 관계는 추정 과정이나 전문 장비에 의존하는 경우가 많습니다.

WorldRover는 이 문제를 렌더링 단계에서 해결하려는 접근입니다. 핵심 구성 요소인 WorldRover-Engine은 Unreal Engine 기반으로 동작하며, 아티스트가 제작한 환경에서 분 단위 탐색 경로를 실행한 뒤 오프라인으로 렌더링합니다. 경로와 카메라 움직임, 장면 기하를 엔진이 직접 보존하기 때문에 하나의 탐색 과정에서 여러 종류의 주석을 정렬해 생성할 수 있습니다.

핵심 내용

  • 영상과 기하 정보의 결합: WorldRover-10M은 RGB 프레임에 계측 깊이, 카메라 궤적, 궤적에서 도출한 행동 신호를 대응시킵니다.
  • 장기 탐색 지원: 완전한 경로를 보존하므로 서로 무관한 짧은 클립보다 지속적인 내비게이션과 장면 기억 연구에 적합합니다.
  • 다중 시점 재생: 동일한 이동을 1인칭, 3인칭, 360도 파노라마 시점에서 다시 렌더링할 수 있습니다.
  • 추가적인 3인칭 주석: 일부 데이터에는 조밀한 광류, 가시성 정보가 포함된 장거리 2D·3D 점 궤적, 카메라와 구분되는 캐릭터 궤적이 제공됩니다.
  • 통제 가능한 외관: 경로와 기하를 고정한 채 환경 상태를 바꾸거나 중립적인 흰색 재질을 적용할 수 있습니다.

의미와 과제

WorldRover의 핵심 가치는 단순히 영상 수를 늘리는 데 있지 않습니다. 탐색을 반복하고 재생할 수 있는 데이터 생성 단위로 만들고, 관측, 공간 구조, 시간적 대응, 행동 관련 신호를 동일한 과정에서 제공한다는 점입니다. 같은 경로를 다른 시점이나 환경 상태로 비교할 수 있어 조건을 통제한 실험에도 유리합니다.

다만 합성 환경은 현실 세계의 대체물이 아닙니다. 아티스트가 만든 장면과 엔진 내부의 환경 변화가 실제 환경의 복잡한 변동을 얼마나 잘 반영하는지는 추가 검증이 필요합니다. 따라서 WorldRover는 현실 데이터를 완전히 대신하기보다, 조밀한 주석과 장거리 대응 정보를 낮은 비용으로 확보하고 탐색 가능한 세계 표현을 개발·평가하는 보완적 기반으로 보는 것이 적절합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
World Observer, 세계 모델이 시야 밖 변화를 추적하는 방법
월드 모델
cctest.ai
월드 모델

World Observer, 세계 모델이 시야 밖 변화를 추적하는 방법

World Observer는 행동 주체의 시점과 관찰자 시점을 분리해 여러 시점을 함께 생성합니다. 물체가 행동 주체의 시야를 벗어난 뒤에도 관찰자 화면에서 계속 변화하도록 해, 다시 시야에 들어왔을 때 상태와 외관의 일관성을 높입니다.

더 보기
CCTest · Blog
AutoGUIWorld, 이미지 생성기로 GUI 에이전트의 가상 환경 구축
월드 모델
cctest.ai
월드 모델

AutoGUIWorld, 이미지 생성기로 GUI 에이전트의 가상 환경 구축

AutoGUIWorld는 이미지 생성 모델의 시각적 사전지식과 작업 플래너를 결합해 실제 소프트웨어를 실행하지 않고도 GUI 상호작용 궤적을 합성한다. 연구진은 여러 운영체제와 브라우저를 아우르는 데이터로 컴퓨터 사용 에이전트의 성능 향상을 확인했다.

더 보기