아티클 목록으로
월드 모델

WorldCrafter, 암묵적 3D 메모리로 일관된 비디오 세계 구현

약 3분 소요

배경

비디오 월드 모델은 그럴듯한 짧은 영상을 만드는 데서 끝나지 않는다. 사용자가 카메라를 움직이며 환경을 탐색할 때, 화면 밖으로 사라진 건물이나 물체도 다른 시점에서 다시 나타나면 같은 공간의 일부로 유지돼야 한다. 하지만 기존 모델은 생성 시간이 길어지거나 시점이 바뀌면 물체의 위치와 형태를 바꾸는 경우가 있으며, 여러 장면이 하나의 지속적인 세계처럼 연결되지 않을 수 있다.

Tencent ARC가 제안한 WorldCrafter는 이 문제를 과거 관측을 어떻게 기억할 것인가의 문제로 보고, 카메라 질의가 가능한 암묵적 3D 인식 메모리를 비디오 생성 과정에 결합한다.

핵심 방식

  • 요청된 시점에 맞춰 메모리를 읽는다. 과거 프레임을 모두 같은 방식으로 사용하는 대신, 다음에 요청된 카메라 위치와 시점에 관련된 다중 시점 정보를 선택한다.
  • 고정된 토큰 예산으로 압축한다. 메모리 인코더와 자세 조건부 읽기 모듈이 과거 관측을 목표 시점에 특화된 고정 개수 토큰으로 바꾼 뒤, 생성기의 디노이징 전에 주입한다.
  • 명시적인 깊이 대응을 사용하지 않는다. 관측 사이의 깊이 기반 대응을 직접 계산하는 대신, 메모리 모듈과 비디오 생성기를 함께 학습해 다중 시점 정보를 저장하고 불러오는 방식을 암묵적으로 익힌다.
  • 장기 기억과 최근 문맥을 함께 활용한다. 메모리는 긴 탐색 과정에서 장면의 구조와 외관을 유지하고, 최근 시간 문맥은 가까운 프레임 사이의 움직임과 연속성을 보완한다. 소단계 증류는 스트리밍 생성에 적합한 효율을 지원한다.

WorldCrafter는 한 장의 이미지나 텍스트 프롬프트에서 탐색을 시작할 수 있으며, 새로운 관측이 들어올 때마다 기억을 갱신한다. 따라서 한 번 생성하고 끝나는 고정 길이 영상 생성기보다는, 상태를 유지하며 계속 변화하는 환경 모델에 가까운 설계라고 볼 수 있다.

의미와 영향

이 연구의 핵심적인 시사점은 비디오 모델의 기억을 단순히 긴 기록으로 만들지 않았다는 데 있다. 앞으로 관찰할 카메라 시점이 과거 정보 중 무엇을 압축하고 생성기에 전달할지 결정하도록 만든다. 이는 제한된 컨텍스트와 토큰 예산을 고려하면서도 정밀한 카메라 이동을 지원하려는 접근이다.

논문에 따르면 정적 및 동적 장면 실험에서 장기 일관성과 카메라 제어 정확도가 향상됐고, 분 단위 탐색에서도 시각적 품질이 유지됐다. 인터랙티브 비디오, 가상 환경 제작, 게임 콘텐츠, 체화형 에이전트 시뮬레이션 등에 활용될 가능성이 있다. 다만 제공된 자료에는 구체적인 벤치마크 수치가 없으므로, 복잡한 상호작용과 실제 환경에서의 일반화 성능은 추가 검증이 필요하다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
암세포에서 행성 궤도까지: 하나의 예측 코어가 서로 다른 세계를 배울 수 있을까
월드 모델
cctest.ai
월드 모델

암세포에서 행성 궤도까지: 하나의 예측 코어가 서로 다른 세계를 배울 수 있을까

JEPA-Anything은 생물학, 날씨, 분자, 제어, 물리 시스템에 공통 예측 코어를 적용하려는 시도입니다. 성과는 유망하지만, 범용 세계 모델이 완성됐다는 의미는 아닙니다.

더 보기
CCTest · Blog
JEPA-Anything: 서로 다른 세계를 위한 인자 분해형 월드 모델
월드 모델
cctest.ai
월드 모델

JEPA-Anything: 서로 다른 세계를 위한 인자 분해형 월드 모델

JEPA-Anything은 잠재 목표를 상호 보완적인 인자로 나누는 직교 예측 인자 분해를 JEPA에 결합한 프레임워크입니다. 비전, 생물학, 임상 경로, 제어, 분자 동역학, 물리장, 날씨 등 서로 다른 영역에서 공통 예측 원리를 검증합니다.

더 보기