WorldWeaver: 멀티 에이전트 비디오 월드 모델의 공유 상태 관리
도입
멀티 에이전트 환경의 세계 모델은 그럴듯한 다음 프레임을 만드는 것만으로는 부족하다. 여러 에이전트가 같은 세계를 서로 다른 시점에서 관찰한다면, 카메라가 바뀌거나 에이전트가 달라져도 세계의 상태는 일관되게 유지되어야 한다. Hugging Face Daily Papers에 소개된 논문 “Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers”는 이 문제를 해결하기 위해 WorldWeaver(W²)를 제안한다.
핵심 내용
- 관찰 이력 중심 접근의 한계: 기존 자기회귀 비디오 확산 파이프라인은 보통 이전 관찰 프레임을 조건으로 다음 영상을 생성한다. 이는 짧은 구간의 시각적 연속성에는 도움이 되지만, 멀티 에이전트와 멀티 뷰 환경에서 공유 상태를 안정적으로 유지하기에는 충분하지 않다.
- 세계 상태 레지스터: WorldWeaver는 학습 가능한 토큰을 레지스터로 사용해 공유 세계 정보와 각 에이전트의 상태를 저장한다. 이 레지스터는 생성된 비디오 청크가 끝날 때마다 동적으로 업데이트되어 다음 생성 단계의 기반이 된다.
- 상태를 지도하는 다양한 신호: 논문은 개별 에이전트 상태, 조감도와 같은 전역 상태 뷰, 장면 텍스트 등을 감독 신호로 활용한다고 설명한다. 이는 모델이 단순히 픽셀 패턴을 이어 붙이는 것이 아니라 더 구조적인 환경 표현을 학습하도록 유도한다.
- Mixture-of-Transformers 설계: WorldWeaver는 세계 상태 모델링과 시각 프레임 모델링에 별도의 Transformer 가중치를 사용한다. 이를 통해 “상태를 이해하고 유지하는 역할”과 “관찰 영상을 생성하는 역할”을 구조적으로 나눈다.
- Minecraft 실험: 실험은 2 에이전트 Minecraft 비디오 생성에 초점을 맞춘다. 공개된 요약에 따르면 명시적인 세계 상태 모델링은 논리적 일관성과 생성 품질을 향상시킨다.
의미와 영향
WorldWeaver가 흥미로운 이유는 세계 상태를 긴 비디오 컨텍스트 안에 암묵적으로 남겨두지 않고, 모델 아키텍처의 핵심 구성요소로 끌어올렸다는 점이다. 공유되고 업데이트되는 내부 상태를 갖춘 모델은 게임형 환경, 인터랙티브 시뮬레이션, 체화 AI 학습, 멀티 에이전트 계획 시스템에서 특히 중요해질 수 있다.
다만 현재 소재에서 확인할 수 있는 내용은 주로 논문 초록과 페이지 요약에 기반한다. 따라서 더 많은 에이전트, 더 긴 시간 범위, 실제 세계 영상에서도 같은 효과가 유지되는지는 별도 검증이 필요하다. 그럼에도 방향성은 분명하다. 장기 상호작용을 지원하는 세계 모델은 단순한 프레임 이력보다 더 지속적이고 공유 가능한 내부 세계 상태를 필요로 한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…