아티클 목록으로
월드 모델

ABot-World-0: 데스크톱 GPU 한 장으로 실행하는 실시간 인터랙티브 월드 모델

약 3분 소요

들어가며

월드 모델의 핵심은 그럴듯한 영상을 한 번 생성하는 데서 끝나지 않는다. 사용자의 입력이나 에이전트의 행동에 반응하고, 시간이 지나도 장면의 일관성을 유지하며, 다음 행동을 결정할 수 있을 만큼 빠르게 관측 결과를 반환해야 한다. ABot-World-0는 이런 목표에 맞춰 설계된 행동 조건 비디오 월드 모델이다.

이 연구는 영상 생성, 데이터 수집, 장기 롤아웃 안정화, 추론 시스템을 하나의 문제로 다룬다. 특히 키보드 같은 원시 행동 입력을 통일된 제어 인터페이스로 사용해, 장면 탐색과 3인칭 캐릭터 상호작용을 모두 지원하려 한다.

핵심 포인트

  • 행동으로 제어되는 비디오 월드 모델: ABot-World-0는 텍스트 프롬프트만으로 영상을 만드는 모델이 아니다. 사용자의 행동 입력을 받아 다음 화면을 생성하고, 다시 그 화면을 바탕으로 다음 행동을 이어가는 폐루프 구조를 지향한다.
  • 다중 소스 데이터 인프라: 학습 데이터는 AAA 게임, 시뮬레이션 엔진, 인터넷 비디오를 포함한다. WorldExplorer는 학습 피드백을 활용해 에이전트 주도 데이터 수집을 수행하며, 통합 파이프라인은 14개의 결정적 품질 검사, VLM 기반 평가, 동기화된 행동 및 텍스트 주석을 적용한다.
  • 교사에서 학생으로의 점진적 증류: 연구진은 양방향 행동 조건 교사 모델을 먼저 구성한 뒤, teacher forcing과 ODE distillation을 통해 실시간 생성에 적합한 인과적 학생 모델로 증류한다.
  • LongForcing으로 장기 드리프트 완화: 자기회귀 방식의 월드 모델은 롤아웃이 길어질수록 작은 오류가 누적되고 분포가 어긋나기 쉽다. ABot-World-0는 LongForcing을 도입해 학생 모델의 긴 자기 롤아웃을 더 긴 지평을 가진 교사 모델과 맞추며, 누적 분포 이동과 자기회귀 드리프트를 줄이는 것을 목표로 한다.
  • 3인칭 캐릭터 일관성 유지: 캐릭터 중심 상호작용에서는 외형과 정체성이 시간이 지나며 흔들릴 수 있다. reference-character memory는 지속적인 외형 단서를 제공해 장기 롤아웃에서도 캐릭터의 정체성을 유지하도록 돕는다.
  • 배포까지 고려한 추론 최적화: 시스템은 경량 VAE 디코더, 효율적인 어텐션, 메모리 인식 스케줄링, 저비트 DiT 추론을 결합한 스트리밍 추론 스택을 사용한다. 논문에 따르면 최적화된 저비트 구성에서 단일 NVIDIA RTX 5090으로 720P 영상을 최대 16 FPS로 스트리밍하며, 행동 입력부터 첫 프레임까지의 지연은 약 1.2초, 피크 VRAM은 약 19GiB다.

의미와 영향

ABot-World-0가 주목할 만한 이유는 월드 모델을 짧은 영상 데모가 아니라 조작 가능한 시스템에 가깝게 다룬다는 점이다. 게임 프로토타이핑, 구현형 AI 훈련, 가상 에이전트, 시뮬레이션 환경 생성에서는 영상 품질만큼이나 제어 가능성, 지연 시간, 장기 일관성, 하드웨어 요구사항이 중요하다.

물론 제시된 성능은 WorldRoamBench와 확장 인터랙티브 롤아웃 실험을 기반으로 하며, 실제 게임 엔진이나 범용 시뮬레이터를 곧바로 대체한다는 뜻은 아니다. 다만 이 연구는 인터랙티브 월드 모델이 모델 구조만의 문제가 아니라 데이터, 학습, 메모리, 서빙 최적화를 함께 설계해야 하는 시스템 문제임을 잘 보여준다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
UniWorld-View, WorldScore 1위: 이미지 한 장으로 제어 가능한 새 시점 영상을 만든다
월드 모델
cctest.ai
월드 모델

UniWorld-View, WorldScore 1위: 이미지 한 장으로 제어 가능한 새 시점 영상을 만든다

투잔 인텔리전스가 베이징대, 펑청연구소와 개발한 UniWorld-View가 페이페이 리 팀 관련 WorldScore 순위에서 1위에 올랐다. 단일 이미지나 단안 영상에서 지정한 카메라 궤적의 새 시점 영상을 생성하는 것이 핵심이다.

더 보기
CCTest · Blog
AlayaRenderer-Flash, 생성형 월드 렌더링을 플레이 가능한 30 FPS로 끌어올리다
월드 모델
cctest.ai
월드 모델

AlayaRenderer-Flash, 생성형 월드 렌더링을 플레이 가능한 30 FPS로 끌어올리다

AlayaRenderer-Flash는 생성형 월드 렌더링 속도를 0.56 FPS에서 31.54 FPS로 높여, 물리 엔진 기반 인터랙티브 장면을 실시간 플레이에 가깝게 만들었다. 텍스트만으로 영상을 상상하는 방식이 아니라, 구조화된 월드 상태를 바탕으로 RGB 프레임을 합성한다.

더 보기