WorldGuide, 동영상 세계 모델을 목표 지향 작업 실행기로 확장
들어가며
동영상 생성 모델은 시각적으로 그럴듯한 궤적을 만들 수 있다. 그러나 자연스러운 장면을 생성하는 것과 절차적 작업을 끝까지 성공적으로 수행하는 것은 다른 문제다. 물체를 정리하거나 여러 조작을 순서대로 수행하려면 현재 상태를 파악하고, 다음 행동을 선택하며, 선택한 행동을 실행하고, 최종 목표가 달성됐는지 확인해야 한다. WorldGuide는 이 문제를 단순한 동영상 생성이 아니라 폐루프 작업 실행으로 재정의한다.
계획과 실행을 연결하는 구조
WorldGuide는 초기 이미지와 작업 목표를 입력으로 받는다. ContextPlanner는 현재 생성된 시각 상태를 바탕으로 다음 원자 행동을 예측한다. 작업이 끝났다고 판단하면 완료 토큰을 출력한다. 이후 Executor가 예측된 행동을 동영상 클립으로 구현하고, 그 결과가 다음 계획을 위한 시각 상태가 된다. 시스템은 이 과정을 반복하면서 계속 실행할지, 다음 행동으로 넘어갈지, 작업을 종료할지 결정한다.
이 방식은 오픈루프 생성의 약점을 겨냥한다. 전체 궤적을 미리 확정하면 중간 결과가 예상과 달라져도 이후 행동을 조정하기 어렵다. WorldGuide에서는 매 단계에서 생성된 영상이 다음 의사결정에 직접 영향을 준다. 플래너와 실행기는 동일한 단계별 절차 시연 데이터로 학습되므로, 행동을 선택하는 능력과 그 행동을 실제 영상으로 구현하는 능력 사이의 간극을 줄이는 것이 목표다.
장기 작업에서는 과거 영상의 관리 비용도 문제가 된다. 모든 프레임을 계속 입력하면 컨텍스트가 빠르게 커진다. WorldGuide는 계층형 시각 메모리를 사용해 필요한 상태 정보를 유지하면서 과거 이력에 필요한 토큰 비용을 제한한다. 연구팀은 플래너와 실행기의 공동 학습에 필요한 단계별 데이터 부족을 해결하기 위해 WorldGuide Bench도 제시했다. 이 벤치마크는 약 5만 9천 개의 단계 주석 동영상으로 구성되며, 245개 작업과 27개 절차 범주를 포함한다.
결과와 해석
WorldGuide Bench에서 WorldGuide의 Task Success는 33.33%였다. 참고 행동 계획을 제공받는 MiniMax-H3의 29.90%보다 높은 수치다. Video-CraftBench에서는 47.69%를 기록했으며, 목표만 조건으로 사용한 설정의 32.73%보다 높았다. 단계별 계획, 행동 구현, 시각 피드백을 결합하면 절차적 동영상 작업의 수행 능력을 개선할 수 있음을 시사한다.
다만 이 결과를 완전한 해결로 해석해서는 안 된다. 한 장면에서 올바른 행동이 나타나더라도 전체 상태가 일관되게 유지된다는 보장은 없다. 또한 그럴듯한 동영상만으로 최종 목표 달성을 검증할 수도 없다. 따라서 앞으로는 상태 확인, 실패 복구, 새로운 작업으로의 일반화가 핵심 과제가 된다.
의미와 영향
WorldGuide는 동영상 생성과 시각적 계획, 체화 지능을 연결하는 시스템 관점을 제시한다. 세계 모델은 다음 장면을 예측하는 데 그치지 않고, 자신이 생성한 상태를 점검하고 필요하면 행동을 수정해야 한다. 이 접근법은 로봇 시뮬레이션, 상호작용 환경 모델링, 절차적 콘텐츠 생성에 참고가 될 수 있다. 실제 활용을 위해서는 더 높은 실행 신뢰성과 엄격한 검증 방법이 필요하다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…