PAWBench가 묻다: 동영상 생성 모델은 결과의 확률까지 재현할 수 있을까
동영상 생성 모델이 물리적으로 그럴듯한 미래 하나를 만들었다고 해서 같은 관찰과 행동에서 가능한 여러 결과를 이해한다는 뜻은 아닙니다. PAWBench는 반복 생성으로 올바른 행동 분포를 복원할 수 있는지 평가합니다.
더 보기동영상 생성 모델이 물리적으로 그럴듯한 미래 하나를 만들었다고 해서 같은 관찰과 행동에서 가능한 여러 결과를 이해한다는 뜻은 아닙니다. PAWBench는 반복 생성으로 올바른 행동 분포를 복원할 수 있는지 평가합니다.
더 보기GameWAM은 게임 화면의 미래와 실행 가능한 키보드·마우스 궤적을 함께 생성하는 폐루프 모델입니다. 장기 과제의 재계획을 지원하는 동시에 생성 행동에서 발생하는 방향 편향도 분석합니다.
더 보기새 논문은 월드 모델의 확장이 더 많은 웹 비디오와 연산량만으로 해결되지 않으며, 근거 있는 보상 신호를 반복적으로 만들어내는 데이터 엔진이 필요하다고 주장합니다. 게임 엔진은 공간 모델의 강화학습 후학습에 실행 가능한 환경과 장기 궤적을 제공할 수 있습니다.
더 보기Code World Model은 코딩 에이전트가 지속적인 세계 상태와 규칙을 관리하고, 비디오 모델이 이를 시각적으로 구현하도록 역할을 분리합니다.
더 보기EchoWM은 사용자가 장면 안으로 들어가 지속적으로 이동할 수 있는 생성 미디어용 옴니모달 월드 모델입니다. 이동에 맞춰 720p 영상, 환경음, 음악, 음성을 함께 생성합니다.
더 보기ReWorld는 학습 단계에서 단기 행동 제어와 장기 장면 기억을 분리하고, 추론 단계에서는 제한된 KV 캐시와 카메라 포즈 기반 랜드마크 검색을 결합합니다. 무한히 커지는 문맥 없이도 사용자가 다시 방문한 장소의 정보를 불러오려는 접근입니다.
더 보기한 연구가 전통적 시뮬레이터의 8가지 역량을 기준으로 월드 모델의 발전과 한계를 체계적으로 평가했다. 상호작용과 제어에서는 성과가 있지만, 물리 법칙의 보장과 상태 피드백, 장기 재현성에는 여전히 큰 격차가 있다.
더 보기ForgeWM은 양방향 액션 조건부 비디오 생성기를 게임 상호작용에 적합한 소수 단계 인과 월드 모델로 바꾸는 점진적 학습 프레임워크입니다. 낮은 지연시간을 유지하면서 키보드, 마우스, 게임패드 입력과 화면 변화의 정렬을 개선하는 데 초점을 둡니다.
더 보기WorldRover는 Unreal Engine을 활용해 장시간 탐색 경로와 기하, 움직임, 대응 관계 주석을 함께 생성하는 데이터 엔진입니다. 일관된 세계 표현을 유지하고 다시 방문해야 하는 모델의 학습을 지원하는 것이 목표입니다.
더 보기StateFlow는 영화, 게임, 건축, 도시 설계의 프리비주얼라이제이션을 위해 지속적인 3D 세계 상태를 중심에 둔 생성 프레임워크입니다. 영상을 한 번에 만드는 대신, 세계를 구성하고 변화시키며 카메라를 통해 접근하는 방식을 제안합니다.
더 보기비디오 월드 모델은 한 프레임씩 보면 그럴듯하지만, 긴 전개에서는 상태가 점점 어긋납니다. WorldCycle은 가역적 동작 순환을 자기 검증형 학습 신호로 바꿔 “원래 상태로 돌아오는가”를 최적화합니다.
더 보기MiniWorld는 대규모 사전학습 비디오 생성 모델을 개조하는 방식에서 벗어나, 비디오 월드 모델을 처음부터 재현 가능하게 학습하는 프레임워크를 제안한다. 핵심은 인과적 스트리밍 추론, 제한된 연산 자원, 공개 코드다.
더 보기이 논문은 월드 모델을 물리 상태 예측 장치가 아니라, 에이전트가 계획하고 학습하며 계속 개선되는 데 필요한 상호작용형 정보 프록시로 재정의한다.
더 보기WCM은 로봇 VLA 모델의 강화학습 후처리에서 critic이 단일 프레임에 의존하는 한계를 겨냥한다. 미래 잠재 상태 예측과 가치 추정을 함께 학습해, 부분 관측 환경에서 필요한 시간적 동역학 표현을 만들려는 접근이다.
더 보기Roomer는 생성된 3D 실내 배치에 남는 충돌, 경계 이탈, 출입구 가림, 동선 차단 문제를 특정 객체에 연결하고 국소 편집으로 고치는 반성적 복구 프레임워크다.
더 보기WorldExam은 제어 가능한 비디오 생성 모델을 세계 모델로 평가하기 위한 계층형 벤치마크입니다. 단순한 화질과 명시적 지시 수행을 넘어, 장면 상태에 따라 세계가 그럴듯하게 반응하는지를 본격적으로 다룹니다.
더 보기ODEWorld는 고정된 시간 간격의 다음 상태 예측 대신, 물리 시간에서 움직이는 연속 잠재 속도장을 학습합니다. 이를 통해 임의의 시간 해상도 예측, 역방향 예측, 로봇 계획에 유용한 동역학 표현을 목표로 합니다.
더 보기Mental World Modeling은 세계 모델이 물리적 장면만 정확히 재현해서는 인간 행동을 제대로 예측할 수 없으며, 믿음·의도·감정 같은 숨은 정신 상태를 함께 추적해야 한다고 제안한다.
더 보기QQWorld는 잠재 세계 모델에서 분포의 꼬리가 충분히 제어되지 않는 문제에 주목합니다. 기존 Epps-Pulley 목적을 분위수-분위수 매칭으로 대체해 꼬리 샘플에도 효과적인 보정 신호를 유지하려는 접근입니다.
더 보기World Labs가 로봇 시뮬레이션 기업 SceniX를 인수한 것은 월드 모델의 초점이 시각적 3D 생성에서 행동 결과의 물리적 시뮬레이션으로 이동하고 있음을 보여준다. 물리 AI의 다음 경쟁은 더 많은 ‘유용한 훈련 세계’를 만드는 능력에 달려 있다.
더 보기ShadowDancer는 하나의 시연 영상에 담긴 행동을 새로운 장면으로 옮기는 문제를 다룹니다. 같은 움직임을 유지하되 외형을 바꾼 영상 쌍을 통해, 모델이 더 순수한 동역학 표현을 배우도록 합니다.
더 보기