아티클 목록으로
월드 모델

WorldPlay2, 분해형 제어와 압축 메모리로 인터랙티브 월드 모델 확장

약 4분 소요

배경

인터랙티브 월드 모델은 다음 프레임을 생성하는 데서 끝나지 않는다. 사용자의 입력이나 에이전트의 행동에 실시간으로 반응하면서, 장면의 외관과 캐릭터의 특징, 사건의 흐름을 긴 시간 동안 일관되게 유지해야 한다. 하지만 제어 신호가 다양해질수록 학습해야 할 관계가 복잡해지고, 롤아웃이 길어질수록 과거 컨텍스트와 계산 비용이 빠르게 증가한다.

WorldPlay2는 이 문제를 제어 인터페이스, 과거 정보의 메모리화, 교사-학생 증류를 함께 설계하는 방식으로 다룬다.

핵심 구성

행동 제어와 의미 제어의 분리

WorldPlay2의 첫 번째 요소는 프레임에 맞춰진 행동 제어와 구조화된 의미 제어를 결합한 하이브리드 인터페이스다. 행동 제어는 상호작용에서 즉시 일어나는 움직임을 표현하고, 의미 제어는 장면과 등장인물, 사건에 관한 상위 수준의 지시를 전달한다.

의미 정보는 장면 외관, 캐릭터 정체성, 동적 의미 이벤트로 나뉜다. 장면 외관은 환경이 어떻게 보이는지를, 캐릭터 정체성은 주체의 특징을, 동적 이벤트는 시간에 따라 발생하는 변화를 설명한다. 서로 다른 신호를 하나의 불분명한 입력으로 취급하지 않고 역할별로 분해함으로써, 모델이 각 제어 요소와 시각적 결과 사이의 관계를 더 명확하게 학습하도록 하는 접근이다.

이런 구조는 서로 다른 장면과 캐릭터에 대한 일반화를 지원하는 것을 목표로 한다. 다만 제공된 자료에는 구체적인 벤치마크 수치나 평가 조건이 포함되어 있지 않다.

과거 컨텍스트를 압축 메모리로 처리

긴 영상을 생성할 때 전체 과거 프레임을 매번 다시 입력하면 컨텍스트가 커지고 계산 부담이 증가한다. WorldPlay2는 과거 정보를 작은 메모리 토큰으로 압축하고, 이를 자기회귀 학생 모델과 양방향 교사 모델이 공유하도록 구성한다.

그 결과 긴 롤아웃 전체를 한 번에 공동 처리하는 대신, 메모리를 조건으로 한 클립 단위 점수 평가를 수행할 수 있다. 이전 정보를 매 단계 다시 읽는 대신 압축된 상태를 다음 구간으로 전달하는 방식이다. 논문이 제시하는 핵심 방향은 과거 정보의 영향을 보존하면서도 장기 증류에 필요한 비용을 줄이는 데 있다.

Stable Forcing으로 증류 안정화

자기회귀 모델은 스스로 생성한 초기 오류를 다음 단계로 전달할 수 있다. 생성 시간이 길어지면 작은 차이가 누적되어 전체 롤아웃의 품질 저하로 이어질 가능성이 커진다. WorldPlay2는 이를 완화하기 위해 Stable Forcing을 제안한다.

먼저 몇 단계 생성 전략으로 학생 모델을 초기화한 뒤, 전체 롤아웃을 다시 재생해 학습에 활용한다. 초기 단계에서는 학습을 안정적으로 시작하고, 이후에는 짧은 구간만 잘 생성하는 것이 아니라 긴 생성 과정 전체의 품질을 고려하도록 만드는 설계다. 이를 통해 학생 모델이 교사 모델의 출력을 모방하는 데서 나아가, 자기회귀 생성에서 발생하는 오류에도 더 견고하게 대응하도록 하는 것이 목표다.

의미와 남은 과제

WorldPlay2의 중요한 점은 실시간성을 단순한 추론 속도 문제로만 다루지 않는다는 것이다. 제어 신호는 요인별로 분해하고, 긴 이력은 압축된 메모리로 전달하며, 교사와 학생의 차이는 별도의 안정화 전략으로 관리한다. 이 세 요소를 함께 설계해 실시간 반응성과 장기 일관성 사이의 균형을 찾으려 한다.

이 접근은 인터랙티브 영상 생성, 게임 세계 시뮬레이션, 조작 가능한 미래를 예측하는 에이전트에 참고가 될 수 있다. 그러나 압축 메모리가 세부 상태를 얼마나 보존하는지, 분해된 제어가 복잡한 조합에서도 안정적으로 작동하는지, 더 긴 개방형 상호작용에서 일관성을 유지하는지는 추가 검증이 필요하다. 제공된 자료는 방법 개요와 논문이 보고한 성능 주장을 담고 있을 뿐, 상세한 수치와 실험 조건은 원문 확인이 필요하다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
InternW0-Δ, 2만 시간 이상 공개 데이터로 시각 예측과 로봇 행동 통합
월드 모델
cctest.ai
월드 모델

InternW0-Δ, 2만 시간 이상 공개 데이터로 시각 예측과 로봇 행동 통합

InternW0-Δ는 시각 동역학, 장면 의미론, 4D 기하·운동 사전 지식과 로봇 행동 생성을 하나로 묶는 World Action Model입니다. 논문은 시뮬레이션 벤치마크와 실제 로봇 플랫폼에서 기존 방법보다 높은 성능을 보고합니다.

더 보기