GameWAM: 게임 세계 모델과 행동 생성을 하나로 묶다
들어가며
게임 에이전트의 어려움은 화면을 읽고 버튼을 누르는 데서 끝나지 않습니다. 한 번의 입력이 세계 상태를 어떻게 바꾸는지 예측하고, 시간이 지나도 유지되는 정보를 추적하며, 게임마다 다른 네이티브 입력 방식으로 계획을 실행해야 합니다. 기존 게임 에이전트는 시각 정보와 과제 맥락을 곧바로 행동으로 매핑하는 경우가 많습니다. 반면 상호작용형 세계 모델은 특정 행동 뒤에 어떤 화면이 나타날지를 예측하지만, 스스로 과제를 수행하는 정책은 아닐 수 있습니다. GameWAM은 이 두 기능을 하나의 World-Action Model로 통합하려는 시도입니다.
핵심 구조
GameWAM은 미래 영상과 행동 궤적을 순차적으로 따로 만드는 대신, 두 가지를 공동 생성합니다. 병렬적인 시각·행동 확산 Transformer 프로세스를 사용하고, 블록 인과 조건화와 flow matching으로 두 생성 과정 사이의 관계를 학습합니다. 공동 학습을 위해 게임플레이와 GUI 조작을 시간 동기화한 궤적도 구축했습니다. 이에 따라 관측 변화, 조작 의도, 네이티브 입력을 같은 시간 흐름 안에서 연결할 수 있습니다.
게임 제어는 본질적으로 이질적입니다. 카메라나 커서 이동은 연속값이고, 키보드 입력은 이산적인 의미를 가집니다. 같은 키보드와 마우스를 사용하더라도 게임 조작과 GUI 조작의 목적은 다릅니다. GameWAM은 각 행동 시점에서 현재 모드가 gameplay인지 GUI인지 예측하고, 모드별 행동 분포를 선택합니다. 연속 행동에는 정규화를 적용해 서로 다른 제어 공간을 하나의 행동 생성 과정에서 다루기 쉽게 했습니다.
긴 과제에는 block-cycle 제어를 적용합니다. 모델은 즉시 실행할 범위를 넘어선 미래 행동까지 예측하지만, 실제로는 짧은 행동 접두부만 커밋합니다. 새로운 관측을 받은 뒤 남은 계획을 다시 계산하는 방식입니다. 사이클 내부의 세밀한 문맥과 사이클 사이의 계층적 시각 이력은 메모리 사용을 제한하면서도 행동의 시간적 연속성을 유지하도록 돕습니다. 즉, 너무 긴 오픈루프 계획에 의존하지 않으면서도 짧은 반응만 반복하는 문제를 피하려는 설계입니다.
실험과 새로운 실패 요인
제공된 자료에 따르면 GameWAM은 Minecraft와 ViZDoom에서 경쟁력 있는 폐루프 과제 성능을 보였습니다. Minecraft에서는 평가된 모든 과제 범주에서 비교 에이전트보다 적은 네이티브 행동을 실행했습니다. 이는 단순한 성공률뿐 아니라, 목표 달성에 필요한 저수준 입력을 얼마나 효율적으로 사용하는지도 보여주는 결과로 해석할 수 있습니다.
논문은 생성 행동의 취약점도 함께 제시합니다. Low-Frequency Action Source Imprinting, 즉 LASI는 조건이 고정된 상황에서 샘플링된 행동 소스의 저주파 성분이 카메라의 거친 움직임을 유도하는 현상입니다. 이 방향성이 재계획 과정에서 반복적으로 유지되면 한쪽 방향으로 움직임이 누적될 수 있습니다. 생성 모델의 샘플링 변동이 무해한 잡음에 그치지 않고, 장기 제어에서 지속적인 편향으로 발전할 수 있다는 의미입니다.
의미와 한계
GameWAM은 “세계가 다음에 어떻게 보일 것인가”와 “어떤 행동을 해야 하는가”를 하나의 예측 루프에서 다루는 게임 에이전트의 방향을 제시합니다. 게임과 GUI 제어를 통합한 방식은 여러 애플리케이션을 네이티브 입력으로 조작하는 에이전트에도 시사점을 줍니다. 동시에 LASI는 생성형 제어를 평가할 때 성공률만 볼 것이 아니라 샘플링 민감도, 행동 안정성, 재계획 과정의 편향도 살펴야 한다는 점을 보여줍니다. 제공된 자료에는 모델 규모, 데이터 규모, 과제별 세부 수치가 없으므로, GameWAM을 범용 게임 제어를 완성한 해법이라기보다 유망한 시스템 설계이자 중요한 문제를 드러낸 연구로 보는 것이 타당합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…