Spatial-Interactor: 상호작용으로 공간 추론을 학습하는 VLM
들어가며
시각언어모델이 장면 속 물체를 인식한다고 해서 물리 세계를 충분히 이해하는 것은 아니다. 실제 환경에서 행동하려면 물체를 옮긴 뒤 무엇이 달라졌는지, 관점이 바뀌면서 어떤 공간 관계가 달라졌는지, 여러 동작을 수행한 뒤 장면이 어떤 상태가 되었는지를 계속 추적해야 한다. Spatial-Interactor는 이런 동적 공간 추론을 학습하기 위한 프레임워크다.
정적 관계에서 상태 전이로
기존 공간 학습은 정적인 이미지에 대한 질문이 중심이었다. 예를 들어 물체의 속성을 식별하거나 두 물체의 좌우, 앞뒤, 거리 관계를 설명하도록 모델을 훈련한다. 이러한 과제는 공간 개념을 익히는 데 도움이 되지만, 행동이 상태를 어떻게 바꾸는지 직접 감독하는 데는 한계가 있다.
Spatial-Interactor는 상호작용 궤적의 구조를 학습 신호로 활용한다. 행동 전 관찰, 수행한 행동, 행동 후 관찰을 하나의 국소 상태 전이로 묶고, 여러 전이를 연결해 모델이 각 프레임을 독립적으로 판단하는 대신 궤적 전체의 의존성을 학습하도록 한다.
세 단계 커리큘럼
학습 과정은 다음 세 단계로 구성된다.
- L1: 수동적 세계 상태 전이. 물체의 이동과 장면 변화, 시점 변화가 외부 세계 상태를 어떻게 갱신하는지 학습한다.
- L2: 능동적 자기 상태 전이. 모델 자신의 행동이나 관점 변화가 이후 관찰에 어떤 변화를 일으키는지 모델링한다.
- L3: 장기 상호작용 궤적. 연속적인 국소 전이를 통합해 긴 행동 시퀀스 동안 일관된 공간 상태를 유지한다.
연구진은 이 목표에 맞춰 시뮬레이션과 실제 상호작용 궤적에서 LSI-108K 데이터셋을 구축했다. 데이터와 과제는 국소 상태 전이 이해부터 장기 궤적 통합까지 각 학습 단계에 맞춰 구성됐다.
두 단계 학습 전략
L1과 L2에서는 지도 미세조정(SFT)을 적용해 모델이 기본적인 국소 상태 전이를 익히도록 한다. 이후 장기 추론 단계에서는 온폴리시 증류를 사용한다. 특권 정보를 받은 교사 브랜치가 구간별 전이 설명을 입력으로 받고, 학생 모델이 자신의 정책에 따라 생성한 사고 연쇄를 감독하는 방식이다. 핵심은 설명을 단순히 늘리는 것이 아니라, 연속적인 변화를 하나의 지속적인 공간 상태 갱신 과정으로 연결하는 데 있다.
의미와 한계
이 연구의 중요한 점은 체화된 공간 추론을 상호작용에 따른 상태 유지 문제로 재구성했다는 데 있다. 관찰-행동-재관찰의 순환을 학습의 중심에 놓음으로써 시각적 이해와 물리적 행동 사이의 연결을 더 명확하게 만들려는 시도다. 논문에 따르면 여러 VLM과 공간 벤치마크에서 국소 전이 모델링과 장기 통합 능력이 일관되게 향상됐다.
다만 제공된 자료에는 세부 벤치마크 점수, 모델 규모별 비교, 실제 로봇 배치 결과가 포함돼 있지 않다. 따라서 Spatial-Interactor를 범용 물리 세계 모델을 완성한 해법이라기보다, 동적 공간 추론을 위한 학습 설계로 이해하는 편이 적절하다. 향후에는 더 개방적이고 통제되지 않은 환경에서도 이러한 상태 추적이 유지되는지가 중요한 검증 과제가 될 것이다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…