World Action Agent, 로봇이 움직이기 전 VLM이 동작을 리허설한다
들어가며
비전-언어 모델(VLM)은 폭넓은 지식과 공간 추론 능력을 갖고 있지만, 이를 실제 로봇의 안정적인 물리 행동으로 바꾸는 일은 여전히 어렵다. 기존 시스템은 VLM을 제약 예측기나 프로그램 생성기로 사용하거나, 고정된 장면 이미지를 보여주고 행동을 선택하게 하는 경우가 많다. 이때 모델이 장면을 이해하는 과정과 로봇이 그 세계에서 행동하는 과정 사이에는 별도의 제어 인터페이스가 필요하다.
World Action Agent(WAA)는 이 인터페이스를 행동 가능한 시각 워크스페이스로 설계한다. VLM이 조작 전체를 한 번에 출력하도록 요구하는 대신, 여러 에이전트와 기본 도구를 사용해 관찰하고, 행동을 제안하고, 수정한 뒤 실행하도록 만든다.
핵심 구성
- 접촉 시점: 장면의 기하 정보를 바탕으로 현재 상호작용 지점 주변의 시점을 자동 선택한다. 집기, 밀기, 접촉 같은 동작에서 고정된 전체 화면만 보는 것이 아니라 실제 접촉과 관련된 국소 정보를 제공한다.
- 동작 리허설: 모든 행동은 실행 전 편집 가능한 제안으로 변환된다. 에이전트가 직접 수정할 수 있으며, Imagination Agent가 예상 결과를 미리 검토하고 계획 피드백에 따라 제안을 다시 다듬을 수도 있다.
- 시야 내 보정: 저수준 실행 뒤 위치 오차가 남으면, 오류를 관찰한 동일한 시야에서 보정한다. 관찰, 리허설, 실행이 서로 다른 단계로 분리되지 않고 하나의 루프를 이룬다.
WAA는 실행 하니스인 동시에 체화된 절차 지식을 축적하는 장치이기도 하다. 전문가 영상과 사람의 시연에서 멀티모달 스킬을 발전시키고, 근거 기반 검토를 거친 뒤 Skill Agent를 통해 호출할 수 있다. 또한 워크스페이스에서 수집한 상호작용 궤적을 활용해 같은 하니스를 조작하는 더 작은 VLM을 훈련할 수 있다.
실험 결과
LIBERO-Pro에서 WAA는 LIBERO-90만으로 발전시킨 스킬을 사용해 평균 성공률 75.6%를 기록했다. 논문은 이 결과가 엔드투엔드 비전-언어 액션 모델, 코드-정책 에이전트, 동일한 백본을 사용하는 시각 하니스 기준선을 앞선다고 보고한다. 같은 스킬은 추가 학습 없이 robosuite에서도 효과를 유지했다.
또 다른 결과는 모델 전이에 관한 것이다. 하니스에서 얻은 궤적으로 Qwen3.5-9B를 미세 조정하자 도메인 외 성공률이 1.7%에서 43.3%로 높아졌다. 이는 워크스페이스가 단순한 실행 래퍼가 아니라, 장면을 확인하고 행동을 구성하며 피드백에 대응하는 방법을 학습하게 하는 구조화된 데이터 형식이라는 점을 보여준다.
의미와 과제
WAA의 핵심은 VLM 주변에 도구를 몇 개 추가한 데 있지 않다. 로봇 조작을 검토하고 수정할 수 있는 판단의 연속으로 재구성했다는 데 의미가 있다. 의미 수준의 추론을 동작 미리보기, 계획 피드백, 시각적 보정으로 저수준 실행에 연결하기 때문에, 긴 작업에서 초기 오류가 이후 단계로 연쇄되는 영향을 줄일 가능성이 있다.
이 접근은 완전한 엔드투엔드 정책 학습과 다른 선택지를 제시한다. 범용 모델이 모든 제어를 내부적으로 처리하도록 요구하는 대신, 추론 능력과 재사용 가능한 스킬, 상상, 보정을 함께 작동시킬 수 있는 일관된 행동 인터페이스를 제공한다. 환경이 바뀌어도 스킬이 작동했다는 결과는 상호작용 인터페이스의 설계가 단순한 데이터 확대만큼 중요할 수 있음을 시사한다.
다만 현재 결과만으로 가정이나 산업 현장의 모든 조건에서 강건성이 입증된 것은 아니다. 접촉 시점 선택, 계획 피드백의 품질, 스킬 검토 비용, 복잡한 조작의 안전 경계는 추가 검증이 필요하다.
그럼에도 WAA는 로봇에게 단지 세계를 보여주는 대신, 행동을 미리 시도하고 다시 고칠 수 있는 세계를 제공해야 한다는 방향을 제시한다. 이는 범용 VLM을 체화 지능으로 연결하는 구체적인 시스템 설계 사례다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…