MotorMind, 범용 VLM의 제로샷 로봇 조작을 시험하다
배경
낯선 환경에서 로봇을 작동시키려면 자연어 지시를 이해하는 것만으로는 부족하다. 로봇은 시각 관찰을 바탕으로 실행 가능한 행동을 선택하고, 실제 결과를 확인한 뒤 환경 변화나 실패에 맞춰 다음 행동을 수정해야 한다. 시각·언어·행동 모델(VLA)은 로봇 조작을 발전시켰지만, 특정 작업에 맞춘 데이터와 정책 학습에 의존하는 경우가 많다. 그 결과 새로운 작업과 환경에서의 제로샷 일반화에는 여전히 한계가 있다.
또 다른 접근은 범용 비전·언어 모델(VLM)을 고수준 추론에 활용하고, 코딩 에이전트나 학습된 행동 전문가, 추가적인 그라운딩 도구를 결합하는 방식이다. 이 방법은 강력할 수 있지만 외부 모델과 도구가 늘어나면서 시스템 복잡도와 비용도 커진다. MotorMind는 범용 VLM 자체가 인간 원격 조작자처럼 관찰과 행동을 반복하며 로봇을 운용할 수 있는지 질문한다.
작동 방식
MotorMind는 VLM이 관절 단위의 제어 신호를 직접 생성하도록 하지 않는다. 대신 모델은 현재 관찰을 바탕으로 중간 수준의 행동을 제안한다. 이 제안은 결정론적 로봇 제어기가 실행하며, 시스템은 실행 과정의 상태와 시각적 변화를 계속 확인한다. 새로운 피드백은 다시 모델에 전달되고, 관찰·행동·확인·수정의 순환이 이어진다.
핵심 구성은 다음과 같다.
- 중간 수준 행동 인터페이스: 개방적인 모델 추론과 저수준 로봇 제어 사이를 연결한다.
- 비동기 모니터링: 행동 실행과 진행 상황 확인을 병렬로 수행해 이상 상황에 대응한다.
- 백그라운드 메모리 업데이트: 실행 중 얻은 정보를 이후 판단에 활용한다.
- 외부 의존성 축소: 작업별 정책 학습, 코딩 에이전트, SAM3와 같은 추가 그라운딩 도구를 사용하지 않는다.
실험 결과와 한계
LIBERO-PRO 기본 테스트에서 MotorMind는 66.7%의 성공률을 기록했고, 섭동이 포함된 조건에서는 53.8%를 기록했다. 비교한 기존 제로샷 방법의 최고 성능은 해당 조건에서 각각 13.3%와 19.2%였다. 실제 xArm6 로봇에서는 직접 조작과 사람에 의한 방해 상황을 포함해 평균 95%의 성공률을 보고했다. 더 강력한 VLM을 백본으로 교체하면 성능이 추가로 향상됐다.
다만 이 결과가 범용 VLM이 로봇 제어를 해결했다는 뜻은 아니다. 남은 실패는 주로 물체의 정확한 위치를 파악하는 시각적 그라운딩, 접촉과 물리적 결과를 이해하는 체화 추론, 실행 가능한 행동을 선택하는 행동 지식에서 발생했다. 물체를 인식하는 능력과 실제로 안전하게 잡고 움직이는 능력 사이에는 여전히 간극이 있다.
의미와 영향
MotorMind가 보여주는 중요한 설계는 VLM과 제어기의 역할 분담이다. VLM은 관찰에 기반한 유연한 판단을 담당하고, 결정론적 제어기는 그 중간 수준의 의도를 예측 가능한 물리적 움직임으로 바꾼다. 이렇게 하면 모델에 모든 저수준 제어를 맡기지 않으면서도 범용 모델의 전이 능력을 활용할 수 있다.
이 접근은 로봇 능력 향상이 반드시 작업별 정책을 계속 학습시키는 방식에만 의존할 필요는 없다는 점도 시사한다. 더 나은 행동 표현과 촘촘한 피드백 구조가 있다면, 강력해지는 VLM을 실제 로봇으로 옮기는 경로가 짧아질 수 있다. 그러나 실제 배치를 위해서는 안전 제약, 실패 복구, 장시간 작업 평가가 추가로 필요하다. MotorMind는 범용 VLM이 로봇 조작 루프에 직접 참여할 수 있음을 보여주는 가능성 검증으로 보는 것이 적절하다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…