RoboDawn, 비전언어모델의 추론을 로봇 제어로 옮기다
배경
비전언어모델(VLM)은 이미지와 언어를 결합해 높은 수준의 지시를 이해할 수 있다. 그러나 로봇을 실제로 움직이려면 공간 관계를 파악하고, 시각적 판단을 실행 가능한 동작으로 바꾸며, 실행 과정에서 생기는 오차를 수정해야 한다. 논문 「Transferring the Intelligence of VLMs to Robotic Control」은 이 디지털 세계와 물리 세계 사이의 간극을 줄이기 위해 RoboDawn이라는 제어 인터페이스를 제안했다.
제어를 간결한 행동 언어로 추상화
RoboDawn은 VLM에 연속적인 관절 궤적을 직접 출력하게 하지 않는다. 대신 이동, 회전, 그리퍼 제어로 구성된 소수의 이산 명령을 제공한다. 로봇은 현재 장면을 관찰하고 다음 행동을 추론한 뒤 실행한다. 실행 결과가 반영된 새로운 시각 상태를 다시 관찰하고, 그에 따라 다음 행동을 조정한다. 이 관찰·추론·실행·재관찰 루프 덕분에 모델은 처음부터 전체 궤적을 고정하지 않고 중간의 오차를 단계적으로 보정할 수 있다.
연구진은 로봇 작업을 위한 인컨텍스트 학습 방식도 제시했다. 소수의 시연은 명령의 사용법뿐 아니라 작업을 해결하는 전략도 알려준다. 따라서 시연은 단순한 버튼 사용 예시가 아니라, 특정 시각 상태에서 어떤 행동을 선택하고 어떤 순서로 작업을 진행해야 하는지에 대한 맥락을 제공한다.
실험 결과
RoboTwin 2.0 C2R에서 RoboDawn은 시연이 없는 조건에서 53.2%의 성공률을 기록했고, 한 번의 인컨텍스트 시연을 추가하면 73.6%로 상승했다. 이는 보고된 π0.5 기준선의 46.0%보다 높다. 더 어려운 RoboDojo에서도 성공률은 제로샷 조건의 35.67%에서 한 번의 시연 후 47.17%로 증가했다. 특히 목표 작업에 맞춰 별도로 훈련된 로봇 정책에 의존하지 않았다는 점이 중요하다.
논문이 보여주는 핵심 관찰은 다음과 같다.
- RoboDojo에서 47%를 넘는 성공률을 달성해 장기 조작 작업의 강한 기준점을 제시했다.
- 인컨텍스트 학습으로 추론 시점에 로봇 행동을 개선할 수 있어, 시연과 상호작용 기록이 체화 에이전트에 유용함을 보였다.
- 추론 또는 상호작용 단계의 한도를 높이면 성능이 계속 향상되는 테스트 타임 스케일링 현상이 나타났다.
또한 같은 프레임워크를 실제 Franka 로봇에 적용해 블록을 바구니에 넣는 작업과 블록 쌓기 작업을 수행했다. 이 결과는 RoboDawn의 인터페이스가 시뮬레이션 환경에만 국한되지 않음을 보여준다.
의미와 과제
RoboDawn의 핵심 가치는 범용 VLM의 시각적 추론과 물리적 행동 사이에 모델이 이해하기 쉬운 중간 표현을 마련했다는 데 있다. 작업마다 대규모 로봇 데이터를 새로 수집하는 대신, 범용 모델의 지식과 계획 능력을 재사용하고 시연을 통해 배치 시점에 적응할 가능성을 열었다.
다만 현재 결과는 특정 벤치마크와 제한적인 실제 작업을 중심으로 한다. 이산 명령이 정밀하고 빠르거나 안전성이 중요한 조작까지 지원할 수 있는지, 가림과 접촉 불확실성, 오차 누적에 얼마나 안정적인지는 추가 검증이 필요하다. 그럼에도 간결한 제어 언어와 단계적 실행, 시각 피드백을 결합해 디지털 지능을 물리 세계에 연결하는 실용적인 방향을 제시했다는 점에서 의미가 있다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…