아티클 목록으로
로보틱스·피지컬 AI

Grounded Action Model, 3D 그라운딩을 로봇 제어의 기반으로

약 4분 소요

들어가며

로봇에게 “빨간 컵을 집어”라고 지시하려면 언어를 이해하는 것만으로는 충분하지 않습니다. 로봇은 여러 물체 중 어떤 컵이 목표인지 식별하고, 그 물체가 3차원 공간의 어디에 있는지 파악한 뒤, 로봇 팔이 어떤 경로와 방향으로 접근해야 하는지 결정해야 합니다. 하지만 현재 많은 로봇 파운데이션 모델은 비전·언어 모델이나 동영상 생성 모델을 기반으로 하며, 정확한 공간 위치를 직접 학습하도록 설계되지는 않았습니다. 그 결과 물체와 위치의 연결은 로봇 시연 데이터에서 간접적으로 습득되는 경우가 많습니다.

새롭게 제안된 Grounded Action Model(GAM)은 3D 그라운딩을 행동 예측의 핵심 구성요소로 끌어오는 접근법입니다.

물체 중심의 통합 표현

GAM은 자연어, 점 프롬프트, 박스 프롬프트를 입력으로 받을 수 있습니다. 서로 다른 입력은 선택된 물체를 나타내는 하나의 물체 중심 표현으로 변환됩니다. 이 표현에는 목표물에 집중한 시각 특징과 함께, 물체의 3D 위치 및 기하학적 구조를 나타내는 계량 정보가 포함됩니다.

이후 물체 표현은 로봇의 상태 이력과 함께 멀티스트림 Transformer에 입력됩니다. GAM은 한 시점의 단일 제어 명령보다 연속적인 행동 청크를 예측하므로, 접근·파지·이동·배치처럼 여러 단계가 이어지는 조작에 적합합니다. 또한 완전 자율 정책으로 사용할 수도 있고, 상위 수준 플래너가 호출하는 하위 수준 컨트롤러로도 작동합니다. 상위 플래너는 언어, 점, 박스 등 여러 방식으로 목표를 지정할 수 있어 장기 작업과 과거 상태에 의존하는 작업을 연결하기 쉽습니다.

시뮬레이션과 실제 로봇 평가

RoboTwin 2.0의 50개 과제에서 GAM은 평균 성공률 55.3%를 기록해 Spatial Forcing의 52.0%를 앞섰습니다. 장면을 무작위화한 조건에서는 47.6%를 기록했고, Abot-M0는 30.4%였습니다. 특히 GAM의 행동 정책은 깨끗한 장면에서 수집한 시연 데이터만으로 학습됐습니다. 명시적인 물체 기하 정보가 장면의 외관이 달라졌을 때도 목표물을 다시 찾는 데 도움을 줬을 가능성이 있습니다.

LIBERO-PRO에서는 16개 교란 설정의 평균 성공률이 61%로, π₀.₅의 53%보다 높았습니다. 가장 큰 차이는 목표물의 위치가 바뀌거나 작업 중 새로운 목표가 지정되는 조건에서 나타났습니다. 고정된 장면 배치를 단순히 기억하는 대신, 현재 지시와 물체의 위치를 다시 연결해야 하는 상황에서 물체 중심 표현의 장점이 드러난 것입니다.

실제 로봇 실험에서도 비슷한 경향이 보고됐습니다. 시각적 변화가 있는 양팔 YAM 평가에서 GAM은 20회 중 17회 성공을 유지했지만, π₀.₅는 4회 성공에 그쳤습니다. Franka 로봇에서 Molmo2 플래너와 결합했을 때는 장기적이고 기억 의존적인 작업에서 동일 분포 단계 완료율 64.7%, 분포 외 단계 완료율 49.8%를 기록했습니다.

의미와 남은 과제

GAM의 핵심 의미는 계획과 제어의 역할을 분리하는 데 있습니다. 상위 시스템은 “무엇을 조작할지” 결정하고, GAM은 대상물의 3D 정보를 이용해 “어디로 어떻게 움직일지”를 실행합니다. 이러한 구조는 하나의 정책이 언어 이해, 물체 선택, 위치 추정, 정밀 제어를 모두 시연 데이터에서 추론해야 하는 부담을 줄일 수 있습니다.

다만 현재 결과는 특정 벤치마크와 제한적인 실제 로봇 실험에 기반합니다. 심한 가림, 새로운 물체 범주, 정교한 접촉 조작, 긴 작업 중 실패 복구까지 해결했다는 의미는 아닙니다. 그럼에도 GAM은 로봇 파운데이션 모델에서 언어와 시각 특징뿐 아니라, 명시적이고 측정 가능한 공간 그라운딩도 핵심 기반 기능으로 다뤄야 한다는 방향을 제시합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
RoboDawn, 비전언어모델의 추론을 로봇 제어로 옮기다
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

RoboDawn, 비전언어모델의 추론을 로봇 제어로 옮기다

RoboDawn은 이동, 회전, 그리퍼 조작을 간결한 이산 명령으로 구성해 에이전트형 비전언어모델이 로봇을 제어하도록 한다. 폐루프 상호작용과 소수의 시연만으로 시뮬레이션과 실제 로봇 작업에서 성능 향상을 확인했다.

더 보기
CCTest · Blog
명시적 궤적 없이 앞을 내다보는 3D 확산 정책
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

명시적 궤적 없이 앞을 내다보는 3D 확산 정책

짧은 관측 이력에서 상호작용의 진행 방향을 나타내는 잠재 표현을 학습해 3D 확산 정책에 예측 능력을 더하는 방법이 제안됐다. 별도의 궤적 계획기를 추가하지 않고도 DP3의 기존 구조를 유지하면서 성능 향상을 보고했다.

더 보기