아티클 목록으로
로보틱스·피지컬 AI

WorldToken, 시간 중심으로 로봇 모방학습을 설계하다

약 3분 소요

들어가며

로봇 모방학습 정책은 매 결정 시점마다 여러 종류의 입력을 받아야 합니다. 여러 카메라의 이미지, 관절과 말단장치의 상태를 나타내는 고유수용감각, 그리고 수행할 작업을 설명하는 조건 정보가 대표적입니다. 이 정보를 시퀀스 모델 안에 어떻게 배치하느냐는 모델의 크기만큼이나 학습 방식에 영향을 줄 수 있습니다. WorldToken은 이 문제를 시간 중심(time-first) 구조로 풀고자 합니다.

방식의 핵심

WorldToken은 같은 정책 시점에 들어온 다중 시점 이미지, 고유수용감각, 작업 조건을 하나의 world token으로 융합합니다. 이어지는 시점의 토큰을 시간 순서로 배열하고, 인과 Transformer가 과거에서 현재로 이어지는 관계를 학습하도록 합니다. 출력 단계에서는 확산 행동 헤드를 사용해 단일 동작이 아니라 여러 동작으로 구성된 행동 청크를 생성합니다.

이 설계의 핵심은 시점 내부와 시점 사이의 구조를 분리하는 것입니다. 같은 순간에 관측된 서로 다른 모달리티는 하나로 묶고, Transformer는 연속된 순간 사이의 변화를 모델링합니다. 이미지, 상태, 언어를 각각 별도의 긴 토큰열로 배치하는 방식과 달리, 로봇이 시간에 따라 관측한 세계의 변화를 중심으로 표현을 만들려는 접근입니다. 다만 제공된 실험에는 다른 시퀀스 구성과의 직접 비교가 없으므로, 이 방식의 일반적 우월성을 주장할 수는 없습니다.

실험 결과

RoboCasa 23개 작업에서, 동결된 사전학습 CLIP 텍스트 인코더를 제외하고 처음부터 학습한 8,530만 파라미터 정책은 작업당 2,900개의 생성 시연을 사용해 평균 59.45%의 폐루프 성공률을 달성했습니다. 데이터 규모 5종, 모델 규모 5종, 학습 시드 2종을 조합한 요인 실험에서는 목표 도메인 데이터를 추가할수록 성능이 일관되게 향상됐습니다. 반면 모델 규모는 중간 수준을 넘어서면서 추가 확장의 이득이 줄어들었습니다.

시간 문맥도 중요한 변수였습니다. 동일한 체크포인트에서 볼 수 있는 과거를 한두 개의 정책 시점으로 제한하자 RoboCasa의 50개 정책 모두에서 폐루프 성공률이 하락했습니다. RMBench Blocks Ranking에서는 가시적인 이력을 146초에서 8초로 줄였을 때 평가 성공률이 95%에서 28%로 떨어졌습니다. 탐색적 장기 rollout에서는 기준 교환 순서가 850초 이상 유지됐습니다. 이는 지속적인 순서 행동에 긴 문맥이 도움이 될 수 있음을 시사하지만, 특정 평가 설정의 결과인 만큼 일반 능력으로 확대 해석해서는 안 됩니다.

의미와 한계

WorldToken은 시점마다 이뤄지는 멀티모달 융합과 시점 사이의 인과적 모델링을 분명하게 나눈 로봇 정책 구현입니다. 결과는 로봇 조작에서 네트워크를 계속 키우는 것보다, 목표 환경에 맞는 데이터와 충분한 시간 이력을 확보하는 일이 더 중요할 수 있음을 보여줍니다.

그러나 결론의 범위는 제한적입니다. 논문은 검증한 학습 레시피에서 완전한 WorldToken 구현이 작동한다는 점과 데이터 규모, 모델 규모, 시간 문맥의 행동을 분석했습니다. 각 구성요소의 독립적인 기여를 분리하지 않았고, 다른 시퀀스 조직 방식보다 뛰어나다는 사실도 입증하지 않았습니다. 향후에는 더 강한 구조적 비교, 작업 간 일반화, 실제 로봇에서의 검증이 필요합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
PhysCaP, 물리 특성을 직접 탐색하는 로봇 조작 에이전트
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

PhysCaP, 물리 특성을 직접 탐색하는 로봇 조작 에이전트

PhysCaP는 코드-애즈-정책 로봇에 물리 정보 기반의 능동 탐색을 결합한 방법입니다. 로봇은 카메라 관찰에만 의존하지 않고 고유수용감각 데이터를 활용해 물체의 질량과 강성을 추정하며, 필요한 경우에만 추가 상호작용을 수행합니다.

더 보기