로봇 인컨텍스트 학습: 시연을 전이 가능한 행동으로 바꾸기
들어가며
로봇이 과제를 끝냈다고 해서 시연이 전달한 내용을 제대로 배웠다고 보기는 어렵습니다. 예를 들어 물체를 목표 위치로 옮기는 시연에는 최종 위치뿐 아니라 특정 순서, 자세, 회피 조건, 접촉 방식이 포함될 수 있습니다. 핵심은 로봇이 이런 요구사항을 파악하고, 물체와 환경 또는 실행 조건이 바뀐 뒤에도 이를 유지할 수 있는지입니다.
서베이 논문 「In-Context Learning for Robots: Methods and Applications」는 이 문제를 로봇 인컨텍스트 학습(ICL)의 관점에서 정리합니다. 여기서 ICL은 배포 단계에서 신경망 파라미터를 업데이트하지 않고, 시연과 상호작용을 문맥으로 삼아 이미 가진 능력을 새로운 과제에 맞추는 접근입니다. 이는 일반적인 재학습과 다르며, 모델 가중치를 빠르게 바꾸는 관련 방법과도 구분됩니다.
문맥과 실행을 연결하는 네 가지 경로
이 서베이는 모델 이름보다 가르침이 어떤 실행 인터페이스를 거쳐 실제 행동에 영향을 주는지에 따라 방법을 분류합니다.
- 문맥 조건 정책: 시연, 관측, 상호작용 이력을 정책의 조건으로 사용해 행동 분포를 바꿉니다. 단순히 그럴듯한 행동을 만드는 것이 아니라 시연에 담긴 구체적 요구를 보존하는지가 중요합니다.
- 기하학적 시연 전이: 시연의 궤적, 운동 기준, 공간 관계를 새로운 물체와 장면에 매핑합니다. 원래 상황과 새로운 상황 사이의 대응관계를 안정적으로 찾는 것이 핵심입니다.
- 월드 모델 기반 제어: 문맥을 활용해 가능한 미래를 예측하고, 그 결과를 바탕으로 행동을 선택합니다. 월드 모델은 시연의 이해와 제어를 연결하지만, 환경 변화와 행동의 결과를 얼마나 잘 표현하는지가 중요합니다.
- 스킬·에이전트 기반 실행: 문맥을 호출 가능한 스킬, 프로그램, 또는 상위 수준의 계획으로 변환합니다. 복합 과제에 적합하며 기억, 실패 복구, 과거 경험 재사용을 결합하기도 쉽습니다.
실제 시스템에서는 이 네 계열이 서로 겹칠 수 있습니다. 그러나 가르침이 행동으로 전달되는 매개체가 행동 분포인지, 운동 참조인지, 예측된 미래인지, 스킬과 프로그램 구조인지 구분하게 해 준다는 점에서 유용한 분류입니다.
성공률만으로는 부족하다
과제를 완료했는지만으로는 로봇이 시연에서 무엇을 배웠는지 알 수 없습니다. 평가는 최소한 세 질문을 구분해야 합니다. 로봇이 시연이 제공한 요구사항에 반응했는가? 물리적 상황이 바뀌어도 그 요구를 유지할 수 있는가? 축적된 기억과 경험이 이후 학습과 실행을 개선하는가?
따라서 가르침에 대한 반응성, 요구사항의 충실한 전이, 물리적 일반화, 대응관계, 기억, 실패 복구, 경험 재사용이 모두 중요한 평가 요소가 됩니다. 이들은 부수적인 기능이 아니라 문맥을 실제 행동으로 바꾸는 핵심 구성요소입니다.
의미와 향후 방향
이 서베이의 중요한 점은 로봇 ICL을 단순히 “몇 가지 예시를 보여 주는 것”으로 보지 않는다는 데 있습니다. 문맥을 어떻게 표현할지, 새로운 상황과 어떻게 대응시킬지, 계획과 제어에 어떻게 전달할지, 실패 뒤 어떻게 재사용할지까지 포함하는 시스템 문제로 확장합니다. 또한 복합 과제 습득을 물리적 재귀 자기개선과 연결합니다. 경험은 현재 과제를 해결하는 데 그치지 않고, 다음 과제를 더 잘 배우는 능력까지 높여야 한다는 관점입니다.
연구자에게 이 분류는 더 정밀한 실험을 설계할 기준을 제공합니다. 시스템 개발자에게는 평균 성공률만으로는 충분하지 않다는 점을 일깨웁니다. 시연을 충실하고 전이 가능한 행동으로 바꾸며, 경험을 통해 그 능력을 계속 개선할 수 있는지가 로봇 인컨텍스트 학습의 본질적인 평가 기준입니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…