Skill2Real: 로봇 조작 기술을 시뮬레이션에서 현실로
로봇 정책을 시뮬레이션에서 실제 환경으로 옮기는 일은 단순히 동작을 학습시키는 문제와 다르다. 카메라와 같은 인식 조건, 접촉 동역학, 로봇의 형태가 달라져도 학습된 지식이 작동해야 하기 때문이다. Skill2Real은 이 문제를 작업별 정책의 재학습이 아니라, 재사용 가능한 실행 기술과 그 메모리를 이전하는 문제로 다룬다.
프레임워크의 구성
핵심은 공통 로봇 애플리케이션 프로그래밍 인터페이스(API)다. 기술은 시뮬레이터 내부의 특권 상태에 직접 의존하지 않고, 공개 관측과 API 의미론을 바탕으로 표현된다. 따라서 환경이나 로봇의 구현이 달라져도 기술이 의존하는 경계를 유지할 가능성이 커진다.
학습 과정은 제안자·검증자·거버너(Proposer–Verifier–Governor, PVG) 루프로 구성된다. 제안자는 기술을 만들거나 수정하고, 검증자는 시뮬레이션에서만 얻을 수 있는 특권 증거를 사용해 결과를 확인하고 실패 원인을 진단한다. 거버너는 제안된 변경을 받아들일지, 기술 메모리를 어떤 방식으로 갱신할지 결정한다. 단순한 반복 시행착오가 아니라, 시뮬레이션의 진단 정보를 업데이트 심사 과정에 포함한 셈이다.
능력은 두 단계의 계층으로 학습된다. 먼저 ‘소뇌’가 국소적인 조작 기술을 익힌다. 이후 ‘뇌’가 소뇌를 동결한 상태에서 여러 기술을 작업 수준의 순서로 조합한다. 두 종류의 메모리는 실제 로봇으로 이전되며, 이 과정에서 작업 정책을 미세 조정하거나 기술 메모리를 업데이트하지 않는다.
주요 결과
- GPT-5.6 Sol이 LIBERO-90에서 기술을 학습하고 GPT-6 Astra가 각 동결 체크포인트를 평가했을 때, LIBERO-Pro Long 성공률은 2.0%에서 56.3%로 높아졌다. Pro Long에 대한 학습은 진행하지 않았다.
- Robosuite의 7개 작업을 독립적으로 학습한 결과, 평균 성공률은 Sol에서 85.1%, Opus 5에서 89.4%였다.
- Sol이 LIBERO-90에서 학습한 동결 기술은 Astra를 통해 네 가지 실제 로봇 조작 작업에서 평균 78.75%의 완료율을 기록했다.
- Verifier 또는 Governor를 제거하면 최종 Pro Long 성공률이 각각 17.3%포인트와 13.3%포인트 하락했다.
의미와 한계
Skill2Real의 중요한 관점 전환은 sim-to-real을 작업별 엔드투엔드 정책을 다시 만드는 문제로 보지 않고, 공통 인터페이스를 통해 조합 가능하고 점검 가능한 기술을 옮기는 문제로 본다는 점이다. API는 서로 다른 환경 사이의 추상화 계층을 제공하고, 계층적 메모리는 저수준 동작 실행과 고수준 작업 구성을 분리한다. PVG 루프는 실제 로봇에서는 수집하기 어려운 진단 정보를 시뮬레이션에서 활용한다.
다만 결과는 논문에 제시된 벤치마크, 모델 조합, 네 가지 실제 작업이라는 범위 안에서 해석해야 한다. API 설계와 관측 품질, 시뮬레이션과 실제 장비의 차이가 전이 성능에 영향을 줄 수 있다. 더 다양한 로봇 형태와 긴 작업 흐름, 개방형 작업에서도 같은 효과가 유지되는지는 아직 확인이 필요하다. 그럼에도 이 연구는 로봇의 재사용 단위를 작업별 정책이 아니라 실행 가능한 기술 메모리로 설계하는 방향을 보여준다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…