RoboJEPA, 로봇 잠재 세계 모델의 스케일링 법칙을 제시하다
로봇 세계 모델 연구에서 중요한 질문은 미래를 예측할 수 있는지에만 머물지 않는다. 모델 규모와 데이터, 학습 연산량을 늘렸을 때 성능이 어떤 규칙으로 향상되는지도 알아야 한다. RoboJEPA는 실제 로봇 데이터를 바탕으로 이 문제를 체계적으로 측정하려는 시도다.
픽셀이 아닌 잠재 상태를 예측
RoboJEPA는 Joint Embedding Predictive Architecture, 즉 JEPA를 기반으로 한다. 미래 관측을 픽셀 단위로 재구성하는 대신 학습된 잠재 표현 안에서 미래 상태를 예측하고, 그 결과를 여러 단계 굴려 계획에 활용한다. 이 방식은 행동과 관련된 상태 변화에 모델의 역량을 집중할 여지를 제공한다.
학습 데이터는 12개 로봇 형태를 아우르는 대규모 실제 로봇 데이터로 구성됐다. 연구는 다음 요소들을 함께 살폈다.
- 잠재 롤아웃이 실제 미래 상태에서 얼마나 벗어나는지 나타내는 ‘상상 오차’
- 상상 오차와 학습 연산량의 관계
- 잠재 예측 품질과 로봇 계획 성능의 상관관계
- 긴 행동 시퀀스가 필요한 실제 하드웨어 작업에서의 결과
연산량으로 더 큰 모델의 성능을 추정
논문은 RoboJEPA의 상상 오차가 연산량에 대해 2차 거듭제곱 법칙을 따른다고 보고한다. 이는 더 큰 모델을 매번 실제 로봇에서 비싸게 시험하지 않고도, 상대적으로 작은 규모에서 측정한 관계를 활용해 성능 추세를 예상할 가능성을 뜻한다.
또한 연산량이 증가할수록 하위 계획 성능도 예측 가능한 방식으로 향상됐으며, 상상 오차와 강한 상관관계를 보였다. 이 관계가 더 많은 환경과 로봇 형태에서도 유지된다면, 상상 오차는 일부 실제 로봇 평가를 대신하는 실용적 지표가 될 수 있다. 먼저 모델 내부의 잠재 궤적을 비교한 뒤 유망한 모델만 실제 하드웨어에서 평가하는 방식이다.
다만 제공된 자료만으로 이 법칙이 모든 작업과 환경에서 성립한다고 단정할 수는 없다. 따라서 상상 오차는 물리적 평가를 완전히 대체하는 만능 지표라기보다, 세계 모델의 내부 품질과 실제 행동을 연결하는 유용한 신호로 보는 편이 정확하다.
목표 이미지로 수행하는 제로샷 계획
RoboJEPA는 단일 목표 이미지를 입력으로 받아 실제 하드웨어에서 그 상태를 향해 계획하는 실험도 수행했다. 장기 작업에서 로봇은 고정된 동작을 단순히 복제하는 대신, 잠재 공간에서 가능한 미래를 상상하고 그 결과를 바탕으로 다음 행동을 선택한다.
8B 파라미터 버전은 지금까지 학습된 가장 큰 JEPA predictor 모델로 소개됐다. 연구진은 모델 체크포인트와 학습 코드, 로봇 배포 코드도 공개했다. RoboJEPA의 핵심 의의는 여러 로봇 형태를 대상으로 한 세계 모델의 확장을 경험적 주장에 그치지 않고 측정 가능한 연구 문제로 정리했다는 데 있다. 앞으로는 다양한 작업, 환경, 하드웨어에서 이러한 스케일링 법칙이 얼마나 안정적인지 확인해야 한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…