VLA 강화학습 업데이트가 저랭크 구조를 보이는 이유
들어가며
비전-언어-행동(VLA) 모델에 강화학습을 적용해 로봇 정책을 개선하는 방식이 확산되고 있다. 그러나 강화학습이 정책의 내부를 실제로 어떻게 바꾸는지는 아직 명확하지 않다. HOLI-LAB의 이번 연구는 최종 성공률만 비교하는 대신, 학습된 신호가 파라미터 공간의 어디에 저장되는지 추적했다.
핵심 결과
연구진은 π_{0.5}와 GR00T N1.5/N1.6을 포함한 플로우 기반 VLA 모델을 LIBERO, ManiSkill, MetaWorld, CALVIN에서 분석했다. 주요 결과는 다음과 같다.
- 업데이트가 저랭크 구조를 보였다. 전체 파라미터 규모에 비해 강화학습으로 발생한 실질적 변화는 제한된 방향에 집중됐다. 모델 전체를 광범위하게 다시 학습하지 않아도 정책을 개선할 수 있음을 시사한다.
- Timestep Modules에 변화가 몰렸다. 이 모듈은 액션 전문가 내부의 작은 구성요소로, 기존에는 상대적으로 덜 주목받았다. 모듈 교체 실험에서는 강화학습 성능 향상의 상당 부분을 이 모듈이 담당하는 것으로 나타났다.
- 이산 디노이징 타임스텝이 중요했다. 롤아웃에서 사용하는 특정 타임스텝에 맞춰 모듈이 특화되며, 연구진은 이러한 학습 방식이 저랭크 업데이트의 형성과 관련 있다고 분석했다.
- shift 벡터의 변화가 가장 뚜렷했다. 여러 출력 중 shift 벡터가 강화학습 전후로 가장 크게 달라졌다. 그 업데이트 방향은 작업 성공을 강하게 예측했으며, 보고된 ROC-AUC는 최대 99.6%였다.
- 업데이트의 기하가 작업 관계를 반영했다. 서로 다른 작업의 shift 업데이트 방향이 얼마나 유사한지는 작업 간 전이 패턴과 상관관계를 보였다.
의미와 한계
이번 결과는 VLA 강화학습이 정책 전체를 균일하게 바꾸기보다, 행동 생성 과정에 있는 소수의 작업 관련 방향을 조정할 수 있음을 보여준다. 이 구조가 더 다양한 모델과 환경에서도 확인된다면, 향후 포스트트레이닝은 업데이트 범위를 줄여 비용을 낮추고 정책 변화를 더 쉽게 해석할 수 있다.
연구진은 이미 학습된 shift 업데이트 방향을 따라 정책을 유도하면 추가 강화학습 없이도 성능을 더 높일 수 있다는 점도 보였다. 이는 RL을 대체한다기보다, RL이 찾아낸 파라미터 방향을 정책 편집, 작업 전이, 능력 진단에 재사용하는 접근으로 볼 수 있다.
다만 이번 분석은 플로우 기반 VLA 모델, 이산 디노이징 설정, 여러 시뮬레이션 벤치마크에 한정된다. 다른 행동 생성 방식이나 연속 시간 설정, 실제 로봇에서도 같은 저랭크 구조가 나타나는지는 앞으로 검증해야 한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…