아티클 목록으로
강화학습

VLA 강화학습 업데이트가 저랭크 구조를 보이는 이유

약 3분 소요

들어가며

비전-언어-행동(VLA) 모델에 강화학습을 적용해 로봇 정책을 개선하는 방식이 확산되고 있다. 그러나 강화학습이 정책의 내부를 실제로 어떻게 바꾸는지는 아직 명확하지 않다. HOLI-LAB의 이번 연구는 최종 성공률만 비교하는 대신, 학습된 신호가 파라미터 공간의 어디에 저장되는지 추적했다.

핵심 결과

연구진은 π_{0.5}와 GR00T N1.5/N1.6을 포함한 플로우 기반 VLA 모델을 LIBERO, ManiSkill, MetaWorld, CALVIN에서 분석했다. 주요 결과는 다음과 같다.

  • 업데이트가 저랭크 구조를 보였다. 전체 파라미터 규모에 비해 강화학습으로 발생한 실질적 변화는 제한된 방향에 집중됐다. 모델 전체를 광범위하게 다시 학습하지 않아도 정책을 개선할 수 있음을 시사한다.
  • Timestep Modules에 변화가 몰렸다. 이 모듈은 액션 전문가 내부의 작은 구성요소로, 기존에는 상대적으로 덜 주목받았다. 모듈 교체 실험에서는 강화학습 성능 향상의 상당 부분을 이 모듈이 담당하는 것으로 나타났다.
  • 이산 디노이징 타임스텝이 중요했다. 롤아웃에서 사용하는 특정 타임스텝에 맞춰 모듈이 특화되며, 연구진은 이러한 학습 방식이 저랭크 업데이트의 형성과 관련 있다고 분석했다.
  • shift 벡터의 변화가 가장 뚜렷했다. 여러 출력 중 shift 벡터가 강화학습 전후로 가장 크게 달라졌다. 그 업데이트 방향은 작업 성공을 강하게 예측했으며, 보고된 ROC-AUC는 최대 99.6%였다.
  • 업데이트의 기하가 작업 관계를 반영했다. 서로 다른 작업의 shift 업데이트 방향이 얼마나 유사한지는 작업 간 전이 패턴과 상관관계를 보였다.

의미와 한계

이번 결과는 VLA 강화학습이 정책 전체를 균일하게 바꾸기보다, 행동 생성 과정에 있는 소수의 작업 관련 방향을 조정할 수 있음을 보여준다. 이 구조가 더 다양한 모델과 환경에서도 확인된다면, 향후 포스트트레이닝은 업데이트 범위를 줄여 비용을 낮추고 정책 변화를 더 쉽게 해석할 수 있다.

연구진은 이미 학습된 shift 업데이트 방향을 따라 정책을 유도하면 추가 강화학습 없이도 성능을 더 높일 수 있다는 점도 보였다. 이는 RL을 대체한다기보다, RL이 찾아낸 파라미터 방향을 정책 편집, 작업 전이, 능력 진단에 재사용하는 접근으로 볼 수 있다.

다만 이번 분석은 플로우 기반 VLA 모델, 이산 디노이징 설정, 여러 시뮬레이션 벤치마크에 한정된다. 다른 행동 생성 방식이나 연속 시간 설정, 실제 로봇에서도 같은 저랭크 구조가 나타나는지는 앞으로 검증해야 한다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
온라인 정책 증류의 스케일링: 작은 교사가 더 큰 추론 모델을 이끄는 방식
강화학습
cctest.ai
강화학습

온라인 정책 증류의 스케일링: 작은 교사가 더 큰 추론 모델을 이끄는 방식

온라인 정책 증류가 서로 다른 규모의 모델 사이에서 추론 능력을 어떻게 전달하는지 체계적으로 분석한 연구입니다. 소형 강화학습 전문가도 더 큰 학생 모델을 개선할 수 있으며, 교사의 규모와 점수만으로는 감독 가치가 결정되지 않는다는 결과를 제시합니다.

더 보기
CCTest · Blog
LLM 강화학습의 학습·추론 불일치, CIS로 보정한다
강화학습
cctest.ai
강화학습

LLM 강화학습의 학습·추론 불일치, CIS로 보정한다

RLVR에서는 롤아웃을 생성하는 추론 엔진과 그래디언트를 계산하는 학습 엔진이 같은 토큰에 서로 다른 확률을 부여할 수 있습니다. 새 기법 CIS는 토큰 신뢰도를 반영한 중요도 샘플링으로 이 차이가 정책 업데이트에 미치는 영향을 줄입니다.

더 보기