DiVeR, VLA 검증기를 로봇의 핵심 의사결정에 집중시키다
들어가며
비전-언어-행동(VLA) 모델은 복잡한 로봇 조작을 위한 핵심 기반으로 자리 잡고 있다. 하지만 더 많은 로봇 데이터와 더 큰 모델을 활용해 성능을 높이는 방식은 데이터 수집과 학습 비용을 크게 늘린다. 테스트 시 스케일링은 다른 접근을 제시한다. 같은 관측에 대해 여러 행동 후보를 생성하고, 검증기가 그중 작업 성공으로 이어질 가능성이 높은 후보를 선택하도록 하는 것이다.
DiVeR가 주목한 문제는 검증기가 궤적의 어느 상태를 중점적으로 학습해야 하는가이다. 기존 분류 기반 검증기는 대체로 궤적 단위의 성공 또는 실패 결과를 사용하며, 방문한 상태를 비슷한 비중으로 취급한다. 그러나 많은 상태에서는 타당한 행동 후보들이 서로 유사하기 때문에 어느 후보를 선택하든 최종 결과에 미치는 차이가 작다. 반대로 소수의 상태에서는 행동 후보가 크게 갈리고, 그 선택이 이후의 성공과 실패를 좌우할 수 있다.
핵심 아이디어
- 행동 분산으로 중요도 추정: 여러 후보 행동의 표현을 비교하고, 표현 공간에서 분산이 큰 상태를 선택의 결과가 더 중요할 수 있는 지점으로 간주한다.
- 검증기 학습 재가중: 궤적의 모든 상태에 동일한 학습 압력을 주는 대신, 후보 행동의 차이가 큰 상태에 더 많은 비중을 부여한다.
- 추가 감독 신호를 줄임: 각 단계에 별도의 성공·실패 라벨을 붙이거나 새로운 환경 상호작용을 수행하지 않고, 이미 생성된 후보 행동에서 의사결정 중요도 신호를 얻는다.
- 낮은 추론 오버헤드: 샘플링된 행동 표현을 활용하기 때문에 논문은 검증기 추론 비용이 거의 증가하지 않는다고 설명한다.
실험과 의미
DiVeR는 LIBERO, RoboCasa, 그리고 Franka Research 3 로봇을 활용한 실제 환경 실험에서 평가됐다. 논문 초록에 따르면 여러 설정에서 검증기가 후보 행동을 더 효과적으로 선택하도록 만들었으며, 그 결과 작업 성공률을 일관되게 높였다.
이 연구가 제시하는 관점은 테스트 시 스케일링이 단순히 후보를 많이 생성하는 문제만은 아니라는 것이다. 후보 간 차이가 실제로 중요한 순간을 찾아내야 추가 샘플링의 가치가 살아난다. 장기 조작 과제에서는 로봇이 궤적 전체를 균등하게 평가하기보다, 접촉, 파지, 장애물 회피, 행동 전환처럼 이후 결과를 바꿀 수 있는 상태에 검증 능력을 집중하는 편이 효율적일 수 있다.
다만 행동 표현의 분산은 의사결정 중요도를 직접 측정하는 값이 아니라 대리 지표다. 표현 공간에서의 차이가 실제 미래 결과와 얼마나 잘 연결되는지, 그리고 생성된 후보 행동의 품질이 충분한지는 여전히 중요한 조건이다. 그럼에도 DiVeR는 추가 로봇 데이터나 단계별 주석 없이 기존 VLA 테스트 시 추론 과정에 적용할 수 있는 실용적인 개선 방향을 제시한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…