아티클 목록으로
로보틱스·피지컬 AI

ShieldVLA: VLA 모델이 안전하게 회복할 수 있는 순간을 판단하는 방법

약 3분 소요

배경

비전·언어·행동(VLA) 모델은 시각 정보와 언어 지시를 로봇의 행동으로 연결하며, 조작과 내비게이션 작업에서 높은 일반화 가능성을 보여주고 있습니다. 그러나 작업을 완료하는 능력과 안전하게 완료하는 능력은 다릅니다. 로봇이 위험한 상태에 가까워졌을 때 핵심은 현재 상태가 위험한지 여부만이 아니라, 아직 안전한 상태로 돌아갈 가능성이 남아 있는지를 판단하는 것입니다.

ShieldVLA는 이 회복 가능성을 VLA 안전 미세조정의 핵심 기준으로 삼습니다. Hamilton-Jacobi(HJ) 도달 가능성의 개념을 바탕으로, 시각 관측에서 모델 프리 도달 가능성 가치 함수의 근사치를 학습하는 안전 critic을 제안합니다. 이 critic은 현재 관측이 안전한 운용 영역에 있는지, 또는 안전하게 회복할 수 있는 영역에 남아 있는지를 추정합니다.

핵심 접근

  • 실행 가능성에 따른 정책 최적화. 현재 상태가 안전하게 회복 가능한 범위라면 정책은 작업 보상을 계속 최대화합니다. 반대로 위험 상태에 가까워지면 정상적인 작업 진행보다 회복 행동을 우선하도록 학습합니다.
  • 고정 페널티의 한계 보완. 라그랑주 기반 방법은 예상 누적 비용에 소프트 페널티를 부여합니다. 페널티가 약하면 안전 제약 위반이 남고, 너무 강하면 정책이 필요 이상으로 보수적으로 변할 수 있습니다. ShieldVLA는 critic을 이용해 상태에 따라 우선할 목표를 바꿉니다.
  • VLM을 활용한 안전 감독. 시각 환경의 모든 시간 단계에 수작업으로 안전 비용을 부여하는 것은 어렵습니다. 이 방법은 루브릭 기반 VLM 안전 점수를 구조화된 critic 학습 목표로 바꿔, 직접적인 비용 라벨에 대한 의존도를 낮춥니다.
  • 여러 모델과 환경에서 평가. 제공된 자료에 따르면 OpenVLA-OFT, OmniVLA, SPOC-VLA 등이 평가에 사용되었습니다. 예시로 Dubins-VL, TurtleBot-Nav, Safety-CHORES, Franka-Reach가 제시되며, 초록은 내비게이션과 조작을 포함한 총 5개 벤치마크를 언급합니다.

의미와 한계

논문은 5개 벤치마크에서 누적 안전 비용이 평균 57% 감소했고, SafeVLA보다 작업 성공률이 0.13 향상됐다고 보고합니다. 이 결과의 의미는 안전을 에피소드 전체에 동일한 벌점으로 적용하지 않는 데 있습니다. 상태가 실행 가능한 동안에는 작업을 수행하고, 정상적인 진행이 안전한 결과를 위협할 때는 회복을 우선하는 방식입니다.

이런 설계는 로봇의 유용성과 과도한 신중함 사이의 긴장을 완화할 가능성이 있습니다. 동시에 VLM 점수의 보정 품질, 시각 관측만으로 숨은 위험을 파악하는 능력, 시뮬레이션 또는 벤치마크에서 실제 로봇으로의 일반화는 추가 검증이 필요합니다. ShieldVLA는 모든 로봇 위험을 해결하는 최종 해법이라기보다, VLA 안전 정렬에 안전 경계와 회복 가능성을 명시적으로 포함하는 학습 프레임워크로 보는 편이 적절합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
HuRo, 인간 영상을 확장 가능한 VLA 사전학습 데이터로 변환
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

HuRo, 인간 영상을 확장 가능한 VLA 사전학습 데이터로 변환

HuRo는 서로 다른 인간 조작 영상을 로봇에 맞는 관측과 행동 궤적으로 변환하는 로봇화 파이프라인을 제안한다. 실험 결과, 이 데이터를 활용한 사전학습 규모를 키우면 실제 조작 성능과 분포 외 일반화가 함께 향상됐다.

더 보기