아티클 목록으로
로보틱스·피지컬 AI

CARE, VLA 로봇이 실행 실패에서 스스로 복구하도록 돕다

약 3분 소요

배경

비전-언어-행동(VLA) 정책은 시각 정보와 자연어 지시를 로봇의 물리적 행동으로 연결하는 기술입니다. 하지만 학습 당시의 정상 궤적에서 실행이 조금만 벗어나도 정책이 급격히 불안정해질 수 있습니다. 물체를 약간 빗나가게 잡거나, 예상과 다른 자세로 물체가 놓이거나, 하위 작업 사이의 전환이 실패하면 로봇은 잘못된 행동을 계속할 수 있습니다. 이런 오류가 누적되면 부분적인 문제 하나가 전체 작업 실패로 이어집니다.

논문 ‘CARE: Experience-Guided Atomic Corrective Execution for Vision-Language-Action Policies’는 이 문제를 실행 중 실패 이후의 회복 능력이라는 관점에서 다룹니다. 목표는 작업을 처음부터 다시 시작하는 것이 아니라, 남아 있는 진행 상황을 활용해 필요한 부분만 바로잡는 것입니다.

CARE의 핵심 아이디어

  • 실제 실패를 학습 데이터로 활용: 수작업으로 만든 섭동이나 무작위 변화만으로 교정 데이터를 생성하는 대신, 실제 실행에서 발생한 실패 롤아웃을 수집합니다.
  • 단계별 실패 편차 모델링: 잡기, 이동, 배치 등 어느 단계에서 실패했는지에 따라 적절한 복구 방식은 달라질 수 있습니다. CARE는 실행 단계에 조건을 둔 실패 후 편차를 모델링하고, 경험적 분포를 이용해 대표적인 실패 상태와 교정 시연을 만듭니다.
  • 원자적 교정 실행: 추론 시 작업을 여러 단계로 나누어 계획하고, 문제가 생기면 작은 조정이나 특정 작업의 재실행을 선택합니다. 전체 절차를 무조건 처음부터 반복하는 방식과 구별됩니다.
  • 물리적으로 근거 있는 3D 모니터링: 장면과 로봇의 상태를 3차원으로 모니터링해, 작업 진행을 유지할 수 있는 시점에 교정 행동을 시작하도록 합니다.

실패 복구를 직접 평가하는 FSR-Bench

CARE는 Failure State Recovery Benchmark(FSR-Bench)도 제안합니다. 이 벤치마크는 작업 도중 발생한 국소적 편차와 구조적 이상에서 로봇이 회복할 수 있는지를 평가합니다. 이는 최종 성공률만 측정하는 평가를 보완합니다. 정상적인 조건에서 작업을 끝내는 능력과, 이미 오류가 발생한 뒤에도 작업을 이어가는 능력은 실제 로봇 시스템에서 서로 다른 역량이기 때문입니다.

논문 초록에 따르면 CARE는 여러 VLA 백본, 시뮬레이션 벤치마크, 실제 양팔 로봇 작업에서 검증되었습니다. 평균 작업 성공률 향상 폭은 시뮬레이션에서 14.5포인트, 실제 환경에서 15.9포인트로 보고되었습니다. 다만 제공된 자료에는 모델별·작업별 세부 결과가 없으므로, 이 수치는 전체적인 성능 경향으로 해석하는 것이 적절합니다.

의미와 과제

CARE의 중요한 점은 실패를 폐기해야 할 사례가 아니라 회복 정책을 개선하는 경험으로 본다는 데 있습니다. 장기 조작 작업에서는 작은 오류가 발생할 때마다 전체 과정을 재시작하는 것이 비효율적이며, 재시작 자체가 추가 오류를 만들 수도 있습니다. 원자적 교정은 이런 연쇄 실패를 줄이기 위한 실용적인 방향을 제시합니다.

그러나 성능은 실패 롤아웃의 다양성, 작업 단계 구분의 정확성, 3D 상태 모니터링의 신뢰성에 좌우될 수 있습니다. 더 개방적인 환경과 새로운 물체 구성에서도 일반화되는지는 추가 검증이 필요합니다. 코드와 모델, 데이터가 공개되어 있어 실패 인지형 VLA 연구를 재현하고 확장할 수 있는 기반을 제공합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
HuRo, 인간 영상을 확장 가능한 VLA 사전학습 데이터로 변환
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

HuRo, 인간 영상을 확장 가능한 VLA 사전학습 데이터로 변환

HuRo는 서로 다른 인간 조작 영상을 로봇에 맞는 관측과 행동 궤적으로 변환하는 로봇화 파이프라인을 제안한다. 실험 결과, 이 데이터를 활용한 사전학습 규모를 키우면 실제 조작 성능과 분포 외 일반화가 함께 향상됐다.

더 보기
CCTest · Blog
Grounded Action Model, 3D 그라운딩을 로봇 제어의 기반으로
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

Grounded Action Model, 3D 그라운딩을 로봇 제어의 기반으로

Grounded Action Model(GAM)은 로봇이 조작해야 할 물체와 그 위치를 명시적으로 이해하도록 설계된 행동 모델입니다. 언어·점·박스 프롬프트를 물체 중심의 3D 표현으로 통합해 장면 변화와 목표물 이동에 대한 대응력을 높입니다.

더 보기
CCTest · Blog
RoboDawn, 비전언어모델의 추론을 로봇 제어로 옮기다
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

RoboDawn, 비전언어모델의 추론을 로봇 제어로 옮기다

RoboDawn은 이동, 회전, 그리퍼 조작을 간결한 이산 명령으로 구성해 에이전트형 비전언어모델이 로봇을 제어하도록 한다. 폐루프 상호작용과 소수의 시연만으로 시뮬레이션과 실제 로봇 작업에서 성능 향상을 확인했다.

더 보기