아티클 목록으로
로보틱스·피지컬 AI

로봇 실행 오차를 VLA가 스스로 보정하는 방법

약 3분 소요

들어가며: 예측이 맞아도 로봇은 실패할 수 있다

시각·언어·행동 모델(VLA)은 이미지와 언어 지시, 로봇 상태를 바탕으로 실행할 동작을 생성한다. 그러나 모델이 출력한 명령과 하드웨어가 실제로 수행하는 움직임은 항상 같지 않다. 관절 마찰은 움직임을 지연시키고, 백래시는 방향 전환 때 오차를 만든다. 탑재물의 무게, 열 상태, 장기간 사용에 따른 마모도 로봇의 반응을 바꾼다.

이 차이가 누적되면 VLA가 합리적인 동작 순서를 예측했더라도 작업은 실패할 수 있다. 포항공과대학교 연구팀은 이 문제를 배포 시점의 적응 문제로 보고, ‘자기 보상 VLA’를 제안했다. 모든 하드웨어 조건을 학습 단계에서 다루는 대신, 실제 로봇이 움직이며 만들어내는 오차를 사용해 정책을 조정하는 접근이다.

핵심 방법: 명령과 실행의 잔차를 학습 신호로 사용

  • VLA는 평소처럼 동작을 생성하며, 기존 로봇 컨트롤러는 그대로 둔다.
  • 고유수용성 피드백으로 로봇이 실제 수행한 움직임을 기록한다.
  • 명령된 동작과 실행 결과의 차이를 온라인 적응 신호로 사용한다.
  • 작업 보상이나 사람의 라벨 없이 작은 LoRA 어댑터를 업데이트한다.

이렇게 하면 모델은 로봇이 현재 어떤 방식으로 반응하는지 학습하고, 다음 명령을 미리 보정할 수 있다. 완전한 동역학 모델을 별도로 구축하지 않아도 특정 관절의 부족한 움직임이나 지연된 응답 같은 경향에 대응할 수 있다는 점이 특징이다.

RoboStress: 상태와 이력에 따라 달라지는 오차 평가

연구팀은 물리 로봇만으로 광범위하게 재현하기 어려운 실행 조건을 평가하기 위해 RoboStress라는 시뮬레이션 벤치마크도 제시했다. 관절 수준에서 마찰, 백래시, 컴플라이언스, 중력 보상 오차를 모델링하고, 로봇의 상태와 과거 움직임에 따라 실행 오차가 달라지는 7개 배포 시나리오를 구성했다. 소개된 조건에는 무거운 하중, 열 드리프트, 기계적 마모가 포함된다.

이는 학습 중 무작위 잡음을 넣는 방식과 다르다. 실제 로봇에서는 같은 명령이라도 관절 위치, 이동 방향, 직전 궤적에 따라 결과가 달라질 수 있기 때문이다. 보고된 결과에 따르면 자기 보상 방식은 두 VLA 백본 모두에서 7개 시나리오 전부에 걸쳐 기본 정책, 도메인 랜덤화, RobustVLA보다 높은 성능을 보였다.

실물 검증에서는 사용 이력이 서로 다른 두 대의 Piper 로봇 팔을 사용했다. 두 로봇 모두 평균 작업 성공률이 30%포인트 이상 향상됐다. 작업 시연에 등장하지 않은 물체에서도 π₀.₅의 성공률은 16%에서 64%로 증가했다. 이는 특정 물체를 외워서 얻은 개선이라기보다, 로봇의 실행 특성 자체에 적응한 결과로 해석할 수 있다.

의미와 남은 과제

이 연구는 로봇 적응의 초점을 학습 전 데이터 수집에서 배포 중 피드백 활용으로 옮긴다. 로봇이 마모되거나 하중이 바뀔 때마다 라벨이 붙은 시연 데이터를 다시 모아야 하는 부담을 줄일 수 있어, 장기간 운영되는 로봇 시스템에 의미가 있다.

다만 온라인 적응에는 피드백 잡음과 비정상적인 움직임을 안정적으로 처리해야 한다는 과제가 남는다. 잘못된 보정은 작업 품질뿐 아니라 안전에도 영향을 줄 수 있다. RoboStress는 통제된 비교 환경을 제공하지만, 더 다양한 로봇과 장기 운용에서의 안정성은 추가 검증이 필요하다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Skill2Real: 로봇 조작 기술을 시뮬레이션에서 현실로
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

Skill2Real: 로봇 조작 기술을 시뮬레이션에서 현실로

Skill2Real은 작업별 정책을 다시 미세 조정하는 대신, 공통 API를 통해 실행 가능한 로봇 조작 기술을 이전하는 에이전트형 프레임워크를 제안한다. 계층적 메모리와 제안자·검증자·거버너 루프를 활용해 동결된 시뮬레이션 기술의 실제 로봇 적용 가능성을 평가했다.

더 보기
CCTest · Blog
MotorMind, 범용 VLM의 제로샷 로봇 조작을 시험하다
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

MotorMind, 범용 VLM의 제로샷 로봇 조작을 시험하다

MotorMind는 범용 비전·언어 모델이 로봇의 관찰, 행동 선택, 실행 확인을 직접 수행할 수 있는지 검증하는 실행 프레임워크다. 중간 수준 행동 표현과 비동기 피드백을 활용해 전용 정책이나 코딩 에이전트 없이 로봇 조작을 시도한다.

더 보기