아티클 목록으로
로보틱스·피지컬 AI

MobileVLA-R1 2.0, 강화학습으로 로봇 추론과 행동 연결

약 2분 소요

들어가며

“어디로 이동해 작업을 완료하라”는 지시를 이해하는 것과 로봇이 이를 안정적으로 수행하는 것은 다르다. 이동 로봇은 언어와 시각 정보를 해석하는 데서 그치지 않고, 긴 행동 순서를 계획하고, 이동과 조작을 수행하며, 결과에 따라 제어를 수정해야 한다. MobileVLA-R1 2.0은 이러한 고수준 의미 추론과 실제 신체 실행 사이의 간극을 줄이는 데 초점을 맞춘다.

핵심 내용

  • 추론을 학습 과정에 명시적으로 포함한다. 관측에서 행동으로 이어지는 암묵적 매핑만 사용하는 대신, 지도식 Chain-of-Thought(CoT) 정렬과 강화학습을 통해 시간 범위와 작업 수준이 다른 궤적 추론을 학습한다.
  • 고수준 목표와 구체적 제어를 분리한다. 다중모달 추론 표현을 작업 수준의 행동 목표로 바꾸고, 로봇별 컨트롤러가 이를 실제 명령으로 변환한다. 이 구조는 공통된 인식·추론·행동 인터페이스를 유지하면서 고수준 모델이 모든 구동기 세부사항을 직접 다루지 않도록 한다.
  • 여러 로봇 형태를 다룬다. 언어 기반 내비게이션, 사족보행 로봇 제어, 휴머노이드 이동 조작을 평가했으며, VLN-CE와 QUARD, Unitree Go2 및 G1의 실제 배포가 포함됐다.
  • 장기 작업의 개선을 보고한다. VLN-CE에서 MobileVLA-R1보다 평균 SR이 1.6포인트 높아졌고, 실제 G1 이동 조작 작업에서는 전체 작업 성공률이 10.0포인트 향상됐다고 논문은 설명한다.

의미와 영향

이 연구의 핵심은 VLA 모델에 단순히 사고 과정을 덧붙이는 데 있지 않다. 중간 추론을 로봇의 궤적, 작업 목표, 폐루프 제어와 연결하려는 시도라는 점이 중요하다. 장기 작업에서 각 행동을 독립적으로 예측하는 방식보다 전체 목표와 현재 행동의 관계를 지속적으로 유지하는 데 도움이 될 가능성이 있다.

작업 수준의 목표와 로봇별 제어를 나누는 설계는 서로 다른 신체 구조와 구동기를 가진 플랫폼에 고수준 모델을 재사용하는 방법으로도 의미가 있다. 다만 제공된 요약에는 세부 벤치마크 결과, 학습 비용, 실패 사례가 모두 공개돼 있지는 않다. 낯선 환경에서의 일반화, 추론 비용, 실제 운용 안정성은 전체 논문과 구현을 통해 추가로 확인해야 한다.

결국 MobileVLA-R1 2.0은 “무엇을 해야 하는가”라는 추론과 “실제로 성공할 수 있는가”라는 실행 사이의 차이를 강화학습으로 줄이려는 실용적인 방향을 보여준다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
범용 에이전트가 로봇을 직접 조종하는 Agent as Policy
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

범용 에이전트가 로봇을 직접 조종하는 Agent as Policy

Agent as Policy는 범용 코딩 에이전트를 실제 로봇에 연결해 시각 정보를 해석하고 실행 가능한 프로그램과 동작 명령을 생성하도록 합니다. 로봇의 실제 결과를 다시 관찰해 다음 행동을 수정하는 방식으로, 작업별 전용 학습 없이 조작을 수행하는 가능성을 보여줍니다.

더 보기
CCTest · Blog
PhysBrain 1.5, 인식·행동 생성·미래 예측을 하나로 통합
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

PhysBrain 1.5, 인식·행동 생성·미래 예측을 하나로 통합

PhysBrain 1.5는 비전-언어 모델을 물리 환경 이해, 엔드이펙터 동작 생성, 미래 상태 예측까지 수행하는 체화형 기반 모델로 확장하려는 연구입니다. 논문에 따르면 8B 모델은 28개 체화 이해 벤치마크에서 평균 72.5점을 기록했습니다.

더 보기
CCTest · Blog
로봇의 시각적 지름길을 끊는 LIT의 일반화 전략
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

로봇의 시각적 지름길을 끊는 LIT의 일반화 전략

로봇 파운데이션 모델은 익숙한 환경에서는 높은 성능을 내지만, 행동과 우연히 연결된 시각 단서에 의존할 수 있습니다. Latent Interface Training(LIT)은 공간 목표 기반 행동 사전분포와 자세 감독 잠재 인터페이스를 통해 카메라, 조명, 방해물 변화에 대한 강건성을 높입니다.

더 보기