아티클 목록으로
로보틱스·피지컬 AI

PhysBrain 1.5, 인식·행동 생성·미래 예측을 하나로 통합

약 3분 소요

들어가며

물리 세계에서 작동하는 로봇은 장면을 설명하는 것만으로는 충분하지 않습니다. 관찰한 대상을 과업의 목적과 연결하고, 어떤 움직임을 만들어야 하는지 결정하며, 행동 이후 환경이 어떻게 달라질지도 예측해야 합니다. PhysBrain 1.5는 이러한 관찰, 상호작용, 환경 변화의 고리를 하나의 체화형 기반 모델 안에서 다루려는 접근입니다.

하나의 시퀀스 모델

PhysBrain 1.5는 범용 비전-언어 모델에서 출발하지만 로봇 기능을 완전히 별도 제어 모듈로 분리하지 않습니다. 언어 응답, 엔드이펙터의 움직임, 미래 장면을 나타내는 조밀한 시각 목표를 모두 이산 시퀀스로 표현합니다. 이후 공통의 자기회귀형 다음 토큰 예측 방식으로 이들을 함께 학습합니다.

이 구조에서는 서로 다른 출력 형식이 동일한 모델링 인터페이스를 공유합니다. 언어 토큰은 과업의 의미를 표현하고, 운동 시퀀스는 공간적 조작을 나타내며, RGB·깊이·로봇 마스크 같은 시각 목표는 행동 이후의 환경 상태를 묘사합니다. 따라서 장면 이해, 행동 생성, 상태 예측을 하나의 학습 문제로 연결할 수 있습니다. 그러나 이 방식만으로 제어 지연, 안전성, 로봇 하드웨어 차이, 낯선 환경에서의 강건성이 자동으로 해결되는 것은 아닙니다.

사전 학습에 사용되는 체화 감독은 사람의 상호작용 영상에서 얻습니다. 영상을 단순한 연속 프레임으로 처리하는 대신 과업 중심 에피소드로 구성하고, 의미 및 공간적 맥락을 복원된 움직임과 이후 관찰 결과에 대응시킵니다. 이어 인간 시연, 로봇 궤적, 시뮬레이션 경험을 섞은 지도 미세 조정을 수행해 로봇 관련 행동에 적응시킵니다.

결과와 영향

논문은 8B 모델이 28개 체화 이해 벤치마크에서 평균 72.5점을 기록했다고 보고합니다. 이 가운데 14개에서는 오픈소스 모델 최고 결과를 달성했으며, 논문이 비교 대상으로 제시한 일부 폐쇄형 모델과 비슷한 수준의 성능을 보였다고 설명합니다. 정성적 사례로는 엔드이펙터 궤적 생성과 RGB·깊이·로봇 마스크를 공간적으로 정렬한 미래 장면 예측이 제시됩니다.

이 연구의 의미는 단순히 종합 점수에 있지 않습니다. 사람의 영상에서 상호작용의 관계를 학습하고, 로봇 데이터와 시뮬레이션으로 실행에 가까운 정보를 보완하는 방식은 범용 멀티모달 지식과 물리적 행동을 연결하는 학습 경로를 제안합니다. 하나의 토큰 기반 백본이 여러 로봇 플랫폼에서도 안정적으로 작동한다면, 비전-언어 모델은 질문에 답하는 시스템을 넘어 물리 세계의 의사결정에 참여할 수 있습니다.

다만 제공된 소재에는 세부 벤치마크 점수, 실제 로봇 성공률, 추론 지연, 장기 상호작용 평가가 포함돼 있지 않습니다. 따라서 이번 결과를 범용 로봇 제어의 완성으로 보기보다는, 통합형 체화 모델을 향한 중요한 단계적 성과로 해석하는 편이 적절합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
범용 에이전트가 로봇을 직접 조종하는 Agent as Policy
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

범용 에이전트가 로봇을 직접 조종하는 Agent as Policy

Agent as Policy는 범용 코딩 에이전트를 실제 로봇에 연결해 시각 정보를 해석하고 실행 가능한 프로그램과 동작 명령을 생성하도록 합니다. 로봇의 실제 결과를 다시 관찰해 다음 행동을 수정하는 방식으로, 작업별 전용 학습 없이 조작을 수행하는 가능성을 보여줍니다.

더 보기
CCTest · Blog
MobileVLA-R1 2.0, 강화학습으로 로봇 추론과 행동 연결
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

MobileVLA-R1 2.0, 강화학습으로 로봇 추론과 행동 연결

MobileVLA-R1 2.0은 구조화된 체화 추론, 강화학습, 추론 조건부 행동 디코더를 결합해 언어 이해와 실제 로봇 실행 사이의 간극을 줄이려는 VLA 프레임워크다. 내비게이션, 사족보행 제어, 휴머노이드 이동 조작에서 평가됐다.

더 보기
CCTest · Blog
로봇의 시각적 지름길을 끊는 LIT의 일반화 전략
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

로봇의 시각적 지름길을 끊는 LIT의 일반화 전략

로봇 파운데이션 모델은 익숙한 환경에서는 높은 성능을 내지만, 행동과 우연히 연결된 시각 단서에 의존할 수 있습니다. Latent Interface Training(LIT)은 공간 목표 기반 행동 사전분포와 자세 감독 잠재 인터페이스를 통해 카메라, 조명, 방해물 변화에 대한 강건성을 높입니다.

더 보기