아티클 목록으로
로보틱스·피지컬 AI

ReactHuman, 멀티모달 모델의 즉각적인 물리 반응을 평가하다

약 3분 소요

들어가며

탁자 끝에서 접시가 미끄러지거나 칼이 떨어지는 순간, 가정용 로봇에는 긴 추론 시간이 주어지지 않습니다. 물체를 잡을지, 위험을 피할지, 개입이 오히려 상황을 악화시키지 않을지를 빠르게 판단해야 합니다. ReactHuman은 물리 현상을 설명하는 능력을 넘어, 그 이해를 안전한 즉각 행동으로 바꿀 수 있는지를 평가합니다.

기존 평가의 빈틈을 겨냥하다

기존의 물리 상식 평가는 비디오를 본 뒤 질문에 답하게 하는 방식이 많았습니다. 로봇 평가에서는 내비게이션, 조작, 정리처럼 긴 시간 범위의 과제가 주로 다뤄졌습니다. ReactHuman은 이 두 영역 사이에 있는 ‘갑작스러운 위험에 대한 반응’을 측정합니다. 평가 대상인 멀티모달 모델은 시뮬레이션된 휴머노이드의 의사결정 핵심으로 작동하며, 가정 내 위험에 대응하는 행동 계획을 제출합니다.

이 벤치마크는 17개 사건군과 1,000개 이상의 비트 단위 재현 가능 장면으로 구성됩니다. 장면은 240 Hz 강체 물리 시뮬레이션으로 생성되며, 정답은 수작업 프레임 주석이 아니라 시뮬레이션 상태에서 직접 도출됩니다. 또한 거품으로 만든 모루와 강철 사과처럼 외관과 실제 물성이 어긋나는 적대적 객체도 포함합니다. 이를 통해 모델이 실제 운동과 재질보다 시각적 고정관념을 따르는지 확인할 수 있습니다.

답변이 아니라 행동을 평가

ReactHuman은 다섯 가지 지표를 세 가지 관점으로 묶어 평가합니다.

  • 합리성: 상황과 목표에 맞는 반응인지 여부
  • 안전성: 위험과 피해를 줄이는 행동인지 여부
  • 물리적 근거: 움직임, 재질, 충돌, 시간 관계를 실제로 활용했는지 여부

모델이 제출한 계획은 시뮬레이터에서 실제로 실행됩니다. 따라서 말로는 그럴듯한 답을 내놓는 것만으로 충분하지 않습니다. 예를 들어 떨어지는 물체를 가로막는다는 전략이 맞더라도, 접촉 위치를 크게 빗나가면 행동은 실패로 기록됩니다.

실험이 보여준 문제

연구진은 대표적인 멀티모달 대규모 모델 7종을 평가했습니다. 모델들은 위험 상황 약 세 건 중 한 건을 잘못 처리했습니다. 관찰한 장면에 맞춰 행동을 조정하기보다 고정된 행동 성향을 따르는 경우가 있었고, 실제 운동보다 물체의 외관을 신뢰하기도 했습니다. 행동 유형 자체는 맞아도 정확한 가로채기 지점을 놓치는 문제도 나타났습니다.

이러한 약점은 모델 규모가 커져도 줄어들지 않았습니다. 이는 더 강한 언어 능력이나 시각 인식 능력이 반응형 안전성으로 자동 연결되지 않는다는 점을 보여줍니다. 시간, 거리, 운동, 행동 결과를 하나의 판단 과정에서 연결하는 별도의 학습이 필요합니다.

의미와 영향

ReactHuman의 핵심 가치는 체화된 의사결정에서 행동의 결과를 측정 가능하게 만든 데 있습니다. 가정용 로봇에는 합리적인 설명보다 빠르고 실행 가능하며 물리적으로 신뢰할 수 있는 반응이 필요합니다. 이 벤치마크는 운동 예측, 위험 인식, 가로채기, 위험 민감형 행동 선택을 개선하기 위한 세밀한 실패 신호를 제공할 수 있습니다.

시뮬레이션이 센서 잡음, 구동기 지연, 복잡한 접촉을 모두 재현하는 것은 아닙니다. 그러나 실제 배치 전에 문제를 반복 가능하게 분리하고 진단할 수 있다는 점은 중요합니다. 물리 법칙을 이해하는 능력과 위험한 순간에 올바르게 반응하는 능력은 서로 관련되어 있지만 동일하지 않으며, 현재의 멀티모달 모델은 아직 두 능력을 안정적으로 연결하지 못하고 있습니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
PhysBrain 1.5, 인식·행동 생성·미래 예측을 하나로 통합
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

PhysBrain 1.5, 인식·행동 생성·미래 예측을 하나로 통합

PhysBrain 1.5는 비전-언어 모델을 물리 환경 이해, 엔드이펙터 동작 생성, 미래 상태 예측까지 수행하는 체화형 기반 모델로 확장하려는 연구입니다. 논문에 따르면 8B 모델은 28개 체화 이해 벤치마크에서 평균 72.5점을 기록했습니다.

더 보기
CCTest · Blog
범용 에이전트가 로봇을 직접 조종하는 Agent as Policy
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

범용 에이전트가 로봇을 직접 조종하는 Agent as Policy

Agent as Policy는 범용 코딩 에이전트를 실제 로봇에 연결해 시각 정보를 해석하고 실행 가능한 프로그램과 동작 명령을 생성하도록 합니다. 로봇의 실제 결과를 다시 관찰해 다음 행동을 수정하는 방식으로, 작업별 전용 학습 없이 조작을 수행하는 가능성을 보여줍니다.

더 보기