아티클 목록으로
로보틱스·피지컬 AI

UniWAM, 물리 추론·세계 모델링·로봇 행동을 하나로 통합

약 3분 소요

들어가며

현실 세계에서 작동하는 로봇은 장면을 인식하는 것만으로는 부족합니다. 무엇이 일어나고 있는지 이해하고, 다음에 어떤 변화가 발생할지 예측하며, 환경이 달라져도 실행 가능한 행동을 선택해야 합니다. 비전-언어-행동 모델은 사전학습된 비전-언어 모델의 의미 이해와 추론 능력을 활용할 수 있지만, 행동 중심의 학습만으로는 물리적 동역학에 대한 접지가 충분하지 않을 수 있습니다. 반대로 세계-행동 모델은 영상 생성에서 시공간적 사전지식을 얻지만, 의미 이해와 분포 밖 환경에서의 추론에는 한계가 있을 수 있습니다.

논문 「UniWAM: Unified World-Action Model」은 이러한 간극을 줄이기 위해 UniWAM이라는 통합 아키텍처를 제안합니다.

핵심 설계

  • 세 가지 기능의 통합: UniWAM은 물리 추론기, 세계 생성기, 행동 예측기를 하나의 학습 체계로 묶습니다. 각각 환경의 의미·물리 이해, 미래 시각 상태 모델링, 로봇 행동 생성에 대응합니다.
  • 서로 다른 데이터의 결합: 인간 1인칭 데이터와 로봇 데이터를 합쳐 1만 시간 이상 사용하고, 여기에 시각 질의응답 데이터를 더합니다. 인간 영상은 다양한 일상 상호작용을, 로봇 시연은 관측과 실제 제어 사이의 연결을 제공합니다.
  • 자연어로 표현한 저수준 행동: 저수준 행동을 자연어로 나타내 비전-언어 구성요소가 체화 과제에 적응하도록 하면서 기존 언어 능력을 보존하려고 합니다.
  • 구성요소별 보조 감독: VQA, 인간 1인칭 영상, 로봇 시연을 동일한 방식으로 처리하지 않고, 각 데이터의 특성에 맞는 감독 신호를 모델의 적절한 부분에 배정합니다.
  • 강건성과 효율을 위한 후학습: 미래 시각 노이즈 증강은 정확한 미래 예측에 대한 의존을 줄입니다. 이력 조건부 플로 매칭은 인코딩된 과거 행동을 활용해 행동 생성을 초기화하고, 성능을 유지하면서 디노이징 단계를 줄이는 것을 목표로 합니다.

의미와 영향

UniWAM의 핵심 의미는 ‘이해’, ‘미래 예측’, ‘행동’을 서로 분리된 기능이 아니라 하나의 학습 경로로 다루려는 데 있습니다. 제어와 분리된 세계 모델은 그럴듯한 미래를 만들 수 있어도 실제로 실행 가능한 미래를 판단하지 못할 수 있습니다. 반대로 물리적 표현이 부족한 행동 모델은 물체 관계나 접촉 상태가 달라지는 장면, 훈련 분포와 다른 환경에서 불안정해질 가능성이 있습니다. 이 능력들을 비전-언어 추론과 결합하면 로봇이 행동 전에 더 구조적으로 판단하고, 낯선 환경으로 기술을 이전하는 데 도움이 될 수 있습니다.

논문은 인간과 로봇의 공동 학습에 관한 스케일링 법칙을 처음으로 특성화한 연구라고도 설명합니다. 다만 제공된 자료에는 해당 법칙의 구체적인 형태, 전체 평가표, 세부 수치 비교가 포함되어 있지 않습니다. 따라서 여러 평가에서 SOTA를 달성했다는 주장은 논문의 요약 결론으로 이해해야 하며, 모든 과제나 하드웨어에서 우위가 확인됐다고 확대 해석해서는 안 됩니다. UniWAM은 체화 모델을 단순한 행동 예측에서 의미 이해, 시각적 동역학, 제어의 통합으로 확장하려는 한 가지 방향을 보여줍니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
RobotWorld, 다양한 로봇 작업에서 멀티모달 에이전트를 검증하다
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

RobotWorld, 다양한 로봇 작업에서 멀티모달 에이전트를 검증하다

RobotWorld는 멀티모달 에이전트가 지시와 시각 정보를 실제 로봇 행동으로 전환할 수 있는지 평가하는 시뮬레이션 벤치마크입니다. 에이전트는 복잡한 인식·제어 절차를 만들 수 있지만 상태 추적, 실패 복구, 완료 판단에서는 여전히 불안정한 모습을 보입니다.

더 보기
CCTest · Blog
Long-WAM, 로봇 제어에 더 유용한 시각적 장기 기억을 더하다
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

Long-WAM, 로봇 제어에 더 유용한 시각적 장기 기억을 더하다

NVIDIA 연구진이 실시간 로봇 제어에서 긴 시각 이력을 활용하는 Long-WAM을 공개했습니다. 단순히 컨텍스트를 늘리는 대신 자기회귀 영상 사전학습과 시스템 최적화를 결합한 접근입니다.

더 보기
CCTest · Blog
DiVeR, VLA 검증기를 로봇의 핵심 의사결정에 집중시키다
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

DiVeR, VLA 검증기를 로봇의 핵심 의사결정에 집중시키다

DiVeR는 샘플링된 행동 표현의 분산을 분석해 로봇 궤적에서 의사결정이 중요한 상태를 찾아낸다. 이 신호로 검증기 학습의 가중치를 조정해 단계별 라벨이나 추가 환경 상호작용 없이 VLA의 테스트 시 행동 선택을 개선한다.

더 보기