아티클 목록으로
로보틱스·피지컬 AI

WorldLine, 로봇 행동을 시각 세계에서 먼저 검증하다

약 3분 소요

들어가며

로봇이 물체를 집거나 밀고 내려놓는 방법을 배우려면 대개 실제 환경에서 수많은 상호작용을 반복해야 한다. 매 시도마다 시간과 장비 가동 시간을 소모하며, 사람의 확인이 필요한 경우도 있다. 반대로 시각 시뮬레이터가 행동을 실행하기 전에 장면의 변화를 예측할 수 있다면, 실제 실행에 앞서 여러 정책과 행동 후보를 비교할 수 있다.

그러나 기존 영상 생성 모델은 행동의 정확한 결과보다 그럴듯한 화면을 만드는 데 치우치기 쉽다. 영상이 자연스러워 보여도 로봇의 지정된 움직임을 제대로 따르지 못하거나, 로봇과 물체 사이의 인과적 상호작용을 일관되게 표현하지 못할 수 있다. 홍콩과학기술대 연구진의 WorldLine은 이 문제를 행동 구동형 시각 시뮬레이션으로 다룬다.

핵심 설계

WorldLine의 중심 아이디어는 두 가지 학습 과제를 분리하는 것이다. 먼저 대규모 로봇 영상에서 특정 로봇에 덜 의존하는 조작 동역학을 학습한다. 이후 각 로봇의 제어 신호가 이 공통 동역학을 어떻게 유도하는지 학습한다. 이를 통해 제어 공간이 서로 다른 로봇의 데이터를 하나의 시뮬레이터에 활용하려는 것이다.

  • 행동 정보가 없는 영상 활용. 1만 시간 이상의 로봇 영상에서 로봇의 움직임, 장면 변화, 물체와의 상호작용에 관한 시각적 규칙을 학습한다.
  • 행동 궤적을 통한 제어 정렬. 10개가 넘는 로봇 형태에서 얻은 2000시간 이상의 궤적을 사용해 실제 제어와 공통 동역학 모델을 연결한다.
  • 이미지 공간 행동 표현. 로봇마다 다른 제어 인터페이스 사이에 공유 가능한 시각적 행동 표현을 둔다.
  • 상호작용 중심 학습. 다중 뷰 데이터와 실패 궤적, 관계 정규화를 사용해 단순한 화질이 아니라 로봇-물체 관계를 보존하도록 한다.
  • 효율적인 인과 롤아웃. 로봇 움직임에 초점을 맞춘 소단계 증류로 예측에 필요한 계산 단계를 줄이면서 행동 결과에 중요한 움직임을 유지한다.

결과와 의미

유보된 환경과 도메인 밖 설정에서 WorldLine은 시각적 품질과 로봇 움직임의 일치도를 함께 평가했다. 실패 궤적에서 로봇 마스크 IoU는 가장 강한 기준선보다 0.1626 높았다. RoboTwin과 AgiBot에서 궤적 성공 여부를 예측하는 평균 정확도는 74%로, 가장 강한 기준선보다 1%포인트 높았다. 또한 RoboTwin 데이터로 학습하거나 별도 적응을 하지 않은 조건에서도, WorldLine의 롤아웃을 활용하면 정책을 직접 실행하는 경우보다 작업 성공률이 최대 21.4%포인트 향상됐다.

이 연구의 의미는 생성 영상을 단순한 시각 예측 결과가 아니라 정책 평가 도구로 사용한다는 데 있다. 로봇은 실제 행동을 수행하기 전에 여러 후보를 가상 시각 세계에서 비교하고, 실패 가능성이 높은 행동을 걸러낼 수 있다. 동역학 학습과 행동 정렬을 분리한 구조는 서로 다른 로봇 플랫폼의 영상 데이터를 재사용할 가능성도 보여준다.

다만 수치는 논문에서 제시한 벤치마크와 조건에 기반한다. 따라서 현실 환경과 시뮬레이션 사이의 차이가 사라지는 것은 아니며, 실제 배치에는 하드웨어 안전장치와 물리적 검증이 여전히 필요하다. 그럼에도 WorldLine은 값비싼 실세계 시행착오를 줄이고, 정책 선별과 체화 계획을 지원하는 확장 가능한 시각 시뮬레이터의 방향을 제시한다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
EmbodiedMemory-Bench, 장기 과제로 구현형 AI의 기억을 평가하다
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

EmbodiedMemory-Bench, 장기 과제로 구현형 AI의 기억을 평가하다

EmbodiedMemory-Bench는 장기간 환경과 상호작용하는 구현형 에이전트의 기억 능력을 실행 가능한 과제로 평가하는 벤치마크입니다. 세밀한 시각 기억부터 과거 경험의 일반화까지 측정하고, 구조화된 외부 메모리 시스템 EMem과 EMem-8B도 제시합니다.

더 보기
CCTest · Blog
로봇을 프로그래머처럼 움직이게 하는 Physical Coding
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

로봇을 프로그래머처럼 움직이게 하는 Physical Coding

Physical Coding은 로봇의 세계 상태와 실행 절차를 확인하고 수정할 수 있는 프로그램으로 표현하는 접근법입니다. HexaAnything는 여러 도구와 외부 피드백을 연결해 환경 변화와 실행 실패에 대응하려 합니다.

더 보기
CCTest · Blog
RoboFoundry, 로봇의 실행 경험을 진화하는 시스템으로 전환
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

RoboFoundry, 로봇의 실행 경험을 진화하는 시스템으로 전환

RoboFoundry는 컨텍스트, 메모리, 스킬, 실행 인터페이스를 하나의 ‘시스템-정책’으로 다루는 임바디드 에이전트 프레임워크를 제안한다. 여러 벤치마크에서 장기 기억과 작업 수행 능력의 개선을 보고했다.

더 보기