DreamTrue, 로봇 월드 모델의 행동 충실도를 높이다
들어가며
로봇 월드 모델이 실제 제어에 활용되려면 그럴듯한 영상을 만드는 것만으로는 부족합니다. 로봇이 어떤 행동을 입력받았을 때, 그 행동에 맞는 물체의 움직임과 환경의 변화를 예측해야 합니다. DreamTrue는 이러한 행동 충실도와 물리적 타당성을 높이는 데 초점을 둔 다중 시점·이기종 로봇 월드 모델입니다.
논문이 지적하는 기존 데이터의 문제는 크게 두 가지입니다. 첫째, 행동과 영상 사이의 정렬이 완벽하지 않을 수 있습니다. 로봇의 센서나 카메라 보정이 부정확하면 기록된 행동 궤적과 영상 속 실제 위치가 어긋나고, 모델은 입력 행동과 다른 미래를 생성할 수 있습니다. 둘째, 로봇 데이터에는 성공 사례가 실패 사례보다 많이 포함되는 경향이 있습니다. 그 결과 모델이 실패할 가능성이 있는 접촉에서도 물체가 성공적으로 잡히거나 이동하는 미래를 편향되게 예측할 수 있습니다.
핵심 방법
DreamTrue는 먼저 행동 궤적을 이미지 공간의 조건으로 렌더링합니다. 이후 오프라인 기하 보정을 이용해 이 조건을 대상 영상과 맞춥니다. 이를 통해 모델은 로봇이 어느 위치로 이동하고, 장면 속 물체와 어떤 관계를 맺을지를 시각적 형태로 더 명확하게 처리할 수 있습니다. 특정 로봇의 제어 표현에만 의존하기보다 여러 로봇 형태에 적용할 수 있는 행동-영상 인터페이스를 만들려는 접근입니다.
두 번째 요소는 반사실적 후속 학습입니다. 연구팀은 이미 기록된 행동 궤적을 수정하고, 서로 다른 행동과 접촉 조건에서 발생할 미래 영상을 생성합니다. 이렇게 하면 모델은 관측된 성공 시연을 반복하는 데 그치지 않고, 다른 경로를 택했을 때의 결과나 접촉이 어긋났을 때의 가능성도 학습할 수 있습니다. 목적은 실제 데이터에 부족한 상호작용의 범위를 넓히는 것입니다.
그러나 생성된 반사실적 영상에는 항상 실제 세계에서 촬영된 정답 미래가 존재하지 않습니다. DreamTrue는 로봇 결함, 물체 결함, 상호작용 결함을 포함하는 인간 주석 영상 데이터셋을 만들고, 이를 이용해 체화형 비디오 보상 모델을 학습합니다. 보상 모델은 예측된 미래의 물리적·상호작용 품질을 평가하고, 그 점수는 강화학습 기반 후속 학습의 신호로 사용됩니다. 이를 통해 부자연스러운 접촉이나 실행 결과를 줄이는 방향으로 모델을 조정합니다.
결과와 영향
AgiBot 실험에서 DreamTrue는 논문이 제시한 행동 추종 성능 기준으로 최고 수준을 달성했습니다. 인간 평가에서 상호작용 결함률은 48.12%에서 6.25%로 감소했으며, 2026 AgiBot World Challenge의 월드 모델 부문에서 1위를 차지했습니다. 다만 제공된 자료에는 전체 실험 설정, 비교 모델, 세부 지표가 포함되어 있지 않으므로 결과를 종합적으로 판단하려면 원문 확인이 필요합니다.
이 연구의 의미는 월드 모델의 목표를 단순한 영상 품질에서 행동 결과의 신뢰성으로 확장했다는 데 있습니다. 기하 보정은 행동 조건의 위치 정확도를 보완하고, 반사실적 데이터는 성공 편향을 줄이며, 결함 기반 보상 모델은 실제 정답 영상이 없는 상황에서 평가 신호를 제공합니다. 앞으로는 생성된 반사실적 사례가 현실의 실패를 얼마나 잘 반영하는지, 그리고 서로 다른 로봇과 환경에서도 성능이 유지되는지를 검증해야 합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…