아티클 목록으로
로보틱스·피지컬 AI

Long-WAM, 로봇 제어에 더 유용한 시각적 장기 기억을 더하다

약 3분 소요

들어가며

로봇이 안정적으로 작업하려면 현재 카메라 프레임만으로는 부족한 경우가 많습니다. 물체가 어떤 방향으로 움직였는지, 작업이 어느 단계에 도달했는지, 직전 행동이 환경을 어떻게 바꿨는지는 연속적인 시각 이력에서 파악할 수 있습니다. 하지만 이력을 길게 처리하면 계산량과 지연이 커져 로봇의 반응성이 떨어질 수 있습니다. NVIDIA 연구진의 Long-WAM은 이 기억과 실시간성의 충돌을 모델과 시스템 양쪽에서 다룹니다.

핵심은 긴 이력이 아니라 이력의 활용

Long-WAM은 인과적 월드-액션 모델의 컨텍스트를 확장하기 위한 프레임워크입니다. 연구진은 먼저 액션 라벨이 없는 로봇 영상과 1인칭 영상으로 자기회귀 영상 예측을 학습시켰습니다. 이를 통해 모델이 과거 관측으로부터 미래 상황을 추론하도록 만들고, 이후 월드-액션 모델에 적용할 때도 과거에서 미래로 이어지는 구조를 유지합니다.

논문의 중요한 결론은 긴 이력에 접근할 수 있는 것과 이를 실제로 잘 사용하는 것은 다르다는 점입니다. RoboCasa GR-1에서 자기회귀 방식으로 사전학습된 영상 기반 모델은 컨텍스트를 0.0초에서 19.2초로 늘렸을 때 성공률이 63.3%에서 78.7%로 상승했습니다. 반면 양방향 사전학습으로 초기화한 모델은 이력을 늘려도 순수한 개선을 보이지 않았습니다. 로봇 영역의 자기회귀 사전학습을 추가하면 GR-1과 LIBERO-Long의 최고 성능도 더 높아졌습니다.

실시간 배포를 위한 시스템 최적화

긴 시각 이력을 처리하면서 미래 영상의 잠재 표현까지 예측하려면 효율적인 실행 구조가 필요합니다. Long-WAM은 관측 스트리밍 인코딩, 비동기 실행, 하드웨어별 가속을 조합했습니다. RTX 5090에서는 미래 영상 잠재 예측을 포함한 하나의 액션 청크를 107.4밀리초에 처리합니다. DGX Spark와 Jetson AGX Thor에서도 미래 예측 기능을 제거하지 않고 배포할 수 있는 구성이 제시됐습니다.

평가 결과 Long-WAM은 LIBERO-Long, RoboTwin 2.0, DOMINO에서 비교된 방법 중 가장 좋은 결과를 기록했습니다. Unitree G1과 YAM을 이용한 실제 로봇 실험에서는 동적이고 긴 시간에 걸친 조작을 수행했습니다. 동적 컵 쌓기에서는 95%의 성공률을 보였으며, Pi0.5와 Fast-WAM은 20회 실험에서 성공하지 못했습니다.

의미와 남은 과제

Long-WAM은 컨텍스트 확장이 단순히 입력 길이를 늘리는 문제가 아니라는 점을 보여줍니다. 사전학습 목표, 액션 적응, 추론 시스템을 함께 설계해야 과거 관측을 미래 결과 예측과 작업 진행 판단에 연결할 수 있습니다. 또한 상위 수준의 플래너와 결합해 복합 작업을 수행하는 기억 기반 실행기로 활용될 가능성도 있습니다.

다만 이번 결과는 논문에 제시된 벤치마크와 로봇, 하드웨어 조건에 기반합니다. 개방적인 환경과 새로운 센서, 다른 유형의 작업에서도 같은 성능이 유지되는지, 긴 예측이 요구하는 데이터와 연산 비용이 어느 정도인지는 추가 검증이 필요합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
RobotWorld, 다양한 로봇 작업에서 멀티모달 에이전트를 검증하다
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

RobotWorld, 다양한 로봇 작업에서 멀티모달 에이전트를 검증하다

RobotWorld는 멀티모달 에이전트가 지시와 시각 정보를 실제 로봇 행동으로 전환할 수 있는지 평가하는 시뮬레이션 벤치마크입니다. 에이전트는 복잡한 인식·제어 절차를 만들 수 있지만 상태 추적, 실패 복구, 완료 판단에서는 여전히 불안정한 모습을 보입니다.

더 보기
CCTest · Blog
DiVeR, VLA 검증기를 로봇의 핵심 의사결정에 집중시키다
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

DiVeR, VLA 검증기를 로봇의 핵심 의사결정에 집중시키다

DiVeR는 샘플링된 행동 표현의 분산을 분석해 로봇 궤적에서 의사결정이 중요한 상태를 찾아낸다. 이 신호로 검증기 학습의 가중치를 조정해 단계별 라벨이나 추가 환경 상호작용 없이 VLA의 테스트 시 행동 선택을 개선한다.

더 보기