Long-WAM, 로봇 제어에 더 유용한 시각적 장기 기억을 더하다
들어가며
로봇이 안정적으로 작업하려면 현재 카메라 프레임만으로는 부족한 경우가 많습니다. 물체가 어떤 방향으로 움직였는지, 작업이 어느 단계에 도달했는지, 직전 행동이 환경을 어떻게 바꿨는지는 연속적인 시각 이력에서 파악할 수 있습니다. 하지만 이력을 길게 처리하면 계산량과 지연이 커져 로봇의 반응성이 떨어질 수 있습니다. NVIDIA 연구진의 Long-WAM은 이 기억과 실시간성의 충돌을 모델과 시스템 양쪽에서 다룹니다.
핵심은 긴 이력이 아니라 이력의 활용
Long-WAM은 인과적 월드-액션 모델의 컨텍스트를 확장하기 위한 프레임워크입니다. 연구진은 먼저 액션 라벨이 없는 로봇 영상과 1인칭 영상으로 자기회귀 영상 예측을 학습시켰습니다. 이를 통해 모델이 과거 관측으로부터 미래 상황을 추론하도록 만들고, 이후 월드-액션 모델에 적용할 때도 과거에서 미래로 이어지는 구조를 유지합니다.
논문의 중요한 결론은 긴 이력에 접근할 수 있는 것과 이를 실제로 잘 사용하는 것은 다르다는 점입니다. RoboCasa GR-1에서 자기회귀 방식으로 사전학습된 영상 기반 모델은 컨텍스트를 0.0초에서 19.2초로 늘렸을 때 성공률이 63.3%에서 78.7%로 상승했습니다. 반면 양방향 사전학습으로 초기화한 모델은 이력을 늘려도 순수한 개선을 보이지 않았습니다. 로봇 영역의 자기회귀 사전학습을 추가하면 GR-1과 LIBERO-Long의 최고 성능도 더 높아졌습니다.
실시간 배포를 위한 시스템 최적화
긴 시각 이력을 처리하면서 미래 영상의 잠재 표현까지 예측하려면 효율적인 실행 구조가 필요합니다. Long-WAM은 관측 스트리밍 인코딩, 비동기 실행, 하드웨어별 가속을 조합했습니다. RTX 5090에서는 미래 영상 잠재 예측을 포함한 하나의 액션 청크를 107.4밀리초에 처리합니다. DGX Spark와 Jetson AGX Thor에서도 미래 예측 기능을 제거하지 않고 배포할 수 있는 구성이 제시됐습니다.
평가 결과 Long-WAM은 LIBERO-Long, RoboTwin 2.0, DOMINO에서 비교된 방법 중 가장 좋은 결과를 기록했습니다. Unitree G1과 YAM을 이용한 실제 로봇 실험에서는 동적이고 긴 시간에 걸친 조작을 수행했습니다. 동적 컵 쌓기에서는 95%의 성공률을 보였으며, Pi0.5와 Fast-WAM은 20회 실험에서 성공하지 못했습니다.
의미와 남은 과제
Long-WAM은 컨텍스트 확장이 단순히 입력 길이를 늘리는 문제가 아니라는 점을 보여줍니다. 사전학습 목표, 액션 적응, 추론 시스템을 함께 설계해야 과거 관측을 미래 결과 예측과 작업 진행 판단에 연결할 수 있습니다. 또한 상위 수준의 플래너와 결합해 복합 작업을 수행하는 기억 기반 실행기로 활용될 가능성도 있습니다.
다만 이번 결과는 논문에 제시된 벤치마크와 로봇, 하드웨어 조건에 기반합니다. 개방적인 환경과 새로운 센서, 다른 유형의 작업에서도 같은 성능이 유지되는지, 긴 예측이 요구하는 데이터와 연산 비용이 어느 정도인지는 추가 검증이 필요합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…