아티클 목록으로
로보틱스·피지컬 AI

EmbodiedMemory-Bench, 장기 과제로 구현형 AI의 기억을 평가하다

약 4분 소요

장기 과제에서 기억이 중요한 이유

구현형 에이전트가 현재 카메라 화면을 이해하고 행동하는 것만으로는 긴 과제를 해결하기 어렵습니다. 에이전트는 환경의 작은 시각적 단서를 기억하고, 이동한 물체의 상태를 추적하며, 특정 행동이 환경에 어떤 변화를 일으켰는지 기록해야 합니다. 또한 이전 탐색에서 얻은 정보를 나중의 의사결정에 재사용해야 합니다.

기존 평가 방식은 개별 과제를 성공적으로 완료하는지에 초점을 맞추는 경우가 많았습니다. 이 방식만으로는 에이전트가 실제로 기억을 형성했는지, 아니면 최근 관찰과 단기 추론에 의존했는지 구분하기 어렵습니다. ZJU-OmniAI 연구팀이 제안한 EmbodiedMemory-Bench는 장기 상호작용 속에서 기억을 직접 평가해 이 공백을 메우려 합니다.

네 가지 기억 능력

EMem-Bench는 2,554개의 실행 가능한 상호작용 에피소드로 구성되며, 다음 네 가지 문제를 다룹니다.

  • 세밀한 시각 기억: 장면의 전체적인 인상뿐 아니라 구체적인 시각 정보를 보존하는 능력;
  • 동적 세계 상태 추적: 관찰과 행동에 따라 물체와 환경의 상태를 계속 갱신하는 능력;
  • 상호작용 결과 학습: 성공, 실패 또는 상태 변화가 알려준 정보를 기록하는 능력;
  • 과거 경험의 일반화: 이전 과제에서 얻은 지식을 새로운 의사결정에 적용하는 능력.

평가 설계는 기억을 만드는 단계와 기억을 활용하는 단계를 분리합니다. 에이전트는 먼저 환경과 상호작용하며 정보를 수집하고 기억을 구축하거나 갱신합니다. 이후 새로운 과제를 수행할 때 이 기억을 호출하고 실제 행동으로 목표를 달성해야 합니다. 이는 단순히 더 긴 관찰 기록을 모델에 입력하는 방식보다 지속적으로 환경을 다루는 로봇의 상황에 가깝습니다.

구조화된 외부 메모리 EMem

연구팀은 Embodied-Memorizer, 줄여서 EMem이라는 외부 메모리 시스템도 제안했습니다. EMem은 경험을 공간 메모리, 사건 메모리, 장면 메모리로 나눕니다. 공간 메모리는 위치와 관계를, 사건 메모리는 행동과 그 결과를, 장면 메모리는 환경의 넓은 맥락을 담당합니다. 장기간의 기록을 하나의 거대한 문맥으로 취급하기보다 과제에 필요한 종류의 정보를 선택적으로 검색하려는 접근입니다.

또한 이 메모리를 관리하고 사용하는 8B 정책 모델 EMem-8B도 학습했습니다. 평가에는 여러 오픈소스 및 상용 멀티모달 대규모 모델과 대표적인 멀티모달 메모리 시스템이 포함됩니다. 보고된 결과에 따르면 현재 모델들은 네 가지 과제에서 전반적으로 약하고 성능 편차도 큽니다. 백본을 맞춘 비교에서는 EMem이 평가된 메모리 시스템 중 가장 높은 종합 성능을 보였으며, 오픈소스 모델과 상용 모델 모두를 개선했습니다. EMem-8B 역시 기반 백본보다 향상된 결과를 냈습니다.

연구가 갖는 의미

이 연구의 핵심은 기억을 단순한 과거 기록이 아니라 여러 능력의 조합으로 구체화했다는 점입니다. 세부 정보 보존, 변화하는 세계 모델의 갱신, 행동 결과의 이해, 경험의 전이는 모두 장기적인 구현형 지능에 필요한 요소입니다. 컨텍스트 창을 늘리거나 더 많은 로그를 저장하는 것만으로는 이러한 능력이 자동으로 생기지 않습니다.

EMem-Bench는 앞으로 외부 메모리 구조, 검색 전략, 학습 방법, 계획 알고리즘을 비교하는 기준으로 활용될 수 있습니다. 다만 제공된 자료에는 과제별 점수나 세부 실험 결과가 포함되어 있지 않습니다. 따라서 이 결과를 특정 모델의 최종 순위라기보다, 구현형 AI의 기억 능력에 남아 있는 격차와 시스템 설계 방향을 보여주는 평가 프레임워크로 이해하는 것이 적절합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
RoboFoundry, 로봇의 실행 경험을 진화하는 시스템으로 전환
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

RoboFoundry, 로봇의 실행 경험을 진화하는 시스템으로 전환

RoboFoundry는 컨텍스트, 메모리, 스킬, 실행 인터페이스를 하나의 ‘시스템-정책’으로 다루는 임바디드 에이전트 프레임워크를 제안한다. 여러 벤치마크에서 장기 기억과 작업 수행 능력의 개선을 보고했다.

더 보기
CCTest · Blog
로봇을 프로그래머처럼 움직이게 하는 Physical Coding
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

로봇을 프로그래머처럼 움직이게 하는 Physical Coding

Physical Coding은 로봇의 세계 상태와 실행 절차를 확인하고 수정할 수 있는 프로그램으로 표현하는 접근법입니다. HexaAnything는 여러 도구와 외부 피드백을 연결해 환경 변화와 실행 실패에 대응하려 합니다.

더 보기
CCTest · Blog
사람 손의 능숙함을 로봇으로: Morphometric Imitation이 동작 전이부터 제로샷 제어까지 연결
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

사람 손의 능숙함을 로봇으로: Morphometric Imitation이 동작 전이부터 제로샷 제어까지 연결

UC 버클리 연구진과 공동 연구자들은 인간의 손-물체 상호작용을 실행 가능한 로봇 시연과 시각운동 정책으로 바꾸는 3단계 프레임워크 Morphometric Imitation을 제안했다. 3종 로봇 손과 10개 상호작용 과제에서 평가했으며, 실제 환경 제로샷 실험에서 89.3%의 성공률을 기록했다.

더 보기