EmbodiedMemory-Bench, 장기 과제로 구현형 AI의 기억을 평가하다
장기 과제에서 기억이 중요한 이유
구현형 에이전트가 현재 카메라 화면을 이해하고 행동하는 것만으로는 긴 과제를 해결하기 어렵습니다. 에이전트는 환경의 작은 시각적 단서를 기억하고, 이동한 물체의 상태를 추적하며, 특정 행동이 환경에 어떤 변화를 일으켰는지 기록해야 합니다. 또한 이전 탐색에서 얻은 정보를 나중의 의사결정에 재사용해야 합니다.
기존 평가 방식은 개별 과제를 성공적으로 완료하는지에 초점을 맞추는 경우가 많았습니다. 이 방식만으로는 에이전트가 실제로 기억을 형성했는지, 아니면 최근 관찰과 단기 추론에 의존했는지 구분하기 어렵습니다. ZJU-OmniAI 연구팀이 제안한 EmbodiedMemory-Bench는 장기 상호작용 속에서 기억을 직접 평가해 이 공백을 메우려 합니다.
네 가지 기억 능력
EMem-Bench는 2,554개의 실행 가능한 상호작용 에피소드로 구성되며, 다음 네 가지 문제를 다룹니다.
- 세밀한 시각 기억: 장면의 전체적인 인상뿐 아니라 구체적인 시각 정보를 보존하는 능력;
- 동적 세계 상태 추적: 관찰과 행동에 따라 물체와 환경의 상태를 계속 갱신하는 능력;
- 상호작용 결과 학습: 성공, 실패 또는 상태 변화가 알려준 정보를 기록하는 능력;
- 과거 경험의 일반화: 이전 과제에서 얻은 지식을 새로운 의사결정에 적용하는 능력.
평가 설계는 기억을 만드는 단계와 기억을 활용하는 단계를 분리합니다. 에이전트는 먼저 환경과 상호작용하며 정보를 수집하고 기억을 구축하거나 갱신합니다. 이후 새로운 과제를 수행할 때 이 기억을 호출하고 실제 행동으로 목표를 달성해야 합니다. 이는 단순히 더 긴 관찰 기록을 모델에 입력하는 방식보다 지속적으로 환경을 다루는 로봇의 상황에 가깝습니다.
구조화된 외부 메모리 EMem
연구팀은 Embodied-Memorizer, 줄여서 EMem이라는 외부 메모리 시스템도 제안했습니다. EMem은 경험을 공간 메모리, 사건 메모리, 장면 메모리로 나눕니다. 공간 메모리는 위치와 관계를, 사건 메모리는 행동과 그 결과를, 장면 메모리는 환경의 넓은 맥락을 담당합니다. 장기간의 기록을 하나의 거대한 문맥으로 취급하기보다 과제에 필요한 종류의 정보를 선택적으로 검색하려는 접근입니다.
또한 이 메모리를 관리하고 사용하는 8B 정책 모델 EMem-8B도 학습했습니다. 평가에는 여러 오픈소스 및 상용 멀티모달 대규모 모델과 대표적인 멀티모달 메모리 시스템이 포함됩니다. 보고된 결과에 따르면 현재 모델들은 네 가지 과제에서 전반적으로 약하고 성능 편차도 큽니다. 백본을 맞춘 비교에서는 EMem이 평가된 메모리 시스템 중 가장 높은 종합 성능을 보였으며, 오픈소스 모델과 상용 모델 모두를 개선했습니다. EMem-8B 역시 기반 백본보다 향상된 결과를 냈습니다.
연구가 갖는 의미
이 연구의 핵심은 기억을 단순한 과거 기록이 아니라 여러 능력의 조합으로 구체화했다는 점입니다. 세부 정보 보존, 변화하는 세계 모델의 갱신, 행동 결과의 이해, 경험의 전이는 모두 장기적인 구현형 지능에 필요한 요소입니다. 컨텍스트 창을 늘리거나 더 많은 로그를 저장하는 것만으로는 이러한 능력이 자동으로 생기지 않습니다.
EMem-Bench는 앞으로 외부 메모리 구조, 검색 전략, 학습 방법, 계획 알고리즘을 비교하는 기준으로 활용될 수 있습니다. 다만 제공된 자료에는 과제별 점수나 세부 실험 결과가 포함되어 있지 않습니다. 따라서 이 결과를 특정 모델의 최종 순위라기보다, 구현형 AI의 기억 능력에 남아 있는 격차와 시스템 설계 방향을 보여주는 평가 프레임워크로 이해하는 것이 적절합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…