아티클 목록으로
메모리·컨텍스트

Jev-Mem: System One으로 제어하는 효율적 AI 에이전트 메모리

약 3분 소요

들어가며

장기 작업을 수행하는 AI 에이전트는 단순히 긴 컨텍스트를 읽는 것만으로는 부족합니다. 사용자의 선호, 과거 사건, 정보 사이의 관계를 저장하고 필요할 때 다시 찾아야 합니다. 하지만 많은 에이전트 메모리 시스템은 메모리 생성과 정리, 검색 과정 전반을 자기회귀형 대규모 언어 모델에 맡깁니다. 이 방식은 유연하지만, 반복적이고 단순한 작업에도 생성 비용이 개입해 지연과 비용을 높일 수 있습니다.

Jev-Mem은 System One과 System Two의 역할 분담을 에이전트 메모리에 적용합니다. 자주 발생하는 가벼운 판단은 별도의 제어기가 처리하고, 깊은 의미 해석이 필요한 경우에만 더 무거운 추론 단계를 호출하는 구조입니다.

세 가지 플레인

Jev-Mem은 다음 세 구성요소로 이루어집니다.

  • System One 제어 플레인: 메모리 구축 단계에서는 메모리 유형을 정하고 메모리 사이의 관계를 구성합니다. 검색 단계에서는 질의를 라우팅하고 검색 예산을 배분하며, 그래프를 탐색하고 후보를 평가한 뒤 검색을 언제 멈출지 결정합니다.
  • 다중 관계 메모리 플레인: 정보를 고립된 텍스트 조각으로만 저장하지 않고, 여러 관계를 포함하는 구조화된 형태로 관리합니다.
  • System Two 추론 플레인: 복잡한 추론과 답변 합성이 필요할 때만 호출됩니다.

핵심은 언어 모델을 메모리에서 배제하는 것이 아니라, 언어 모델이 개입해야 할 지점을 조정하는 데 있습니다. System One은 반복적인 관리와 검색 제어를 담당하고, System Two는 검색된 정보의 해석과 답변 작성에 집중합니다. 따라서 모든 메모리 작업마다 고비용 생성 과정을 거치는 상황을 줄일 수 있습니다.

결과와 의미

LoCoMo 평가에서 Jev-Mem의 종합 LLM-as-a-Judge 점수는 0.777이었습니다. 이는 가장 강력한 기준선 대비 상대적으로 11.0% 향상된 수치입니다. 메모리 구축 시간은 158초로, 초록에 따르면 가장 빠른 경쟁 메모리 시스템보다 6.6배 빨랐습니다. 평균 질의 지연은 0.93초로 36.7% 감소했습니다.

이 결과는 에이전트 메모리의 효율성이 반드시 더 강력한 생성 모델만으로 결정되는 것은 아니라는 점을 보여줍니다. 불필요한 생성 호출을 줄이고, 검색 예산과 탐색 과정, 종료 조건을 명시적으로 제어하는 것도 중요한 최적화 방법입니다. Jev-Mem은 메모리를 단순한 벡터 검색 계층이 아니라 유형과 관계, 예산, 탐색 정책을 가진 동적 시스템으로 다룹니다.

이 구조는 장기간 실행되는 개인 비서, 연구 에이전트, 업무 자동화 시스템에 적용될 가능성이 있습니다. 다만 제공된 자료가 주로 LoCoMo 결과를 제시하고 있으므로, 다른 분야와 모델, 더 큰 메모리 규모에서도 같은 효과가 유지되는지는 추가 검증이 필요합니다. 연구진은 코드와 인터랙티브 Hugging Face Space를 공개해 재현과 후속 평가를 지원하고 있습니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
DeepSeek-V4.1-Flash, 장기 에이전트 위한 KV 캐시 압축의 한계 확장
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

DeepSeek-V4.1-Flash, 장기 에이전트 위한 KV 캐시 압축의 한계 확장

DeepSeek-V4.1-Flash는 장기 에이전트 워크로드에서 커지는 프리필 연산량과 KV 캐시의 메모리·스토리지·대역폭 부담을 줄이는 데 초점을 맞춘 모델입니다. CED, 계층 간 KV 재사용, FP4 KV 캐싱, SWA Bounded Replay를 결합해 캐시 사용량을 크게 낮춥니다.

더 보기
CCTest · Blog
Grouped Value Attention, 키 온디맨드 재구성으로 KV Cache 압축
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

Grouped Value Attention, 키 온디맨드 재구성으로 KV Cache 압축

Grouped Value Attention(GVA)은 그룹화한 Value를 저장하고 학습된 선형 변환으로 Content Key를 필요할 때 재구성합니다. 보고된 설정에서 GQA에 가까운 정확도를 유지하면서 영구 캐시 스칼라 수를 약 45~47% 줄였습니다.

더 보기