아티클 목록으로
메모리·컨텍스트

REMORY, 장기 에이전트의 문맥 압축에 잔차 메모리 추가

약 3분 소요

장기간 작업하는 AI 에이전트는 대화, 관찰 결과, 도구 호출, 중간 판단을 계속 축적합니다. 이 기록을 모두 유지하면 컨텍스트 윈도의 한계를 빠르게 넘기 때문에, 실제 시스템에서는 이전 이력을 요약한 뒤 작업을 이어가는 방식이 흔합니다. 그러나 텍스트 요약은 읽기 쉽다는 장점이 있는 반면, 이후의 판단에 영향을 주는 작은 단서나 문장으로 표현하기 어려운 내부 상태를 빠뜨릴 수 있습니다. REMORY는 이 문제를 추가적인 소프트 메모리로 보완합니다.

핵심 구조

REMORY는 별도의 신경 메모리 네트워크를 사용합니다. 네트워크는 원본 이력과 압축된 요약을 함께 입력받아, 길이가 제한된 소프트 메모리 토큰을 생성합니다. 이 토큰은 사람이 읽는 메모가 아니라 언어 모델이 직접 처리하는 연속 표현입니다. 생성된 토큰은 요약 뒤에 이어 붙은 뒤, 동결된 대규모 언어 모델에 전달됩니다.

이 구조에서 요약은 명시적인 정보의 뼈대 역할을 합니다. 반면 소프트 메모리는 요약에 직접 적히지는 않았지만 다음 행동에 영향을 줄 수 있는 정보를 보충합니다. 학습 목표도 단순히 원본 이력을 문장으로 복원하는 것이 아닙니다. 요약과 잔차 메모리를 받은 동결 LLM이 전체 이력을 읽었을 때 생성했을 법한 후속 출력을 최대한 가깝게 만들도록 메모리 네트워크를 학습합니다. 따라서 메모리의 품질은 텍스트 유사성보다 실제 에이전트 행동을 기준으로 평가됩니다.

보고된 결과

  • SummHay에서 통찰 범위를 거의 유지하면서 출처 귀속 성능을 높였습니다.
  • 보고된 설정에서는 입력 위치의 5.2%만 사용해 전체 컨텍스트 조건에 가까운 공동 점수에 접근했습니다.
  • 장기 에이전트 벤치마크에서 Qwen3.8-27B와 GLM-5.3-Flash 모두 일관된 향상을 보였습니다.
  • BrowseComp와 Terminal-Bench 2.1에서는 잔차 메모리를 사용할 때 반복 도구 출력과 도구 오류가 크게 줄었습니다.

의미와 남은 과제

REMORY의 의미는 단순히 프롬프트를 더 짧게 만드는 데 있지 않습니다. 사람이 확인할 수 있는 텍스트 요약과, 자연어로 안정적으로 표현하기 어려운 상태를 담은 학습 표현을 함께 사용한다는 점이 핵심입니다. 브라우저나 터미널을 반복해서 호출하는 에이전트에서 도구 출력을 되풀이하면 컨텍스트가 불필요하게 커지고 오류가 연쇄적으로 발생할 수 있습니다. 따라서 반복 출력과 도구 오류의 감소는 정확도뿐 아니라 컨텍스트를 더 오래 활용하는 데도 도움이 될 수 있습니다.

다만 제공된 자료만으로는 소프트 메모리가 다른 작업으로 얼마나 잘 이전되는지, 토큰 예산을 어떻게 정해야 하는지, 메모리 네트워크의 학습과 추론 비용이 어느 정도인지는 확인할 수 없습니다. 텍스트 요약보다 내부 내용을 검증하기 어렵다는 문제도 남습니다. REMORY는 장기 기억을 완전히 해결한 방법이라기보다, 명시적 요약과 암묵적 메모리를 결합하는 유망한 문맥 압축 설계로 보는 편이 타당합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
EngramEdit, LLM의 사실 지식을 독립적으로 업데이트하다
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

EngramEdit, LLM의 사실 지식을 독립적으로 업데이트하다

EngramEdit는 조건부 메모리를 단순한 용량 확장 장치에서 편집 가능한 지식 인터페이스로 확장합니다. Transformer 본체를 고정한 채 공유 n-gram 임베딩을 업데이트해 여러 표현에 걸친 지식 수정과 부작용 억제를 시도합니다.

더 보기
CCTest · Blog
장문맥 하이브리드 모델의 성능을 좌우하는 위치 편향
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

장문맥 하이브리드 모델의 성능을 좌우하는 위치 편향

새 연구는 슬라이딩 윈도우 어텐션과 선형 어텐션이 문맥 확장과 길이 외삽에서 서로 다른 강점을 보인다고 분석했다. 연구진은 그 차이를 각 어텐션이 형성하는 ‘하이브리드 위치’ 편향으로 설명하고 Sliding-Window Linear Attention을 제안했다.

더 보기
CCTest · Blog
KV 상태 저장으로 AI가 5000만 토큰의 기록을 재사용하는 방법
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

KV 상태 저장으로 AI가 5000만 토큰의 기록을 재사용하는 방법

galahad-kv를 활용한 실험은 언어 모델의 KV 상태를 암호화된 로컬 NVMe에 저장한 뒤 재계산 없이 불러올 수 있음을 보여줬다. 주의집중 창을 넓히는 기술은 아니지만, 긴 기록을 효율적으로 재사용하는 실용적 접근이다.

더 보기