MemFold, 장기 개인화를 위한 소프트 메모리를 행동 중심으로 학습
들어가며
같은 사용자를 장기간 지원하는 어시스턴트는 과거 발화를 단순히 저장하는 데서 그치지 않아야 합니다. 어떤 선호가 여전히 유효한지, 무엇이 바뀌었는지, 현재 요청에 어떤 제약이 적용되는지를 판단해야 합니다. 대화 이력을 텍스트로 계속 붙이면 모델의 입력은 기록량에 따라 커집니다. 반대로 고정된 수의 잠재 벡터로 압축하면 인터페이스 크기를 제한할 수 있지만, 기존 방식은 원문 재구성이나 기준 답변 모방에 초점을 맞추는 경우가 많아 실제 기억 활용 행동과 학습 목표 사이에 차이가 생길 수 있습니다.
MemFold는 기억을 얼마나 잘 복원했는지가 아니라, 그 기억으로 어떤 행동을 가능하게 했는지를 기준으로 압축을 학습합니다.
핵심 방식
- 고정 예산 소프트 메모리: 현재 질의에 맞춰 텍스트 기억을 조건화한 뒤 K개의 연속 벡터로 압축합니다. 독자 모델은 이 벡터를 기억 인터페이스로 사용하므로 전체 이력을 그대로 입력할 필요가 없습니다.
- 학생 모델의 롤아웃 중심 학습: 학생은 소프트 메모리 조건에서 직접 응답을 생성하고, 그 결과가 학습의 대상이 됩니다. 외부에서 제공된 정답 시퀀스만을 모방하는 방식과 다릅니다.
- 서로 보완하는 두 신호: 여러 후보의 과제 결과를 비교하는 그룹 상대 보상과 신뢰도 게이트 온폴리시 증류를 결합합니다. 후자의 경우 텍스트 기억을 볼 수 있는 동결 교사가 학생이 이미 샘플링한 토큰을 다시 평가하고, 충분히 확신할 때만 지침을 제공합니다.
- 추론 단계에서는 교사 제거: 교사는 별도의 답변을 자기회귀적으로 생성하지 않고 학생 토큰을 채점하는 역할만 수행합니다. 실제 사용 시에는 교사를 제거하고 독자 모델과 압축된 소프트 메모리만 남깁니다.
의미와 한계
세 가지 Qwen 백본을 대상으로 한 평가에서, 논문은 PersonaMem-32K와 PersonaMem-128K에서 MemFold가 측정된 비교 대상 가운데 가장 높은 정확도를 기록했다고 보고합니다. 더 긴 이력 조건에서 차이가 커졌으며, 목표 도메인 추가 학습 없이 PrefEval과 LongMemEval으로도 전이됐다고 설명합니다. 이는 짧은 메모리 인터페이스 자체가 문제라기보다, 압축기가 실제 하위 과제의 행동을 기준으로 학습되는지가 중요하다는 점을 보여줍니다.
텍스트 기억 교사는 더 풍부한 사용자 이력을 제공하고, 학생은 제한된 표현만으로 결정을 내려야 합니다. 이 구조는 장기간 실행되는 에이전트에서 학습 단계와 배포 단계의 요구를 분리하는 방법이 될 수 있습니다. 학습 중에는 더 풍부한 교사 관점을 활용하면서, 추론 시에는 고정 예산 표현만 유지할 수 있기 때문입니다.
다만 제공된 소재에는 전체 제거 실험, 구체적인 향상 폭, 메모리 예산별 결과가 포함돼 있지 않습니다. 계산 비용, 사용자 선호 변화에 대한 안정성, K 선택에 대한 민감도는 논문 전문에서 추가로 확인해야 합니다. 그럼에도 MemFold의 핵심 기여는 분명합니다. 기억 압축을 읽기 쉬운 요약문을 만드는 문제에서, 현재의 올바른 행동을 지원하는 정보를 보존하는 문제로 재정의했다는 점입니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…