아티클 목록으로
메모리·컨텍스트

HeteroFold, 서로 다른 모델 간 KV Cache 공유에 도전

약 3분 소요

멀티 에이전트 LLM 시스템은 계획, 검색, 실행, 검증 같은 역할을 서로 다른 모델에 배분할 수 있습니다. 모델 패밀리마다 강점이 다르기 때문에 이기종 조합은 유용하지만, 통신 방식이 텍스트에 머물면 비용이 커집니다. 송신 에이전트가 이미 처리한 긴 컨텍스트를 수신 에이전트가 다시 읽고 Prefill해야 하기 때문입니다.

KV Cache 재사용은 이 중복 계산을 줄이는 방법입니다. 모델은 컨텍스트를 처리하면서 Key와 Value 중간 상태를 저장하고, 이후 토큰 생성에서 이를 재사용합니다. 그러나 KV Cache는 모델 독립적인 데이터가 아닙니다. 토크나이저, 레이어 수, 어텐션 구조, KV 차원, 내부 표현 공간이 모델 패밀리마다 다르므로 한 모델의 캐시를 다른 모델에 그대로 넣을 수 없습니다.

논문은 이러한 문제를 해결하기 위해 HeteroFold를 제안합니다. 이 방법은 먼저 서로 다른 토크나이저에서 발생하는 토큰 경계를 맞추고, 다른 아키텍처의 레이어 대응 관계를 정렬합니다. 이어 송신 모델의 K/V 상태를 수신 모델의 표현 공간으로 매핑하고, 수신 모델의 어텐션 패턴과 출력을 유지하도록 보정합니다. 송신 모델과 수신 모델은 모두 동결되며, 두 모델의 내부 상태를 연결하는 매핑을 학습하는 방식입니다.

실험은 Llama, Qwen, Ministral 사이의 6개 전송 방향을 대상으로 진행됐습니다. 긴 컨텍스트와 짧은 컨텍스트, 멀티 에이전트 설정이 함께 평가됐습니다. 저자 보고에 따르면 HeteroFold는 4개 긴 컨텍스트 벤치마크 모두에서 가장 좋은 캐시 전송 성능을 보였고, 짧은 컨텍스트의 대부분 설정에서도 비교 방법보다 우수했습니다. 32K 컨텍스트에서 Llama 3.1 8B에서 Ministral 3 14B로 전송하는 경우, 수신 측 기본 Prefill보다 약 10.7배 빨랐으며 Dense Latent와 KV Ridge보다 1.18~1.47배 빠른 것으로 보고됐습니다. 멀티 에이전트 벤치마크에서는 텍스트 통신과 비슷한 결과도 제시됐습니다.

HeteroFold의 의미는 KV Cache를 특정 모델 내부에 갇힌 임시 상태가 아니라 모델 사이에서 교환할 수 있는 계산 자산으로 바라본다는 데 있습니다. 여러 에이전트가 긴 문서, 작업 이력, 환경 상태를 반복적으로 공유하는 상황에서는 중복 계산과 지연을 줄이고 모델 조합의 선택 폭을 넓힐 가능성이 있습니다.

다만 실제 서비스에 적용하려면 캐시 변환과 보정에 드는 비용, 캐시 전송량, 평가에 포함되지 않은 작업 분포에서의 안정성을 따져야 합니다. 제공된 자료만으로 모든 모델 규모와 운영 환경에서 동일한 이득이 발생한다고 단정할 수는 없습니다. HeteroFold는 서로 다른 모델 경계를 넘어 KV Cache를 직접 공유할 수 있다는 가능성을 보여주는 연구 방향으로 이해하는 것이 적절합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
기억을 넘어: PoS가 장기 과업 에이전트에 명시적 신념 상태를 제공하다
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

기억을 넘어: PoS가 장기 과업 에이전트에 명시적 신념 상태를 제공하다

상호작용 기록을 기억하는 것만으로는 에이전트가 현재 세계를 일관되게 이해하거나 목표를 향해 나아간다고 보장할 수 없습니다. PoS는 추론 시점에 명시적 신념 상태를 유지하고 정체, 순환, 이탈을 감지해 회복을 유도합니다.

더 보기
CCTest · Blog
MemFold, 장기 개인화를 위한 소프트 메모리를 행동 중심으로 학습
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

MemFold, 장기 개인화를 위한 소프트 메모리를 행동 중심으로 학습

MemFold는 질의와 관련된 텍스트 기억을 고정된 수의 연속 벡터로 압축하고, 그 기억이 실제 응답 행동에 얼마나 도움이 되는지를 기준으로 최적화합니다. 학습에는 과제 보상과 동결된 텍스트 기억 교사의 신뢰도 게이트 온폴리시 증류가 함께 사용됩니다.

더 보기
CCTest · Blog
WUSH-KV: 데이터 적응형 변환으로 저비트 KV 캐시 양자화 개선
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

WUSH-KV: 데이터 적응형 변환으로 저비트 KV 캐시 양자화 개선

WUSH-KV는 캘리브레이션 데이터에서 Key와 Value에 맞는 변환을 각각 학습해 저비트 KV 캐시 양자화 오류를 줄이는 방법입니다. 2비트 평가에서 검증된 모델과 다운스트림 작업 전반에 걸쳐 OSCAR 변환과 비슷하거나 더 나은 결과가 보고됐습니다.

더 보기