CacheBack, 멀티에이전트에 필요한 KV 캐시만 전송한다
멀티에이전트 시스템이 복잡한 문제를 나눠 해결할 때 중요한 것은 통신 가능 여부만이 아니다. 어떤 정보를 얼마나 전달할지가 시스템 성능을 좌우한다. 한 에이전트가 긴 컨텍스트를 처리했더라도 협업하는 에이전트가 실제로 필요한 것은 그중 일부일 수 있다. 전체 내용을 그대로 넘기면 통신이 메모리와 지연의 새로운 병목이 된다.
텍스트 메시지의 한계와 잠재 통신
기존 방식은 발신 에이전트가 결과를 텍스트로 요약해 수신자에게 보내는 것이다. 텍스트는 저장과 확인이 쉽지만, 생성과 디코딩 과정이 추가로 필요하다. 또한 요약 과정에서 수신 에이전트가 필요로 하는 근거와 세부 정보가 빠질 수 있다.
잠재 통신은 새로운 텍스트 메시지를 생성하는 대신 모델 내부 상태, 특히 KV 캐시를 에이전트 사이에서 직접 전달하려 한다. 이를 통해 일부 텍스트 생성 비용을 피하고 요약으로 손실될 수 있는 정보를 보존할 수 있다. 그러나 전체 KV 캐시는 각 에이전트가 처리한 컨텍스트 길이와 협업에 참여한 에이전트 수에 따라 함께 증가한다. GPU 메모리와 수신 모델의 컨텍스트 창이 감당하기 어려운 규모가 될 수 있다는 뜻이다.
수신자의 요구를 중심으로 캐시를 고른다
CacheBack의 출발점은 발신자가 가진 모든 정보를 보낼 필요가 없다는 관찰이다. 수신 에이전트가 먼저 자신의 로컬 작업에 필요한 정보가 무엇인지 짧게 설명하면, 발신 에이전트는 이를 기준으로 전송할 캐시를 걸러낸다.
CacheBack은 이 아이디어를 추가 학습 없이 구현한 방법이다. 발신 에이전트의 어텐션 가중치를 관련성 신호로 활용해 수신자에게 더 유용할 가능성이 높은 KV 캐시 상태를 선택한다. 별도의 통신 인코더를 학습하는 대신, 전송 기준을 ‘발신자가 무엇을 처리했는가’에서 ‘수신자에게 무엇이 필요한가’로 바꾸는 접근이다.
결과와 시스템적 의미
Qwen 3를 사용한 FanOutQA 실험에서 CacheBack은 수신자가 원래 받게 될 상태의 75%를 제거했다. 논문에 따르면 텍스트 통신과 비교해 정확도는 14.7%포인트 높아졌고, 작업 완료 시간의 중간값은 3.2배 줄었다. 또한 순수 Transformer, Mamba-어텐션 하이브리드, 슬라이딩 윈도 어텐션 등 여러 모델 계열에서 비슷한 방향의 개선이 관찰됐다.
이 연구가 제시하는 핵심 원칙은 멀티에이전트 통신을 완전성보다 수신자의 작업에 맞춰야 한다는 것이다. 대규모 중간 상태를 반복적으로 주고받는 워크플로에서는 메모리 사용량과 컨텍스트 부담, 대기 시간을 줄이는 데 도움이 될 수 있다. 다만 제공된 자료만으로는 압축률, 작업 유형, 서로 다른 모델 조합에서의 전체 성능 범위를 판단하기 어렵다. 실제 도입에는 캐시 호환성, 잘못된 상태 선별에 따른 정보 손실, 시스템 통합 비용에 대한 검증이 필요하다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…