아티클 목록으로
AI 에이전트

CacheBack, 멀티에이전트에 필요한 KV 캐시만 전송한다

약 3분 소요

멀티에이전트 시스템이 복잡한 문제를 나눠 해결할 때 중요한 것은 통신 가능 여부만이 아니다. 어떤 정보를 얼마나 전달할지가 시스템 성능을 좌우한다. 한 에이전트가 긴 컨텍스트를 처리했더라도 협업하는 에이전트가 실제로 필요한 것은 그중 일부일 수 있다. 전체 내용을 그대로 넘기면 통신이 메모리와 지연의 새로운 병목이 된다.

텍스트 메시지의 한계와 잠재 통신

기존 방식은 발신 에이전트가 결과를 텍스트로 요약해 수신자에게 보내는 것이다. 텍스트는 저장과 확인이 쉽지만, 생성과 디코딩 과정이 추가로 필요하다. 또한 요약 과정에서 수신 에이전트가 필요로 하는 근거와 세부 정보가 빠질 수 있다.

잠재 통신은 새로운 텍스트 메시지를 생성하는 대신 모델 내부 상태, 특히 KV 캐시를 에이전트 사이에서 직접 전달하려 한다. 이를 통해 일부 텍스트 생성 비용을 피하고 요약으로 손실될 수 있는 정보를 보존할 수 있다. 그러나 전체 KV 캐시는 각 에이전트가 처리한 컨텍스트 길이와 협업에 참여한 에이전트 수에 따라 함께 증가한다. GPU 메모리와 수신 모델의 컨텍스트 창이 감당하기 어려운 규모가 될 수 있다는 뜻이다.

수신자의 요구를 중심으로 캐시를 고른다

CacheBack의 출발점은 발신자가 가진 모든 정보를 보낼 필요가 없다는 관찰이다. 수신 에이전트가 먼저 자신의 로컬 작업에 필요한 정보가 무엇인지 짧게 설명하면, 발신 에이전트는 이를 기준으로 전송할 캐시를 걸러낸다.

CacheBack은 이 아이디어를 추가 학습 없이 구현한 방법이다. 발신 에이전트의 어텐션 가중치를 관련성 신호로 활용해 수신자에게 더 유용할 가능성이 높은 KV 캐시 상태를 선택한다. 별도의 통신 인코더를 학습하는 대신, 전송 기준을 ‘발신자가 무엇을 처리했는가’에서 ‘수신자에게 무엇이 필요한가’로 바꾸는 접근이다.

결과와 시스템적 의미

Qwen 3를 사용한 FanOutQA 실험에서 CacheBack은 수신자가 원래 받게 될 상태의 75%를 제거했다. 논문에 따르면 텍스트 통신과 비교해 정확도는 14.7%포인트 높아졌고, 작업 완료 시간의 중간값은 3.2배 줄었다. 또한 순수 Transformer, Mamba-어텐션 하이브리드, 슬라이딩 윈도 어텐션 등 여러 모델 계열에서 비슷한 방향의 개선이 관찰됐다.

이 연구가 제시하는 핵심 원칙은 멀티에이전트 통신을 완전성보다 수신자의 작업에 맞춰야 한다는 것이다. 대규모 중간 상태를 반복적으로 주고받는 워크플로에서는 메모리 사용량과 컨텍스트 부담, 대기 시간을 줄이는 데 도움이 될 수 있다. 다만 제공된 자료만으로는 압축률, 작업 유형, 서로 다른 모델 조합에서의 전체 성능 범위를 판단하기 어렵다. 실제 도입에는 캐시 호환성, 잘못된 상태 선별에 따른 정보 손실, 시스템 통합 비용에 대한 검증이 필요하다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
WEFT: 도구 사용 후학습을 시스템 전체로 확장하다
AI 에이전트
cctest.ai
AI 에이전트

WEFT: 도구 사용 후학습을 시스템 전체로 확장하다

WEFT는 범용 에이전트의 도구 사용 능력을 높이기 위해 실행 환경만 확장하지 않고, 작업·에이전트 하네스·평가기를 하나의 시스템으로 함께 다룹니다. 실행 기반 자기진화와 장기 워크플로 학습을 안정화하는 기법을 결합했습니다.

더 보기
CCTest · Blog
VeriHarness, 장기 작업을 위한 LLM 에이전트 검증 프레임워크
AI 에이전트
cctest.ai
AI 에이전트

VeriHarness, 장기 작업을 위한 LLM 에이전트 검증 프레임워크

VeriHarness는 테스트 시점에 정답이나 채점 기준이 없어도 장기 작업 에이전트의 결과를 검증하고 개선하는 프레임워크입니다. 여러 실행 결과의 불일치와 합의를 분석하고 환경 증거를 활용해 최종 산출물을 수정합니다.

더 보기
CCTest · Blog
LLM 에이전트는 왜 특정 출처를 선호하는가
AI 에이전트
cctest.ai
AI 에이전트

LLM 에이전트는 왜 특정 출처를 선호하는가

쇼핑, 호텔, 학술 검색을 대상으로 한 연구에서 LLM 에이전트가 후보의 적합도뿐 아니라 상품과 정보의 출처에도 체계적인 선호를 보이는 것으로 나타났습니다. 출처를 가리거나 부족한 정보를 보완하고, 출처 기반 추론을 막는 지시를 주면 이러한 영향이 줄어듭니다.

더 보기