아티클 목록으로
추론·배포

Nexus, 에이전트가 매번 모든 도구 스키마를 읽지 않게 하다

약 3분 소요

배경

MCP 기반 도구 사용 에이전트는 매 턴마다 등록된 도구 스키마를 다시 처리하는 경우가 많다. 도구 수가 늘어나면 긴 입력을 프리필하는 비용과 컨텍스트 점유량이 함께 증가해 time-to-first-token(TTFT)가 주요 병목이 된다. Nexus는 어떤 도구를 선택할지 결정하는 과정과 전체 스키마를 모델에 인코딩하는 과정을 분리해 이 문제를 줄이려 한다.

핵심 설계

  • 검색으로 후보를 좁힌다. INT8 의미 룩어사이드 버퍼(SLB)에 도구 표현을 저장하고, 보정된 크로스 인코더 margin gate로 후보를 고른다. 매번 전체 도구 레지스트리를 주 컨텍스트에 넣을 필요를 줄이는 방식이다.
  • 짧은 서명으로 인자를 생성한다. 인자 생성은 완전한 KV 캐시가 아니라 텍스트 형태의 압축 도구 서명을 기반으로 한다. 서명의 중앙값 길이는 약 19토큰이어서 스키마가 차지하는 컨텍스트를 크게 줄일 수 있다.
  • KV 접합은 보조 최적화로 사용한다. 컴파일된 스키마 KV 블록을 실행 중인 컨텍스트에 직접 옮기는 경로도 제시한다. 그러나 RoPE는 위치에 따라 위상이 달라지므로, 원래 기준점에서 벗어난 위치에 삽입하면 어텐션 결과가 손상될 수 있다.
  • 깊어지면 재디코딩한다. 깊이가 P=256을 넘으면 깊이 적응형 suffix 재디코딩을 적용하고, 필요할 경우 전체 재프리필로 전환한다. ‘절대 퇴행하지 않는다’는 표현은 출력 충실도에 대한 보장이지, 지연 시간이 언제나 개선된다는 뜻은 아니다.

결과와 한계

Apple Silicon 통합 메모리에서 Qwen2.5-14B-Instruct Q4_K_M을 평가한 결과, 도구 레지스트리가 250개로 늘어도 검색 기반 라우팅 정확도는 약 89%를 유지했다. 전체 스키마 재프리필과 비교하면 첫 인자 토큰이 1.66배 빨리 도착했고, 주 컨텍스트 토큰 사용량은 약 80% 감소했다. 같은 규모에서 모든 스키마를 이어 붙이는 기준선은 컨텍스트 창을 초과했다.

KV 접합은 중간 컨텍스트 깊이에서 1.1~1.7배의 TTFT 개선을 제공했지만, 깊이가 증가하면 기준선과 비슷한 수준으로 수렴했다. 복구 절차 이후 top-1 출력 일치도는 유지됐고 KL 발산은 거의 0이었다. 다만 일부 구간에서는 지연 시간이 기준선의 0.98배까지 먼저 떨어질 수 있다. 참조 없이 드리프트를 예측하는 gate도 효과적이지 않았으며, 보고된 Spearman 상관계수는 0.193이었다.

의미와 영향

Nexus의 중요한 시사점은 KV 캐시를 어느 위치에나 안전하게 옮길 수 있다는 것이 아니다. 대규모 도구 레지스트리를 가진 에이전트라면 검색으로 라우팅을 전체 스키마 프리필과 분리하고, KV 접합은 검증과 폴백을 갖춘 제한적 최적화로 다뤄야 한다는 점이다. 이 구조는 TTFT와 컨텍스트 부담을 낮출 가능성이 있지만, 정량 결과는 하나의 모델·양자화 설정·하드웨어 조합에서 얻어졌다. 다른 모델, RoPE 구현, 컨텍스트 길이와 실제 도구 사용 분포를 대상으로 한 추가 검증이 필요하다.

arXiv

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
SparseDecoding, 생성 단계에 맞춘 LLM 가지치기 제안
추론·배포
cctest.ai
추론·배포

SparseDecoding, 생성 단계에 맞춘 LLM 가지치기 제안

SparseDecoding은 자연어 기반 보정 데이터와 실제 생성 과정의 활성 분포가 다르다는 문제를 해결하기 위해 제안됐다. 생성 중 수집한 활성값과 N:M 희소 SpMV 커널을 활용해 A100에서 최대 1.48배의 종단 간 디코딩 가속을 보고했다.

더 보기
CCTest · Blog
TokenRouter: 토큰 단위 LLM 라우팅을 위한 효율적 서빙 시스템
추론·배포
cctest.ai
추론·배포

TokenRouter: 토큰 단위 LLM 라우팅을 위한 효율적 서빙 시스템

TokenRouter는 생성 과정에서 토큰마다 다른 모델을 선택하는 LLM 라우팅을 위한 서빙 시스템입니다. 비동기 모델 서브서버와 지연 배칭으로 실행 단계 불일치와 배치 대기 문제를 줄이는 것을 목표로 합니다.

더 보기
CCTest · Blog
SparseEngine, 장문맥 에이전트를 위한 희소 우선 추론 엔진
추론·배포
cctest.ai
추론·배포

SparseEngine, 장문맥 에이전트를 위한 희소 우선 추론 엔진

SparseEngine은 서로 다른 KV 캐시 방식을 장문맥 LLM 에이전트의 서빙 환경에 통합하기 위해 설계된 희소 우선 추론 엔진입니다. 논문은 처리량과 디코딩 속도 향상뿐 아니라 요청 간 캐시 상태를 이어가는 방법도 제시합니다.

더 보기