아티클 목록으로
추론·배포

Nexus, 에이전트가 매번 모든 도구 스키마를 읽지 않게 하다

약 3분 소요

배경

MCP 기반 도구 사용 에이전트는 매 턴마다 등록된 도구 스키마를 다시 처리하는 경우가 많다. 도구 수가 늘어나면 긴 입력을 프리필하는 비용과 컨텍스트 점유량이 함께 증가해 time-to-first-token(TTFT)가 주요 병목이 된다. Nexus는 어떤 도구를 선택할지 결정하는 과정과 전체 스키마를 모델에 인코딩하는 과정을 분리해 이 문제를 줄이려 한다.

핵심 설계

  • 검색으로 후보를 좁힌다. INT8 의미 룩어사이드 버퍼(SLB)에 도구 표현을 저장하고, 보정된 크로스 인코더 margin gate로 후보를 고른다. 매번 전체 도구 레지스트리를 주 컨텍스트에 넣을 필요를 줄이는 방식이다.
  • 짧은 서명으로 인자를 생성한다. 인자 생성은 완전한 KV 캐시가 아니라 텍스트 형태의 압축 도구 서명을 기반으로 한다. 서명의 중앙값 길이는 약 19토큰이어서 스키마가 차지하는 컨텍스트를 크게 줄일 수 있다.
  • KV 접합은 보조 최적화로 사용한다. 컴파일된 스키마 KV 블록을 실행 중인 컨텍스트에 직접 옮기는 경로도 제시한다. 그러나 RoPE는 위치에 따라 위상이 달라지므로, 원래 기준점에서 벗어난 위치에 삽입하면 어텐션 결과가 손상될 수 있다.
  • 깊어지면 재디코딩한다. 깊이가 P=256을 넘으면 깊이 적응형 suffix 재디코딩을 적용하고, 필요할 경우 전체 재프리필로 전환한다. ‘절대 퇴행하지 않는다’는 표현은 출력 충실도에 대한 보장이지, 지연 시간이 언제나 개선된다는 뜻은 아니다.

결과와 한계

Apple Silicon 통합 메모리에서 Qwen2.5-14B-Instruct Q4_K_M을 평가한 결과, 도구 레지스트리가 250개로 늘어도 검색 기반 라우팅 정확도는 약 89%를 유지했다. 전체 스키마 재프리필과 비교하면 첫 인자 토큰이 1.66배 빨리 도착했고, 주 컨텍스트 토큰 사용량은 약 80% 감소했다. 같은 규모에서 모든 스키마를 이어 붙이는 기준선은 컨텍스트 창을 초과했다.

KV 접합은 중간 컨텍스트 깊이에서 1.1~1.7배의 TTFT 개선을 제공했지만, 깊이가 증가하면 기준선과 비슷한 수준으로 수렴했다. 복구 절차 이후 top-1 출력 일치도는 유지됐고 KL 발산은 거의 0이었다. 다만 일부 구간에서는 지연 시간이 기준선의 0.98배까지 먼저 떨어질 수 있다. 참조 없이 드리프트를 예측하는 gate도 효과적이지 않았으며, 보고된 Spearman 상관계수는 0.193이었다.

의미와 영향

Nexus의 중요한 시사점은 KV 캐시를 어느 위치에나 안전하게 옮길 수 있다는 것이 아니다. 대규모 도구 레지스트리를 가진 에이전트라면 검색으로 라우팅을 전체 스키마 프리필과 분리하고, KV 접합은 검증과 폴백을 갖춘 제한적 최적화로 다뤄야 한다는 점이다. 이 구조는 TTFT와 컨텍스트 부담을 낮출 가능성이 있지만, 정량 결과는 하나의 모델·양자화 설정·하드웨어 조합에서 얻어졌다. 다른 모델, RoPE 구현, 컨텍스트 길이와 실제 도구 사용 분포를 대상으로 한 추가 검증이 필요하다.

arXiv

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
ParaTempo, 시간적 신뢰도로 병렬 추론을 동적으로 최적화
추론·배포
cctest.ai
추론·배포

ParaTempo, 시간적 신뢰도로 병렬 추론을 동적으로 최적화

ParaTempo는 각 추론 분기가 시간에 따라 답안 공간에서 얼마나 수렴하는지 추적하는 학습 불필요 비동기 병렬 추론 프레임워크입니다. 수렴도가 낮은 경로는 제거하고, 안정된 경로는 일찍 종료하며, 남은 계산을 새로운 분기에 재배분합니다.

더 보기
CCTest · Blog
Daedalus-150M, CPU 추론을 거꾸로 설계한 합성곱·어텐션 모델
추론·배포
cctest.ai
추론·배포

Daedalus-150M, CPU 추론을 거꾸로 설계한 합성곱·어텐션 모델

Daedalus-150M은 대형 모델을 축소한 뒤 CPU에 맞추는 대신, 4비트 가중치와 단일 사용자·토큰 단위 생성을 먼저 정하고 구조를 선택한 소형 언어 모델입니다. 18개 블록 중 12개를 짧은 합성곱으로 구성해 긴 문맥에서 KV 캐시를 반복해서 읽는 비용을 줄였습니다.

더 보기
CCTest · Blog
Llama-Mobile, 2.7비트 양자화로 모바일 VLM 배포에 도전
추론·배포
cctest.ai
추론·배포

Llama-Mobile, 2.7비트 양자화로 모바일 VLM 배포에 도전

Llama-Mobile은 제한된 메모리와 연산 자원을 가진 모바일 기기에서 비전-언어 모델을 실행하기 위한 양자화 프레임워크를 제안합니다. 모델이 직접 생성한 데이터와 Arm CPU 실행을 고려한 2.7비트 형식을 활용해 Llama 3.2 11B Vision Instruct를 3.7GB로 줄이면서 표준 시각 질의응답 성능을 유지했습니다.

더 보기