LatentPort, KV 캐시를 넘어 언어 모델 간 메모리 전달 실험
배경
언어 모델의 추론 작업을 다른 모델로 넘길 때 보통 두 가지 방법을 사용한다. 수신 모델이 전체 과거 문맥을 다시 읽거나, 송신 모델이 만든 어텐션 KV 캐시를 전달하는 방식이다. 전자는 중복 계산을 발생시키고, 후자는 하이브리드 모델의 순환 모듈이 축적한 정보를 충분히 보존하지 못할 수 있다. LatentPort는 여러 종류의 실행 상태를 함께 넘겨 수신 모델이 과거 토큰을 재처리하지 않고 이어서 추론할 수 있는지 조사했다.
실험 구성과 결과
연구진은 구조가 맞는 Qwen3.5 4B와 9B Base 모델을 사용했다. 먼저 4B가 4,096개 토큰의 문맥을 처리한 뒤, 9B에 변환된 어텐션 KV와 Gated DeltaNet(GDN) 순환 상태, 합성곱 모듈의 상태를 전달했다. 9B는 과거 프리픽스 토큰을 전혀 받지 않고 후속 구간을 처리했다.
핵심 결과는 다음과 같다.
- KV만 변환하면 네이티브 9B와의 성능 격차가 크게 남았다.
- GDN 지속 상태를 추가하면 교사 강제 음의 로그우도가 토큰당 평균 0.747 nats 감소했다. 95% 문서 페어 부트스트랩 신뢰구간은 0.6921–0.8047이며, PG19의 64개 문서 모두에서 개선됐다.
- 순환 상태와 합성곱 상태를 직접 재사용하는 방식은 이번에 시험한 학습형 GDN 매핑보다 나았다. 이는 두 모델 크기 사이에서 일부 상태 좌표가 기능적으로 호환될 수 있음을 시사한다.
- 추가로 434,176개 파라미터의 보정 모듈을 적용하자, 새 웹 문서 64개에서 네이티브 9B 대비 연속 손실 차이는 0.076 nats/token, JS 발산은 0.022, 네이티브 문맥 회복 지표는 0.918이 됐다.
보정된 9B는 과거 문맥을 처리하지 않았음에도 4B 추론을 계속하는 방식보다 유의미하게 나았다. 모델을 더 큰 모델로 교체할 때 전체 프리픽스를 다시 계산하지 않아도 될 가능성을 보여준 셈이다.
의미와 한계
LatentPort의 중요한 점은 모델 간 전달 단위를 KV 캐시에서 하이브리드 상태 전체로 확장했다는 데 있다. 하이브리드 모델의 문맥 정보는 어텐션뿐 아니라 순환 상태와 합성곱 상태에도 저장될 수 있다. 향후 이러한 상태를 위한 인터페이스가 만들어진다면 동적 모델 교체, 모델 캐스케이드, 긴 문맥 서비스의 재계산 절감, 여러 모델의 협업 등에 활용될 수 있다.
그러나 이번 결과를 범용적인 모델 간 메모리 프로토콜로 해석하기에는 이르다. 실험은 한 방향의 전송, 하나의 구조 일치 모델 쌍, 4K 교사 강제 연속 평가만 다뤘다. 네이티브에 가까운 게이트 분기는 실패했고 16K 분기는 실행되지 않았다. 자유 생성에서 동등한 결과가 나온다는 증거도 제시되지 않았다. 서로 다른 아키텍처와 학습 버전 사이의 안정성, 내부 상태 전달에 따른 격리·개인정보 위험은 후속 연구가 필요한 부분이다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…