Periscope, 동결 언어 모델의 컨텍스트 창을 넘어선 독해
긴 컨텍스트의 비용 문제
컨텍스트 창이 커진다고 해서 언어 모델이 긴 문서를 안정적으로 읽는 것은 아닙니다. 입력이 길어질수록 주의집중과 KV 캐시 비용이 커지고, 중요한 정보가 무관한 내용 속에 묻힐 수 있습니다. KAUST 연구진이 제안한 Periscope는 모델을 다시 학습하거나 가중치를 바꾸지 않고, 동결된 모델을 여러 차례 짧게 호출하는 방식으로 이 문제를 다룹니다.
전체 문서를 여러 탐침으로 분해
Periscope는 관련 문서 고르기, 본문이 뒷받침하는 선택지 판단, 근거 구간 찾기처럼 유한한 후보 중 하나를 선택하는 작업을 대상으로 합니다. 먼저 문서를 N개의 청크로 나누고, N의 제곱근에 가까운 K를 사용해 대략 K×K 격자에 배치합니다.
그다음 두 종류의 탐침을 만듭니다. 로컬 탐침은 서로 이어진 청크를 읽어 인접한 문맥과 세부 정보를 보존합니다. 스트라이드 탐침은 문서 곳곳의 청크를 간격을 두고 샘플링해 전체 범위를 확인합니다. 두 탐침 모두 같은 질문을 받지만, 긴 답변을 생성하지는 않습니다. 대신 후보 답변에 해당하는 한 개 출력 토큰의 로그 오즈를 비교해 어떤 선택지가 더 지지되는지 계산합니다.
각 답변에는 로컬 탐침과 스트라이드 탐침에서 얻은 최고 점수가 부여됩니다. 동시에 탐침의 점수를 포함된 청크에 되돌려 할당하면 증거 지도가 만들어집니다. 지도에서 점수가 높은 청크는 답변을 뒷받침할 가능성이 큰 위치입니다. 따라서 시스템은 처음부터 전체 문서를 정독하는 대신, 우선 가능성이 높은 소수의 구간을 고른 뒤 필요한 부분만 자세히 읽을 수 있습니다.
성능과 메모리 절감
공개된 평가 결과는 선택적 읽기가 단순한 긴 창 읽기와 경쟁할 수 있음을 보여줍니다. LongBench v2에서는 증거 지도가 상위로 선택한 약 9k 토큰만 읽어도, 32k에서 1M 토큰까지의 창을 사용한 동일 모델의 최선 결과와 비슷한 성능을 냈습니다. 컨텍스트 중앙값이 약 150k 토큰인 InfiniteBench에서는 최선의 창 기반 읽기보다 5점 앞섰습니다. BRIGHT 장문서 코퍼스에서도 평가된 6개 방법 가운데 NDCG@10이 가장 높았습니다.
메모리 측면의 핵심은 한 번의 호출마다 하나의 탐침만 캐시한다는 점입니다. 연구진의 보고에 따르면 27B 모델은 80GB GPU 한 장에서 450만 토큰 컨텍스트를 처리할 수 있습니다. 문서를 한 번에 직접 처리하면 KV 캐시에 296GB가 필요합니다. 여러 탐침을 실행하므로 계산량이 사라지는 것은 아니지만, 필요한 장비를 “문서 전체를 담을 GPU”에서 “모델을 담을 GPU”로 바꿀 수 있다는 의미가 있습니다.
의미와 한계
Periscope는 장문 컨텍스트 문제를 해결하는 방법이 반드시 더 큰 창을 만드는 것만은 아니라는 점을 보여줍니다. 유한한 선택지를 판단하는 작업에서는 모든 토큰을 같은 밀도로 표현하기보다, 전역 범위를 확인하면서 결정을 좌우하는 지역 정보를 찾는 방식이 더 효율적일 수 있습니다.
다만 자유 형식의 장문 요약이나 무제한 텍스트 생성을 그대로 대체하는 방법은 아닙니다. 후보 답변을 정의할 수 있어야 하고, 청크 크기와 탐침 설계가 결과에 영향을 줍니다. 실제 시스템에서는 Periscope를 장문서 선별과 근거 위치 파악에 활용한 뒤, 선택된 구간을 대상으로 정독과 검증, 답변 생성을 수행하는 구성이 적합합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…