아티클 목록으로
메모리·컨텍스트

Periscope, 동결 언어 모델의 컨텍스트 창을 넘어선 독해

약 3분 소요

긴 컨텍스트의 비용 문제

컨텍스트 창이 커진다고 해서 언어 모델이 긴 문서를 안정적으로 읽는 것은 아닙니다. 입력이 길어질수록 주의집중과 KV 캐시 비용이 커지고, 중요한 정보가 무관한 내용 속에 묻힐 수 있습니다. KAUST 연구진이 제안한 Periscope는 모델을 다시 학습하거나 가중치를 바꾸지 않고, 동결된 모델을 여러 차례 짧게 호출하는 방식으로 이 문제를 다룹니다.

전체 문서를 여러 탐침으로 분해

Periscope는 관련 문서 고르기, 본문이 뒷받침하는 선택지 판단, 근거 구간 찾기처럼 유한한 후보 중 하나를 선택하는 작업을 대상으로 합니다. 먼저 문서를 N개의 청크로 나누고, N의 제곱근에 가까운 K를 사용해 대략 K×K 격자에 배치합니다.

그다음 두 종류의 탐침을 만듭니다. 로컬 탐침은 서로 이어진 청크를 읽어 인접한 문맥과 세부 정보를 보존합니다. 스트라이드 탐침은 문서 곳곳의 청크를 간격을 두고 샘플링해 전체 범위를 확인합니다. 두 탐침 모두 같은 질문을 받지만, 긴 답변을 생성하지는 않습니다. 대신 후보 답변에 해당하는 한 개 출력 토큰의 로그 오즈를 비교해 어떤 선택지가 더 지지되는지 계산합니다.

각 답변에는 로컬 탐침과 스트라이드 탐침에서 얻은 최고 점수가 부여됩니다. 동시에 탐침의 점수를 포함된 청크에 되돌려 할당하면 증거 지도가 만들어집니다. 지도에서 점수가 높은 청크는 답변을 뒷받침할 가능성이 큰 위치입니다. 따라서 시스템은 처음부터 전체 문서를 정독하는 대신, 우선 가능성이 높은 소수의 구간을 고른 뒤 필요한 부분만 자세히 읽을 수 있습니다.

성능과 메모리 절감

공개된 평가 결과는 선택적 읽기가 단순한 긴 창 읽기와 경쟁할 수 있음을 보여줍니다. LongBench v2에서는 증거 지도가 상위로 선택한 약 9k 토큰만 읽어도, 32k에서 1M 토큰까지의 창을 사용한 동일 모델의 최선 결과와 비슷한 성능을 냈습니다. 컨텍스트 중앙값이 약 150k 토큰인 InfiniteBench에서는 최선의 창 기반 읽기보다 5점 앞섰습니다. BRIGHT 장문서 코퍼스에서도 평가된 6개 방법 가운데 NDCG@10이 가장 높았습니다.

메모리 측면의 핵심은 한 번의 호출마다 하나의 탐침만 캐시한다는 점입니다. 연구진의 보고에 따르면 27B 모델은 80GB GPU 한 장에서 450만 토큰 컨텍스트를 처리할 수 있습니다. 문서를 한 번에 직접 처리하면 KV 캐시에 296GB가 필요합니다. 여러 탐침을 실행하므로 계산량이 사라지는 것은 아니지만, 필요한 장비를 “문서 전체를 담을 GPU”에서 “모델을 담을 GPU”로 바꿀 수 있다는 의미가 있습니다.

의미와 한계

Periscope는 장문 컨텍스트 문제를 해결하는 방법이 반드시 더 큰 창을 만드는 것만은 아니라는 점을 보여줍니다. 유한한 선택지를 판단하는 작업에서는 모든 토큰을 같은 밀도로 표현하기보다, 전역 범위를 확인하면서 결정을 좌우하는 지역 정보를 찾는 방식이 더 효율적일 수 있습니다.

다만 자유 형식의 장문 요약이나 무제한 텍스트 생성을 그대로 대체하는 방법은 아닙니다. 후보 답변을 정의할 수 있어야 하고, 청크 크기와 탐침 설계가 결과에 영향을 줍니다. 실제 시스템에서는 Periscope를 장문서 선별과 근거 위치 파악에 활용한 뒤, 선택된 구간을 대상으로 정독과 검증, 답변 생성을 수행하는 구성이 적합합니다.

출처:Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
RealCompanion이 묻는 장기 대화 AI의 사람 이해 능력
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

RealCompanion이 묻는 장기 대화 AI의 사람 이해 능력

RealCompanion은 AI가 과거 발언을 검색할 수 있는지만이 아니라, 언제 기억이 필요한지 판단하고 이를 현재 대화에 적절히 활용하는지를 평가하는 장기 대화 벤치마크다. 연구 결과는 기억이 필요한 경우가 생각보다 적고, 그 시점을 판별하는 일은 여전히 어렵다는 점을 보여준다.

더 보기
CCTest · Blog
HeteroFold, 서로 다른 모델 간 KV Cache 공유에 도전
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

HeteroFold, 서로 다른 모델 간 KV Cache 공유에 도전

HeteroFold는 서로 다른 모델 패밀리로 구성된 멀티 에이전트 LLM에서 수신 측 재계산을 없애기 위한 KV Cache 전송 방법입니다. 논문은 32K 컨텍스트의 한 전송 방향에서 기본 Prefill 대비 약 10.7배의 속도 향상을 보고했습니다.

더 보기