아티클 목록으로
메모리·컨텍스트

장문맥 하이브리드 모델의 성능을 좌우하는 위치 편향

약 3분 소요

대규모 언어 모델의 장문맥 설계는 모든 토큰을 연결하는 전체 어텐션 일변도에서 여러 어텐션 모듈을 결합하는 방향으로 이동하고 있다. 전체 어텐션은 먼 거리의 의존성을 포착하기 쉽지만, 시퀀스가 길어질수록 계산 비용이 커진다. 슬라이딩 윈도우 어텐션은 참조 범위를 국소화하고, 선형 어텐션은 과거 정보를 더 압축적으로 집계하려 한다.

논문 ‘Mechanics of Long-Context Hybrid Models Part 1.1’은 RoPE 전체 어텐션, NoPE 전체 어텐션, 슬라이딩 윈도우 어텐션, GLA와 GDN 같은 게이트 선형 어텐션이 장문맥 학습에서 어떻게 결합되는지 분석했다. 핵심 주장은 하이브리드 모델을 단순한 어텐션 모듈의 조합으로 볼 것이 아니라, 서로 다른 위치 귀납 편향의 조합으로 이해해야 한다는 것이다.

문맥 확장과 길이 외삽의 시소 효과

연구진은 두 종류의 하이브리드 모델이 서로 다른 조건에서 강점을 보인다는 점을 관찰했다. 학습 문맥 길이를 넘어 모델을 바로 사용하는 길이 외삽에서는 슬라이딩 윈도우 하이브리드가 더 강한 경우가 많았다. 반면 긴 시퀀스를 사용한 지속 사전학습을 거치면 선형 어텐션 하이브리드의 성능 향상이 더 커졌다. 특히 층별로 모듈을 배치하는 구조에서 이 차이가 두드러졌다.

슬라이딩 윈도우 모델에는 ‘짧은 문맥 학습의 함정’이 생길 수 있다. 짧은 윈도우에 지나치게 적응한 모델은 문맥을 확장한 뒤에도 먼 거리 정보를 충분히 활용하지 못할 수 있다. 연구는 이와 관련해 ‘짧은 윈도우 피로’와 ‘긴 윈도우의 나태함’도 제시한다. 윈도우가 너무 짧으면 장거리 학습이 제한되고, 반대로 지나치게 길면 국소 구조를 학습하려는 압력이 약해질 수 있다는 의미다.

선형 어텐션도 외삽을 공짜로 얻지는 못한다

선형 어텐션은 학습 범위 안이나 장문맥 지속학습 이후에는 강한 성능을 보일 수 있다. 그러나 학습 길이를 넘어 직접 외삽할 때는 슬라이딩 윈도우 하이브리드보다 약할 수 있다. 계산 복잡도가 낮다는 사실만으로 위치 일반화까지 보장되지는 않는다는 점을 보여준다.

논문은 모듈별 역할도 분석한다. 소수의 NoPE 어텐션은 높은 검색 적중률과 거친 전역 집계를 통해 넓은 정보 접근을 담당할 수 있다. 반면 RoPE 어텐션과 게이트 선형 어텐션처럼 엔트로피가 낮고 위치에 민감한 모듈은 잡음을 줄이는 역할을 맡는다. 두 분포 사이의 경계는 하이브리드 비율에 따라 변하므로, 한 종류의 모듈을 단순히 늘리는 것이 항상 최선은 아니다.

지역성과 외삽을 결합한 제안

연구진은 위치에 민감한 어텐션에 슬라이딩 윈도우를 적용하고, NoPE 어텐션의 전역 집계를 강화한 Sliding-Window Linear Attention을 제안했다. 이 방식은 국소 패턴, 전역 검색, 길이 외삽을 동시에 고려하려는 접근이다. 보고된 결과에 따르면 64K 문맥의 NIAH-SK1에서 100% 정확도를 유지했으며, 추가 학습 없이 16배 길이 외삽을 달성했다.

이 연구의 broader한 시사점은 장문맥 아키텍처를 평가할 때 계산량만 비교해서는 안 된다는 것이다. 윈도우 크기, 층별 배치, 위치 인코딩, 국소 경로와 전역 경로의 비율이 모두 학습 및 외삽 성능을 좌우한다. 앞으로의 하이브리드 모델은 서로 다른 어텐션을 단순히 쌓는 대신, 각 모듈이 만들어내는 위치 편향까지 함께 설계해야 할 가능성이 크다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
EngramEdit, LLM의 사실 지식을 독립적으로 업데이트하다
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

EngramEdit, LLM의 사실 지식을 독립적으로 업데이트하다

EngramEdit는 조건부 메모리를 단순한 용량 확장 장치에서 편집 가능한 지식 인터페이스로 확장합니다. Transformer 본체를 고정한 채 공유 n-gram 임베딩을 업데이트해 여러 표현에 걸친 지식 수정과 부작용 억제를 시도합니다.

더 보기
CCTest · Blog
KV 상태 저장으로 AI가 5000만 토큰의 기록을 재사용하는 방법
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

KV 상태 저장으로 AI가 5000만 토큰의 기록을 재사용하는 방법

galahad-kv를 활용한 실험은 언어 모델의 KV 상태를 암호화된 로컬 NVMe에 저장한 뒤 재계산 없이 불러올 수 있음을 보여줬다. 주의집중 창을 넓히는 기술은 아니지만, 긴 기록을 효율적으로 재사용하는 실용적 접근이다.

더 보기