장문맥 하이브리드 모델의 성능을 좌우하는 위치 편향
대규모 언어 모델의 장문맥 설계는 모든 토큰을 연결하는 전체 어텐션 일변도에서 여러 어텐션 모듈을 결합하는 방향으로 이동하고 있다. 전체 어텐션은 먼 거리의 의존성을 포착하기 쉽지만, 시퀀스가 길어질수록 계산 비용이 커진다. 슬라이딩 윈도우 어텐션은 참조 범위를 국소화하고, 선형 어텐션은 과거 정보를 더 압축적으로 집계하려 한다.
논문 ‘Mechanics of Long-Context Hybrid Models Part 1.1’은 RoPE 전체 어텐션, NoPE 전체 어텐션, 슬라이딩 윈도우 어텐션, GLA와 GDN 같은 게이트 선형 어텐션이 장문맥 학습에서 어떻게 결합되는지 분석했다. 핵심 주장은 하이브리드 모델을 단순한 어텐션 모듈의 조합으로 볼 것이 아니라, 서로 다른 위치 귀납 편향의 조합으로 이해해야 한다는 것이다.
문맥 확장과 길이 외삽의 시소 효과
연구진은 두 종류의 하이브리드 모델이 서로 다른 조건에서 강점을 보인다는 점을 관찰했다. 학습 문맥 길이를 넘어 모델을 바로 사용하는 길이 외삽에서는 슬라이딩 윈도우 하이브리드가 더 강한 경우가 많았다. 반면 긴 시퀀스를 사용한 지속 사전학습을 거치면 선형 어텐션 하이브리드의 성능 향상이 더 커졌다. 특히 층별로 모듈을 배치하는 구조에서 이 차이가 두드러졌다.
슬라이딩 윈도우 모델에는 ‘짧은 문맥 학습의 함정’이 생길 수 있다. 짧은 윈도우에 지나치게 적응한 모델은 문맥을 확장한 뒤에도 먼 거리 정보를 충분히 활용하지 못할 수 있다. 연구는 이와 관련해 ‘짧은 윈도우 피로’와 ‘긴 윈도우의 나태함’도 제시한다. 윈도우가 너무 짧으면 장거리 학습이 제한되고, 반대로 지나치게 길면 국소 구조를 학습하려는 압력이 약해질 수 있다는 의미다.
선형 어텐션도 외삽을 공짜로 얻지는 못한다
선형 어텐션은 학습 범위 안이나 장문맥 지속학습 이후에는 강한 성능을 보일 수 있다. 그러나 학습 길이를 넘어 직접 외삽할 때는 슬라이딩 윈도우 하이브리드보다 약할 수 있다. 계산 복잡도가 낮다는 사실만으로 위치 일반화까지 보장되지는 않는다는 점을 보여준다.
논문은 모듈별 역할도 분석한다. 소수의 NoPE 어텐션은 높은 검색 적중률과 거친 전역 집계를 통해 넓은 정보 접근을 담당할 수 있다. 반면 RoPE 어텐션과 게이트 선형 어텐션처럼 엔트로피가 낮고 위치에 민감한 모듈은 잡음을 줄이는 역할을 맡는다. 두 분포 사이의 경계는 하이브리드 비율에 따라 변하므로, 한 종류의 모듈을 단순히 늘리는 것이 항상 최선은 아니다.
지역성과 외삽을 결합한 제안
연구진은 위치에 민감한 어텐션에 슬라이딩 윈도우를 적용하고, NoPE 어텐션의 전역 집계를 강화한 Sliding-Window Linear Attention을 제안했다. 이 방식은 국소 패턴, 전역 검색, 길이 외삽을 동시에 고려하려는 접근이다. 보고된 결과에 따르면 64K 문맥의 NIAH-SK1에서 100% 정확도를 유지했으며, 추가 학습 없이 16배 길이 외삽을 달성했다.
이 연구의 broader한 시사점은 장문맥 아키텍처를 평가할 때 계산량만 비교해서는 안 된다는 것이다. 윈도우 크기, 층별 배치, 위치 인코딩, 국소 경로와 전역 경로의 비율이 모두 학습 및 외삽 성능을 좌우한다. 앞으로의 하이브리드 모델은 서로 다른 어텐션을 단순히 쌓는 대신, 각 모듈이 만들어내는 위치 편향까지 함께 설계해야 할 가능성이 크다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…