ALiBi 위치 인코딩의 ‘시야 상실’: 긴 문맥 주의가 0이 되는 이유
들어가며
ALiBi(Attention with Linear Biases)는 Transformer가 더 긴 문맥을 다루도록 돕는 위치 인코딩 방식으로 널리 사용된다. 별도의 위치 임베딩을 학습하는 대신, attention score에 거리 기반 선형 바이어스를 더해 가까운 토큰을 더 선호하도록 만든다. 구조가 단순하고 긴 문맥 일반화에 유리하다는 점 때문에 실용적 선택지로 여겨져 왔다.
하지만 논문 When Attention Goes Blind는 ALiBi에 잘 드러나지 않았던 수치적 실패 모드가 있다고 주장한다. 핵심은 모델이 먼 토큰을 덜 보는 수준이 아니라, 부동소수점 계산 과정에서 먼 위치의 attention weight가 완전히 0이 될 수 있다는 점이다.
핵심 내용
- 문제의 원인은 수치 언더플로: ALiBi의 선형 바이어스는 거리가 멀수록 커진다. 이 값이 softmax를 거친 뒤 매우 작은 확률을 만들면, 부동소수점 정밀도 한계 아래로 내려가 0으로 표현될 수 있다.
- 일부 attention head가 부분적으로 ‘눈먼’ 상태가 된다: attention weight가 정확히 0이면 해당 위치에서 정보를 읽어올 수 없다. 이는 단순히 낮은 확률을 주는 것보다 더 강한 차단 효과다.
- 일반 벤치마크에서는 잘 보이지 않는다: 논문은 이 실패가 긴 문맥에서 특정 토큰을 찾아야 하는 retrieval 작업에 큰 손상을 줄 수 있다고 보고한다. 반면 표준 디코더 벤치마크에서는 영향이 작게 나타날 수 있어 문제를 놓치기 쉽다.
- 실제 사전학습 모델에서도 발생: 저자들은 ALiBi 기반 최신 사전학습 모델에서도 이 현상을 확인했다고 설명한다.
- 148M 파라미터 모델로 원인을 분리: 연구진은 148M 파라미터 디코더 모델의 사전학습 실험을 통해 이 수치 실패와 일반적인 긴 문맥 성능 저하를 구분해 분석했다.
- log-scaled distances가 안정적 완화책: 네 가지 학습 시점 완화 전략과 그 조합을 평가한 결과, 거리 값을 로그 스케일로 다루는 방식이 passkey retrieval에서 가장 일관된 개선을 보였다.
의미와 영향
이 연구는 긴 문맥 모델의 약점을 단순한 모델 용량이나 학습 부족 문제가 아니라, attention 계산의 수치 안정성 문제로 바라보게 만든다. 어떤 위치의 attention 확률이 이미 0으로 붕괴했다면, 모델은 그 위치의 정보를 활용하는 법을 배우기 전에 접근 경로 자체를 잃게 된다.
그렇다고 ALiBi가 쓸모없다는 결론은 아니다. 논문은 기본 ALiBi slopes가 여전히 강력한 기준선이며, 특히 needle-in-a-haystack retrieval에서는 놀라울 정도로 경쟁력 있다고 평가한다. 따라서 핵심은 폐기가 아니라 점검과 보완이다.
실무적으로는 ALiBi를 사용하는 긴 문맥 모델을 평가할 때 일반 언어모델링 지표만으로는 부족하다. passkey retrieval, needle-in-a-haystack 같은 검색형 테스트를 함께 수행하고, 학습 단계에서 더 안전한 거리 스케일링을 적용할지 검토해야 한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…