아티클 목록으로
메모리·컨텍스트

ALiBi 위치 인코딩의 ‘시야 상실’: 긴 문맥 주의가 0이 되는 이유

약 3분 소요

들어가며

ALiBi(Attention with Linear Biases)는 Transformer가 더 긴 문맥을 다루도록 돕는 위치 인코딩 방식으로 널리 사용된다. 별도의 위치 임베딩을 학습하는 대신, attention score에 거리 기반 선형 바이어스를 더해 가까운 토큰을 더 선호하도록 만든다. 구조가 단순하고 긴 문맥 일반화에 유리하다는 점 때문에 실용적 선택지로 여겨져 왔다.

하지만 논문 When Attention Goes Blind는 ALiBi에 잘 드러나지 않았던 수치적 실패 모드가 있다고 주장한다. 핵심은 모델이 먼 토큰을 덜 보는 수준이 아니라, 부동소수점 계산 과정에서 먼 위치의 attention weight가 완전히 0이 될 수 있다는 점이다.

핵심 내용

  • 문제의 원인은 수치 언더플로: ALiBi의 선형 바이어스는 거리가 멀수록 커진다. 이 값이 softmax를 거친 뒤 매우 작은 확률을 만들면, 부동소수점 정밀도 한계 아래로 내려가 0으로 표현될 수 있다.
  • 일부 attention head가 부분적으로 ‘눈먼’ 상태가 된다: attention weight가 정확히 0이면 해당 위치에서 정보를 읽어올 수 없다. 이는 단순히 낮은 확률을 주는 것보다 더 강한 차단 효과다.
  • 일반 벤치마크에서는 잘 보이지 않는다: 논문은 이 실패가 긴 문맥에서 특정 토큰을 찾아야 하는 retrieval 작업에 큰 손상을 줄 수 있다고 보고한다. 반면 표준 디코더 벤치마크에서는 영향이 작게 나타날 수 있어 문제를 놓치기 쉽다.
  • 실제 사전학습 모델에서도 발생: 저자들은 ALiBi 기반 최신 사전학습 모델에서도 이 현상을 확인했다고 설명한다.
  • 148M 파라미터 모델로 원인을 분리: 연구진은 148M 파라미터 디코더 모델의 사전학습 실험을 통해 이 수치 실패와 일반적인 긴 문맥 성능 저하를 구분해 분석했다.
  • log-scaled distances가 안정적 완화책: 네 가지 학습 시점 완화 전략과 그 조합을 평가한 결과, 거리 값을 로그 스케일로 다루는 방식이 passkey retrieval에서 가장 일관된 개선을 보였다.

의미와 영향

이 연구는 긴 문맥 모델의 약점을 단순한 모델 용량이나 학습 부족 문제가 아니라, attention 계산의 수치 안정성 문제로 바라보게 만든다. 어떤 위치의 attention 확률이 이미 0으로 붕괴했다면, 모델은 그 위치의 정보를 활용하는 법을 배우기 전에 접근 경로 자체를 잃게 된다.

그렇다고 ALiBi가 쓸모없다는 결론은 아니다. 논문은 기본 ALiBi slopes가 여전히 강력한 기준선이며, 특히 needle-in-a-haystack retrieval에서는 놀라울 정도로 경쟁력 있다고 평가한다. 따라서 핵심은 폐기가 아니라 점검과 보완이다.

실무적으로는 ALiBi를 사용하는 긴 문맥 모델을 평가할 때 일반 언어모델링 지표만으로는 부족하다. passkey retrieval, needle-in-a-haystack 같은 검색형 테스트를 함께 수행하고, 학습 단계에서 더 안전한 거리 스케일링을 적용할지 검토해야 한다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
CAPA: 코딩 어시스턴트는 사용자의 애매한 표현을 기억할 수 있을까
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

CAPA: 코딩 어시스턴트는 사용자의 애매한 표현을 기억할 수 있을까

새 논문은 세션을 넘나드는 개인화된 모호성 적응을 코딩 어시스턴트의 새로운 평가 과제로 제시한다. 핵심은 같은 사용자의 과거 해결 기록을 활용해 반복되는 애매한 요청을 더 적은 확인으로 처리할 수 있는지다.

더 보기
CCTest · Blog
Metis: 파운데이션 모델 안에 들어간 네이티브 메모리
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

Metis: 파운데이션 모델 안에 들어간 네이티브 메모리

Metis는 에이전트 메모리를 외부 검색·저장 파이프라인이 아니라 모델 내부의 지속적으로 변화하는 상태로 다루는 ‘메모리 파운데이션 모델’을 제안한다. 핵심은 과거 정보를 압축된 세션 상태로 유지하고 이후 계산에서 직접 활용하는 것이다.

더 보기