Transformer는 너무 일찍 멈춘다? 작은 LoRA가 추론 릴레이를 재가동
들어가며
Transformer의 층이 많다고 해서 모든 작업에서 그 깊이를 충분히 사용하는 것은 아니다. Hugging Face Daily Papers에 소개된 이번 연구는 모델이 사고 과정을 출력하지 않고 답만 제시하는 조건에서, 참조 관계를 얼마나 멀리 따라갈 수 있는지 살펴봤다.
예를 들어 K = apple; B = K; D = B; print(D)라는 프로그램이 있다고 하자. 정답을 얻으려면 변수의 부모 관계를 순서대로 추적해야 한다. 연구진이 0.6B부터 32B까지 13개 사전학습 모델을 평가한 결과, 모델이 안정적으로 처리하는 범위는 보통 1.4~3.6줄에 불과했다. 모델의 깊이를 늘리거나 사전학습 루프를 추가해도 이 범위는 크게 확장되지 않았다.
핵심 결과
- 아주 작은 어댑터가 실질적인 계산 깊이를 바꿨다. Qwen3-8B의 초기 층에 rank-8 LoRA를 넣고 기본 모델의 모든 가중치를 동결하자, 24줄 참조 사슬의 완전 일치 정확도가 15.5%에서 99%로 상승했다. 추가된 파라미터는 65,537개뿐이다. 더 오래 학습한 버전은 한 번의 순방향 계산으로 50줄까지 처리했다.
- LoRA는 계산 릴레이를 시작하는 것으로 보인다. LoRA는 각 토큰에 독립적으로 작용하며 토큰 사이의 정보를 직접 옮기지 않는다. 대신 각 프로그램 행의 사슬 정체성이 동결된 중간 층, 특히 16~22층을 거쳐 전달되도록 준비한다. 이후의 어텐션 헤드는 사슬의 더 앞쪽에 있는 조상을 점점 더 멀리 읽는다.
- 삽입 위치에는 급격한 절벽이 있다. 같은 학습법을 20층에 적용하면 약 20.5줄까지 도달했지만, 21층으로 옮기면 5.2줄로 떨어졌다. 동결 모델을 이용한 측정법은 별도로 남겨둔 4개 모델 중 3개에서 유효한 개입 경계를 사전 등록된 허용 범위 안에서 찾아냈다.
- 반복 구조는 효과를 더 키울 수 있다. Ouro-1.4B에서 각 루프에 LoRA를 적용하자 4회 루프에서 60줄, 8회 루프에서 최소 160줄을 처리했다. 이는 두 사슬 중 하나를 고르는 과제에서의 결과다.
- 합성 과제에만 머물지 않았다. MuSiQue에서는 세 표준 모델에 각각 학습한 초기 층 LoRA가 완전 일치 점수를 9.4~17.9포인트 높였다. 다만 해당 실험은 정답 문단이 제공된 조건에서 진행됐다.
의미와 한계
이 연구가 말하는 핵심은 작은 LoRA가 일반 지능을 새로 만들어낸다는 뜻이 아니다. 특정 작업에서 사전학습 모델은 이미 반복 계산을 표현할 수 있지만, 그 계산을 시작하거나 계속 이어가는 데 실패할 수 있다는 것이다. LoRA는 일종의 작동 신호가 되어 동결된 층들이 중간 상태를 더 멀리 전달하도록 만든다.
따라서 모델을 개선하는 방법도 달라질 수 있다. 모든 층을 미세조정하거나 모델 규모를 키우기 전에, 유용한 계산이 어느 층에서 멈추는지 측정한 뒤 특정 위치만 편집하는 방식이다. 다만 가장 강한 결과는 구조화된 참조 사슬과 통제된 다단계 QA에서 나왔으며, 개방형 환경의 일반적인 추론 신뢰성을 보장하지는 않는다. 효과가 모델 구조, 학습 과제, LoRA 삽입 위치에 의존한다는 점도 중요하다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…