아티클 목록으로
대규모 언어 모델

Dust, 역전파 없이 Transformer를 사전 학습하다

약 3분 소요

들어가며

현대 딥러닝의 학습 방식은 사실상 역전파를 중심으로 발전해 왔다. 모델의 미분 가능성을 이용해 gradient를 계산하고, 이를 바탕으로 가중치를 갱신하는 구조다. Dust는 이 전제가 반드시 필요하지 않을 수 있는지 탐색한다. 계산 자원이 충분하다면 해석적인 gradient 대신 더 폭넓은 검색 기반 credit assignment가 경쟁력을 가질 수 있다는 문제의식이다.

Dust의 작동 방식

Dust는 제로차 최적화 알고리즘이다. 손실을 직접 미분하지 않고 내부 활성값에 perturbation을 가한 뒤, 그 perturbation이 손실을 어떻게 바꾸었는지 관찰한다. 손실을 낮춘 perturbation에 더 큰 보상을 부여하고, 여러 perturbation을 보상에 따라 평균해 업데이트 방향을 추정한다.

핵심은 탐색 대상을 가중치에서 활성값으로 옮긴 데 있다. Dust는 각 토큰에 독립적으로 perturbation을 적용하므로, 각각의 토큰을 가상 개체군의 한 구성원으로 볼 수 있다. 별도의 모델 사본을 개체마다 만들지 않고도 한 번의 순전파에서 다수의 후보를 병렬로 평가하는 방식이다. Transformer 블록의 층 유형에 따라 토큰 수준 보상 규칙을 다르게 적용하고, perturbation된 모듈 사이의 간섭을 줄이는 구현도 사용한다.

핵심 결과

  • Transformer 언어 모델 사전 학습에서 역전파에 근접한 성능을 보인 초기 제로차 방법 중 하나로 제시됐다.
  • 가상 개체군의 규모가 커질수록 Dust의 gradient 추정은 역전파와 더 잘 정렬된다. 일부 설정에서는 역전파보다 좋은 결과도 보고됐다.
  • 가중치 공간에서 진화 전략을 수행하는 방식과 비교하면, 활성값 공간 탐색은 평가와 메모리 부담을 줄일 수 있다. 논문은 일정한 토큰 규모 이상에서 비교 대상인 EGGROLL의 Transformer 구현보다 여러 자릿수 효율적일 수 있다고 추정한다.
  • 큰 모델이 반드시 개체군 효율성에서 불리한 것은 아니었다. 실험에서는 더 큰 모델이 여러 개체군 규모에서 훨씬 작은 모델보다 좋은 결과를 보였다.
  • 그렇다고 Dust가 현재 역전파를 더 낮은 비용으로 대체한다는 뜻은 아니다. 연구진도 실제 사용에 필요한 계산 효율에는 아직 도달하지 않았다고 설명한다.

의미와 한계

Dust의 의미는 당장 새로운 표준 학습법을 제시했다는 데 있기보다, 대규모 신경망에서 시험할 수 있는 학습 알고리즘의 범위를 넓혔다는 데 있다. 제로차 방법이 작은 모델이나 단순한 문제에만 적합하다는 통념에 도전하며, 활성값 perturbation과 병렬 계산을 결합하면 Transformer 사전 학습에도 적용할 수 있음을 보여준다.

활성값을 탐색 대상으로 삼는 방식은 내부 표현이나 잠재적 추론 과정을 검색하는 방향으로도 이어질 수 있다. 또한 외부 프로그램이나 미분 불가능한 구성 요소를 포함한 시스템을 학습시키는 대안이 될 가능성도 있다.

다만 역전파와 경쟁하려면 더 큰 개체군과 더 많은 계산이 필요할 수 있다. 현재 결과는 가능성과 확장 경향을 보여주는 것이지, 비용·데이터 효율·최종 능력에서 역전파를 전면적으로 앞선다는 결론은 아니다. 앞으로는 더 큰 규모와 실제로 비미분 구성 요소가 필요한 아키텍처에서도 이 장점이 유지되는지 확인해야 한다.

출처: Hacker News

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
4B 모델이 체스를 두고 설명한다: Queen의 구조와 성과
대규모 언어 모델
cctest.ai
대규모 언어 모델

4B 모델이 체스를 두고 설명한다: Queen의 구조와 성과

Queen은 강하지만 설명하지 못하는 체스 전문가 인코더와 자연어를 생성하는 지시 튜닝 언어 모델을 결합한다. 논문은 7회의 반복 증류를 통해 모델의 체스 레이팅이 1782에서 2697 Elo로 상승했다고 보고한다.

더 보기
CCTest · Blog
Transformer는 너무 일찍 멈춘다? 작은 LoRA가 추론 릴레이를 재가동
대규모 언어 모델
cctest.ai
대규모 언어 모델

Transformer는 너무 일찍 멈춘다? 작은 LoRA가 추론 릴레이를 재가동

새 연구는 많은 사전학습 Transformer가 긴 참조 사슬을 처리할 능력이 없는 것이 아니라, 계산을 너무 일찍 중단할 수 있음을 보여준다. 초기 한 층에 rank-8 LoRA를 추가하면 동결된 중간 층이 더 긴 사슬을 전달할 수 있다.

더 보기