학습 없이 모델 구조의 잠재력을 측정하는 NSC, 사양만으로 아키텍처 탐색
들어가며
Transformer 설계와 모델 압축은 결국 제한된 예산을 어디에 배분할지 결정하는 문제로 귀결됩니다. 네트워크를 더 깊게 만들 것인지, 은닉 차원을 넓힐 것인지, 어텐션 헤드나 FFN의 규모를 키울 것인지 선택해야 합니다. 파라미터 수와 FLOPs는 모델 크기와 계산 비용을 나타내는 표준 지표지만, 같은 예산이 어떤 구조로 배분됐는지는 충분히 설명하지 못합니다.
《Neural Spectral Capacity: Measuring and Designing Architectures from Network Specification Alone》은 이 한계를 보완하기 위해 Neural Spectral Capacity, 즉 NSC를 제안합니다.
NSC의 작동 방식
NSC는 각 가중치 행렬의 특이값 스펙트럼에서 출발합니다. 표준적인 무작위 초기화를 가정하면 Marchenko–Pastur 법칙을 통해 행렬의 형태와 초기화 분산에 따른 스펙트럼 특성을 이론적으로 계산할 수 있습니다. 연구진은 이를 바탕으로 네트워크 사양만으로 산출 가능한 폐쇄형 용량 점수를 구성했습니다.
따라서 후보 모델을 실제로 생성하거나 학습할 필요가 없습니다. 데이터와 그래디언트도 사용하지 않습니다. 비용이 큰 학습 실험에 들어가기 전에 구조적인 잠재력을 비교할 수 있다는 점이 핵심입니다.
NSC의 또 다른 특징은 층별 기여를 합산할 수 있다는 점입니다. 연구진은 이 성질을 이용해 NSC-DP라는 동적 계획법 기반 탐색기를 만들었습니다. 파라미터 수 또는 FLOPs 예산이 주어지면 후보 구조를 블랙박스 방식으로 반복 평가하는 대신, 설정된 탐색 공간에서 NSC를 전역적으로 최대화하는 구조를 계산합니다.
주요 결과
- FlexiBERT 아키텍처 순위 평가에서 NSC는 파라미터 수와 여러 대표적인 학습 없는 프록시보다 높은 성능을 보였습니다. 특히 파라미터 수 차이가 10% 미만인 모델들 사이에서도 구분력을 유지했습니다.
- WikiText-103의 Transformer-XL 설계 실험에서는 CPU 한 코어로 약 2초 만에 탐색을 끝냈고, 논문에 제시된 사람이 설계한 기준 모델보다 낮은 퍼플렉시티를 가진 구조를 찾았습니다.
- LLaMA-7B 가지치기에서는 보정 데이터를 사용하지 않고 5.7B 모델을 선택했습니다. 8개 상식 추론 과제에서 종합적으로 가장 좋은 결과를 보였으며, 가장 강력한 학습 없는 프록시 기준선보다 약 5900배 빠르게 실행됐습니다.
의미와 한계
NSC의 의미는 새로운 점수 하나를 추가했다는 데 그치지 않습니다. 사양만으로 계산할 수 있고 층별로 분해되는 지표를 사용하면, 아키텍처 평가와 탐색을 하나의 제약 최적화 문제로 연결할 수 있습니다. 모델군 확장, 구조적 압축, 예산 배분에서 학습에 앞선 1차 후보 선별 도구로 활용할 가능성이 있습니다.
다만 NSC는 무작위 초기화와 이론적 스펙트럼 가정에 기반한 구조적 용량 지표입니다. 특정 데이터셋이나 작업에서의 최종 정확도를 보장하는 척도는 아닙니다. 데이터 분포, 학습 과정, 최적화 설정, 하드웨어 특성은 실제 순위를 바꿀 수 있습니다. 앞으로는 NSC의 속도와 가산성을 유지하면서 데이터 기반 신호와 배포 비용까지 결합할 수 있을지가 중요한 과제가 될 것입니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…