Loop Scaling Laws, 순환형 MoE의 확장 법칙을 통합하다
들어가며
대규모 언어 모델을 키우는 방법이 고유 파라미터를 계속 추가하는 것만은 아닙니다. 순환형 Transformer는 같은 파라미터를 여러 번 실행해 저장해야 하는 모델 규모를 크게 늘리지 않고 계산 깊이를 높입니다. 반면 Mixture-of-Experts(MoE)는 토큰마다 일부 전문가만 활성화해 한 번의 계산량을 관리하면서 전체 파라미터 용량을 확장합니다.
기존 스케일링 법칙은 대체로 순환과 희소성을 따로 다뤘습니다. 따라서 MoE에 순환을 결합할 때 적절한 루프 횟수는 얼마인지, 희소성이 반복 계산의 효과를 어떻게 바꾸는지는 충분히 설명하기 어려웠습니다.
Meta 연구진은 논문 「Scaling Laws for Looped Mixture of Experts」에서 순환, 희소성, 모델 규모, 데이터 규모를 하나의 틀에서 다루는 Loop Scaling Laws를 제안했습니다.
핵심 내용
- 두 가지 효율 축을 공동 모델링한다. 순환은 주로 계산 깊이를 늘리고, MoE 희소성은 전체 파라미터 용량을 확대한다는 차이를 하나의 법칙에 담았습니다.
- 루프 횟수보다 실질적 용량 증가를 측정한다. 희소성에 따라 달라지는 유계 순환 매핑으로 루핑이 제공하는 유효 파라미터 이득과 수익 체감 구간을 표현합니다.
- 기존 법칙과 연결된다. 특정 조건에서는 일반적인 밀집 모델과 MoE의 스케일링 법칙을 특수한 경우로 복원합니다.
- 제약 조건에 맞춘 설계를 지원한다. 학습 연산량과 메모리 예산이 정해졌을 때 모델 규모, 희소성, 순환 횟수를 정하는 데 활용할 수 있습니다.
- 서로 다른 효율성이 결합된다. 연구 요약에 따르면 희소성은 활성 파라미터 효율에서 약 3배, 순환은 추론 과제의 전체 파라미터 효율에서 약 2배의 효과를 보였으며, 두 요소를 함께 적용하면 성능 경계를 더 확장했습니다.
의미와 영향
이 연구의 핵심은 새로운 수식 하나보다 모델의 용량과 계산 깊이를 같은 설계 공간에서 다루려는 시도에 있습니다. 전문가 수를 늘리는 MoE는 전체 용량을 확장하지만 모든 토큰에 모든 파라미터를 계산하지는 않습니다. 순환 모델은 동일한 블록을 반복해 더 깊은 계산을 수행하지만, 루프를 무한히 늘린다고 성능이 계속 좋아지는 것은 아닙니다. 포화 현상을 포함한 스케일링 법칙은 경험에만 의존하지 않고 구조를 선택하는 데 도움을 줄 수 있습니다.
연구 요약은 1조 토큰 규모의 학습에서도 이러한 효과가 유지됐다고 설명합니다. 학습 연산량을 맞췄을 때, 법칙으로 정한 순환을 적용한 MoE가 전체 파라미터 기준 약 2배 큰 비순환 MoE에 가까운 추론 벤치마크 성능을 보였다는 내용입니다. 또한 추론 시 루프를 더 실행할 수 있어 테스트 시점의 계산 확장에도 활용할 수 있습니다.
다만 이 수치는 보고된 설정에서의 결과이며 모든 모델에 동일하게 적용되는 보장은 아닙니다. 실제 이득은 과제, 라우팅 방식, 하드웨어 활용률, 최적화 안정성에 따라 달라질 수 있습니다. 그럼에도 이 연구는 파라미터 수만 키우는 대신 저장 용량, 활성 연산, 반복 깊이, 추론 시 예산을 함께 배분하는 새로운 확장 전략을 제시합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…