아티클 목록으로
대규모 언어 모델

Loop Scaling Laws, 순환형 MoE의 확장 법칙을 통합하다

약 3분 소요

들어가며

대규모 언어 모델을 키우는 방법이 고유 파라미터를 계속 추가하는 것만은 아닙니다. 순환형 Transformer는 같은 파라미터를 여러 번 실행해 저장해야 하는 모델 규모를 크게 늘리지 않고 계산 깊이를 높입니다. 반면 Mixture-of-Experts(MoE)는 토큰마다 일부 전문가만 활성화해 한 번의 계산량을 관리하면서 전체 파라미터 용량을 확장합니다.

기존 스케일링 법칙은 대체로 순환과 희소성을 따로 다뤘습니다. 따라서 MoE에 순환을 결합할 때 적절한 루프 횟수는 얼마인지, 희소성이 반복 계산의 효과를 어떻게 바꾸는지는 충분히 설명하기 어려웠습니다.

Meta 연구진은 논문 「Scaling Laws for Looped Mixture of Experts」에서 순환, 희소성, 모델 규모, 데이터 규모를 하나의 틀에서 다루는 Loop Scaling Laws를 제안했습니다.

핵심 내용

  • 두 가지 효율 축을 공동 모델링한다. 순환은 주로 계산 깊이를 늘리고, MoE 희소성은 전체 파라미터 용량을 확대한다는 차이를 하나의 법칙에 담았습니다.
  • 루프 횟수보다 실질적 용량 증가를 측정한다. 희소성에 따라 달라지는 유계 순환 매핑으로 루핑이 제공하는 유효 파라미터 이득과 수익 체감 구간을 표현합니다.
  • 기존 법칙과 연결된다. 특정 조건에서는 일반적인 밀집 모델과 MoE의 스케일링 법칙을 특수한 경우로 복원합니다.
  • 제약 조건에 맞춘 설계를 지원한다. 학습 연산량과 메모리 예산이 정해졌을 때 모델 규모, 희소성, 순환 횟수를 정하는 데 활용할 수 있습니다.
  • 서로 다른 효율성이 결합된다. 연구 요약에 따르면 희소성은 활성 파라미터 효율에서 약 3배, 순환은 추론 과제의 전체 파라미터 효율에서 약 2배의 효과를 보였으며, 두 요소를 함께 적용하면 성능 경계를 더 확장했습니다.

의미와 영향

이 연구의 핵심은 새로운 수식 하나보다 모델의 용량과 계산 깊이를 같은 설계 공간에서 다루려는 시도에 있습니다. 전문가 수를 늘리는 MoE는 전체 용량을 확장하지만 모든 토큰에 모든 파라미터를 계산하지는 않습니다. 순환 모델은 동일한 블록을 반복해 더 깊은 계산을 수행하지만, 루프를 무한히 늘린다고 성능이 계속 좋아지는 것은 아닙니다. 포화 현상을 포함한 스케일링 법칙은 경험에만 의존하지 않고 구조를 선택하는 데 도움을 줄 수 있습니다.

연구 요약은 1조 토큰 규모의 학습에서도 이러한 효과가 유지됐다고 설명합니다. 학습 연산량을 맞췄을 때, 법칙으로 정한 순환을 적용한 MoE가 전체 파라미터 기준 약 2배 큰 비순환 MoE에 가까운 추론 벤치마크 성능을 보였다는 내용입니다. 또한 추론 시 루프를 더 실행할 수 있어 테스트 시점의 계산 확장에도 활용할 수 있습니다.

다만 이 수치는 보고된 설정에서의 결과이며 모든 모델에 동일하게 적용되는 보장은 아닙니다. 실제 이득은 과제, 라우팅 방식, 하드웨어 활용률, 최적화 안정성에 따라 달라질 수 있습니다. 그럼에도 이 연구는 파라미터 수만 키우는 대신 저장 용량, 활성 연산, 반복 깊이, 추론 시 예산을 함께 배분하는 새로운 확장 전략을 제시합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
코드를 보여주지 않아도 모델 간 코딩 능력 전이가 가능할까
대규모 언어 모델
cctest.ai
대규모 언어 모델

코드를 보여주지 않아도 모델 간 코딩 능력 전이가 가능할까

베이징대학교 연구진은 후속 학습을 거친 모델이 무관한 프롬프트에 내놓는 단어 하나만으로도 다른 모델에 능력의 일부를 전달할 수 있음을 보였다. 연구진은 이 미세한 변화에 ‘행동의 그림자’라는 이름을 붙였다.

더 보기
CCTest · Blog
정답을 모방하는 대신 잘못된 추론을 피하며 LLM을 학습시키다
대규모 언어 모델
cctest.ai
대규모 언어 모델

정답을 모방하는 대신 잘못된 추론을 피하며 LLM을 학습시키다

Negative Self-Distillation은 특권 정보가 반영된 정답 추론을 그대로 모방시키지 않고, 모델이 스스로 만든 결함 있는 추론에서 멀어지도록 학습하는 방법입니다. 외부 라벨 없이 탐색과 자기수정을 보존하는 것이 목표입니다.

더 보기
CCTest · Blog
NCP-ArchPreview, 다음 토큰에서 다음 개념 예측으로 나아가는 언어 모델
대규모 언어 모델
cctest.ai
대규모 언어 모델

NCP-ArchPreview, 다음 토큰에서 다음 개념 예측으로 나아가는 언어 모델

NCP-ArchPreview는 기존의 다음 토큰 예측에 여러 토큰을 아우르는 이산적 다음 개념 예측을 추가한다. 자동회귀 생성을 유지하면서 더 높은 수준의 의미 구조를 잠재 공간에서 학습하려는 접근이다.

더 보기