RAZOR, 전문가의 대체 가능성으로 MoE를 가지치기하다
들어가며
혼합 전문가(MoE) 모델은 토큰마다 일부 전문가만 활성화해 계산량을 줄입니다. 하지만 실제 배포에서는 전체 전문가 풀을 저장해야 하는 경우가 많아, 모델 규모가 커질수록 메모리 부담이 커집니다. 전문가 가지치기의 핵심은 능력 저하를 최소화하면서 어떤 전문가를 제거할지 결정하는 것입니다.
arXiv 논문에서 제안된 RAZOR는 이 문제를 전문가의 사용 빈도가 아니라 ‘기능적 대체 가능성’의 관점에서 다룹니다.
기능적 대체 가능성 측정
라우팅 횟수, 라우팅 가중치, 출력 크기는 전문가의 역할을 추정하는 신호가 될 수 있습니다. 그러나 이 값만으로 제거 시 손상을 판단하기는 어렵습니다. 자주 선택되는 전문가라도 다른 전문가가 해당 기능을 충분히 보완할 수 있고, 반대로 드물게 선택되는 전문가가 고유한 기능을 담당할 수도 있기 때문입니다.
RAZOR는 ‘합의 잔차(consensus residual)’를 사용합니다. 이는 특정 전문가의 출력이 원래의 가중 혼합 출력에서 얼마나 벗어나는지를 나타냅니다. 다른 전문가들이 만들어내는 계산과의 차이를 관찰함으로써, 해당 전문가의 기능이 얼마나 독자적인지를 평가하는 방식입니다.
논문은 레이어 입력이 고정된 상황에서 단일 전문가를 제거했을 때의 변화를 정확히 나타내는 항등식도 제시합니다. 이 식은 남은 전문가의 가중치 재정규화와, 전문가 제거 후 라우터가 선택하는 보충 전문가를 함께 고려합니다. RAZOR는 보정용 토큰에서 얻은 국소 신호를 모아, 정해진 제거 예산에 맞는 순위를 계산합니다. 그래디언트도 필요하지 않고, 가지치기 후 복구 학습도 요구하지 않습니다.
실험 결과
평가는 GLM-4.7-Flash, Qwen3.6-35B-A3B, DeepSeek-V4-Flash-0731, Hy3에서 수행됐으며, 전문가의 25% 또는 50%를 제거했습니다. 논문에 따르면 8개의 모델·예산 조합 모두에서 RAZOR는 평가된 방법 중 9개 태스크 매크로 평균이 가장 높았습니다.
REAP과 조건을 맞춘 두 백본에서는 RAZOR가 2.12~5.59포인트 높은 결과를 냈고, 36개의 쌍별 태스크 비교를 모두 이겼습니다. GLM-4.7-Flash와 Qwen3.6-35B-A3B의 네 가지 대응 모델·예산 설정에서는 REAP보다 역 KL도 낮았습니다.
의미와 한계
RAZOR의 핵심 기여는 MoE 가지치기의 기준을 바꾼 데 있습니다. 중요한 질문은 단순히 어떤 전문가가 많이 사용되는지가 아니라, 남은 전문가들이 그 기능을 얼마나 잘 덮을 수 있는지입니다. 추가 학습 없이 실행할 수 있어 저장 공간을 줄여야 하는 추론 환경에 활용될 가능성이 있습니다.
다만 벤치마크 성능과 예측 분포가 유지된다고 해서 생성 결과가 완전히 동일해지는 것은 아닙니다. Qwen3.6-35B-A3B 응답 분석에서는 가지치기 후 다양성, 형식, 종료 방식의 변화가 관찰됐습니다. 따라서 향후 평가는 태스크 점수와 분포 지표뿐 아니라 장문 생성, 구조화된 출력, 종료 동작도 함께 살펴봐야 합니다. RAZOR는 가지치기 손상을 줄이는 방법이지, 원본 모델과의 완전한 행동 일치를 보장하는 방법으로 제시된 것은 아닙니다.
출처: arXiv
댓글
로그인 상태 확인 중…
댓글 불러오는 중…