RouteFM, LLM 라우팅을 ‘한 번 사전학습하고 어디서나 라우팅’하는 방향으로
들어가며
실제 서비스에서 사용하는 대규모 언어 모델은 서로 다른 강점을 가진다. 어떤 모델은 복잡한 추론에 강하고, 다른 모델은 특정 도메인이나 모달리티에 적합하다. 더 작은 모델은 품질이 조금 낮더라도 비용과 지연시간 측면에서 유리할 수 있다. LLM 라우팅은 각 질의를 가장 적절한 모델로 보내 품질과 추론 효율의 균형을 맞추는 기술이다.
문제는 많은 라우터가 특정 작업 부하와 고정된 후보 모델 풀에 맞춰 학습된다는 점이다. 후보가 바뀌거나 도메인이 이동하고, 컨텍스트 예산이나 배포 조건이 달라지면 추가 감독 데이터와 재학습이 필요해질 수 있다. Hugging Face Daily Papers에 소개된 Pretrain Once, Route Anywhere: Towards a Foundation Model for LLM Routing은 이 구조를 바꾸기 위해 RouteFM을 제안한다.
핵심 내용
- 고정된 모델 이름에 의존하지 않는다. RouteFM은 모델 ID를 기억해 선택하는 대신, 후보 모델이 소수의 입력에 어떻게 반응하는지 관찰하고 현재 목표에 필요한 능력을 추정한다.
- 여러 환경에서 라우팅 능력을 사전학습한다. 이질적인 라우팅 환경을 에피소드 단위로 구성해, 특정 데이터셋과 모델 풀의 대응 관계가 아니라 모델 능력을 읽어내는 방법 자체를 학습한다.
- 새 환경에서는 컨텍스트만으로 적응한다. 사전학습이 끝난 라우터는 고정한 채 새로운 후보 모델의 행동 증거를 제공해 판단할 수 있다. 배포 환경마다 별도의 재학습을 수행하는 방식과 다르다.
- 다양한 변화에 대한 전이를 평가했다. 도메인, 모달리티, 후보 모델 풀, 컨텍스트 예산이 바뀌는 조건을 살폈으며, 행동 증거가 제한적일수록 RouteFM의 이점이 크게 나타났다.
- 보지 못한 벤치마크에서도 성능을 보였다. 사전학습에 포함되지 않은 MMR-Bench에서 후보 모델마다 8개의 관측만 사용했을 때, 최강 기준선보다 2.23 품질 포인트 높은 결과를 냈다.
의미와 한계
RouteFM의 핵심은 새로운 라우터 하나를 추가했다는 데 있지 않다. 라우터가 무엇을 일반화해야 하는지에 대한 관점을 바꾼 데 의미가 있다. 기존 방식은 대체로 “이 모델 집합에서 이 유형의 요청을 어떻게 분배할 것인가”를 학습한다. 반면 RouteFM은 적은 행동 샘플에서 후보 모델의 능력 프로필을 만들고, 현재 질의의 목표에 맞춰 모델을 선택하는 절차를 배우려 한다.
이 접근은 기반 모델의 사전학습과 전이 개념에 가깝다. 서비스에서 모델 풀이 자주 교체되더라도 고정된 라우터를 재사용할 가능성이 있으며, 환경별 데이터 수집과 학습 부담을 줄일 여지도 있다. 특히 후보 모델을 익명으로 다룬다는 점은 새 모델이 추가되는 상황과도 잘 맞는다.
다만 제공된 자료만으로는 학습 비용, 라우팅 오버헤드, 환경별 상세 결과를 확인할 수 없다. 대규모 실서비스 트래픽이나 엄격한 지연시간 제약에서 동일한 효과가 유지되는지도 추가 검증이 필요하다. 그럼에도 이 연구는 LLM 라우팅을 반복적인 국소 최적화에서, 한 번 학습해 여러 환경에 적용하는 범용 추론 능력으로 확장할 수 있음을 보여준다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…