아티클 목록으로
추론·배포

기업의 다양한 요청을 하나의 셀프 호스팅 LLM으로 통합하는 법

약 4분 소요

들어가며

기업의 대규모 언어 모델 운영은 모델 선택만으로 끝나지 않는다. 데이터 레지던시 제약 때문에 자체 인프라에서 모델을 실행해야 하는데, 새로운 모델이 나와도 호환성과 위험 관리 문제로 이전 모델을 즉시 폐기하기는 어렵다. 이렇게 모델과 서비스가 늘어나면 제한된 GPU 풀이 여러 인스턴스로 쪼개진다. 이번 사례는 이 문제를 모델 통합으로 풀려는 시도다. 200개가 넘는 내부 애플리케이션의 요청을 하나의 셀프 호스팅 모델에 집중하고, 실제 운영에서 발견한 오류를 후학습의 출발점으로 삼았다.

핵심 설계

  • 운영 오류에서 목표를 뽑는다. 팀은 지시 따르기, 함수 호출, 내부 업무 분포를 세 가지 주요 품질 격차로 정리했다. 오프라인 평가도 실제 트래픽의 구성에 맞춰 층화했다.
  • 목표별 전문가를 따로 학습한다. 모든 목표를 하나의 공동 보상으로 최적화하면 영역 간 보상 간섭이 발생할 수 있다. 이에 따라 세 축마다 GRPO 전문가를 별도로 훈련했다.
  • 실패 방식도 영역별로 구분한다. 지시 따르기에서는 의미 붕괴, 함수 호출에서는 불필요한 과잉 호출, 내부 업무에서는 장황한 출력으로 점수를 높이려는 현상이 나타났다. 따라서 모든 문제에 같은 보상 수정법을 적용하지 않았다.
  • SLERP로 하나의 모델을 만든다. 여러 전문가를 별도 서비스로 유지하는 대신 2단계 SLERP로 파라미터를 결합해 혼합된 기업 요청을 처리하는 모델을 구성했다.
  • 평가 도구를 나눠 쓴다. 정답 여부를 명확히 확인할 수 있는 작업은 결정론적 검증기로 채점하고, 자동 판정이 어려운 작업은 보정된 LLM 심사자를 활용한다.

결과와 의미

비추론 모드에서 통합 모델은 내부 Arena에서 69.6점을 기록해 총 파라미터 수가 약 7배인 기준 모델의 65.8점을 넘었다. 지시 따르기 점수는 0.85 대 0.83, 함수 호출 점수는 0.79 대 0.77이었다. 자료는 일반 대화 벤치마크도 개선됐다고 설명한다. 실제 배포에서는 플랫폼 트래픽의 50%, 월 1억 1,600만 건의 요청을 처리한다.

이 결과를 작은 모델이 항상 큰 모델보다 우수하다는 뜻으로 해석해서는 안 된다. 핵심은 기업의 실제 요청 분포에 맞춰 후학습한 모델이 동일한 서빙 자원에서 더 높은 실용성을 제공할 수 있다는 점이다. 모델을 통합하면 라우팅, 모니터링, 배포, 용량 계획을 단순화할 수 있고, 여러 전문 모델과 구형 모델을 유지하면서 발생하는 GPU 파편화도 줄일 수 있다. 품질 향상이 단순한 벤치마크 점수가 아니라 처리 가능한 운영 트래픽 비율로 연결된다는 점도 중요하다.

남은 과제

기업 트래픽은 고정된 데이터셋이 아니다. 새 도구와 프롬프트가 추가되고 새로운 실패 유형이 생기면, 정적인 평가셋은 현실을 빠르게 반영하지 못할 수 있다. 따라서 특정 시점의 커버리지뿐 아니라 평가와 재학습이 트래픽 변화보다 얼마나 빠르게 갱신되는지 측정해야 한다.

LLM 심사자 역시 주의해서 사용해야 한다. 최적화 데이터와 평가 데이터가 지나치게 비슷하면 모델이 실제 사용자에게 유용해지는 대신 심사자의 선호를 모방할 위험이 있다. 어려운 사례에서 사람 평가와 얼마나 일치하는지, 새로 유입되는 요청에서도 성능이 유지되는지, 시간에 따른 커버리지가 어떻게 변하는지를 함께 확인해야 한다.

이 사례가 제시하는 메시지는 분명하다. 후학습은 일회성 모델 업그레이드가 아니라, 운영 오류를 수집하고 목표별로 개선한 뒤 하나의 서비스 모델로 통합하는 지속적인 유지보수 과정이 될 수 있다.

출처:Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
CRISP, 구조 인식 라우팅으로 장문맥 희소 프리필 개선
추론·배포
cctest.ai
추론·배포

CRISP, 구조 인식 라우팅으로 장문맥 희소 프리필 개선

CRISP는 입력에 따라 달라지는 희소 어텐션을 위해 프록시 어텐션 맵에서 구조를 직접 읽는 지표와 sink를 고려한 임계값을 제안합니다. 이를 통해 동적 라우팅 비용과 긴 문맥에서 누적되는 배경 노이즈를 함께 줄이는 것이 목표입니다.

더 보기