아티클 목록으로
추론·배포

파레토 최적화에서 사용자 선호로: PersonTTS의 개인화 테스트 타임 스케일링

약 3분 소요

테스트 타임 스케일링(Test-Time Scaling, TTS)은 대규모 언어 모델이 답을 생성하는 순간에 추가 계산을 투입해 추론 성능을 높이는 방법이다. 여러 후보 답안을 만들고 비교하거나, 검증과 검색 단계를 추가하거나, 일정한 종료 조건에 도달할 때까지 추론을 이어가는 방식이 대표적이다. 더 많은 계산은 정확도를 높일 수 있지만, 동시에 응답 지연과 추론 비용도 증가시킨다.

실제 사용자는 정확도만을 최적화하지 않는다. 어떤 사용자는 더 오래 기다리더라도 높은 정답률을 원할 수 있고, 다른 사용자는 빠른 응답을 우선할 수 있다. 또 다른 사용자는 제한된 추론 예산 안에서만 서비스를 이용해야 한다. 따라서 정확도와 비용, 정확도와 지연시간 중 하나만을 기준으로 만든 최적 전략이 모든 사용자에게 적합하다고 보기는 어렵다.

논문 「From Pareto to Preference」는 이 문제를 개인화 테스트 타임 스케일링으로 정식화한다. 기존 TTS 연구가 정확도-비용 또는 정확도-지연시간과 같은 단일 자원 축의 파레토 전선을 개선하는 데 집중했다면, 이 연구는 사용자의 여러 요구를 동시에 만족시키는 비율을 최대화하는 실행 가능한 제어기를 찾는 데 초점을 맞춘다.

제어기는 테스트 타임 계산을 어떻게 배분할지 결정하는 정책이다. 예를 들어 후보를 몇 개 생성할지, 언제 검증을 수행할지, 추가 탐색을 계속할지, 어느 시점에 중단할지를 정할 수 있다. 핵심은 평균적으로 가장 높은 점수를 내는 제어기를 고르는 것이 아니라, 특정 사용자의 정확도 기준, 지연시간 한도, 비용 제약에 맞는 정책을 발견하는 데 있다.

PersonTTS의 주요 구성은 다음과 같다.

  • 공동 요구 충족 평가: 정확도, 지연시간, 추론 비용을 따로 최적화하지 않고 하나의 요구 조합으로 평가한다.
  • 요구사항 기반 초기화: 새로운 사용자 프로필에 대해 무작정 처음부터 탐색하지 않고, 요구가 유사한 프로필에서 찾은 제어기를 출발점으로 사용한다.
  • 절차적 경험 추출: 이전 정책 탐색 과정에서 재사용 가능한 절차적 지침을 만들어 탐색 에이전트를 돕는다.
  • 목표 프로필 재평가: 과거 경험을 활용하더라도 모든 후보는 목표 사용자 프로필에서 평가한다. 따라서 이전 결과를 단순히 복사하지 않는다.

실험은 AIME와 HMMT에서 수행됐으며, 보지 못한 사용자 프로필과 홀드아웃 문제를 포함한다. 논문 초록에 따르면 PersonTTS는 강력한 TTS 기준선보다 높은 공동 요구 충족률을 보였다. 후보 평가 예산이 동일한 조건에서도 사용자 간 경험을 재사용하면 정책 품질이 추가로 향상됐고, 정책 발견 에이전트에 필요한 시간과 비용도 크게 줄어들었다.

이 연구가 주는 의미는 TTS의 목표를 하나의 보편적인 효율 곡선을 개선하는 것에서, 사용자 선호에 맞는 추론 정책을 선택하는 것으로 확장했다는 데 있다. 실제 추론 서비스에서는 요금제, 디바이스 성능, 응답시간 요구에 따라 서로 다른 계산 정책을 배치하는 데 활용될 수 있다. 또한 TTS 평가도 최고 정확도나 단일 비용 지표만 보여주는 데서 벗어나, 여러 조건을 동시에 충족하는 비율을 함께 살펴볼 필요가 있다.

다만 제공된 초록에는 구체적인 수치가 제시되지 않았다. 서로 다른 모델과 작업, 실제 서비스 트래픽에서도 발견된 제어기가 안정적으로 작동하는지, 그리고 사용자 프로필 간 경험 재사용이 언제 효과적이지 않은지는 전체 논문과 후속 연구에서 확인해야 할 부분이다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
SparseDecoding, 생성 단계에 맞춘 LLM 가지치기 제안
추론·배포
cctest.ai
추론·배포

SparseDecoding, 생성 단계에 맞춘 LLM 가지치기 제안

SparseDecoding은 자연어 기반 보정 데이터와 실제 생성 과정의 활성 분포가 다르다는 문제를 해결하기 위해 제안됐다. 생성 중 수집한 활성값과 N:M 희소 SpMV 커널을 활용해 A100에서 최대 1.48배의 종단 간 디코딩 가속을 보고했다.

더 보기
CCTest · Blog
TokenRouter: 토큰 단위 LLM 라우팅을 위한 효율적 서빙 시스템
추론·배포
cctest.ai
추론·배포

TokenRouter: 토큰 단위 LLM 라우팅을 위한 효율적 서빙 시스템

TokenRouter는 생성 과정에서 토큰마다 다른 모델을 선택하는 LLM 라우팅을 위한 서빙 시스템입니다. 비동기 모델 서브서버와 지연 배칭으로 실행 단계 불일치와 배치 대기 문제를 줄이는 것을 목표로 합니다.

더 보기
CCTest · Blog
SparseEngine, 장문맥 에이전트를 위한 희소 우선 추론 엔진
추론·배포
cctest.ai
추론·배포

SparseEngine, 장문맥 에이전트를 위한 희소 우선 추론 엔진

SparseEngine은 서로 다른 KV 캐시 방식을 장문맥 LLM 에이전트의 서빙 환경에 통합하기 위해 설계된 희소 우선 추론 엔진입니다. 논문은 처리량과 디코딩 속도 향상뿐 아니라 요청 간 캐시 상태를 이어가는 방법도 제시합니다.

더 보기