파레토 최적화에서 사용자 선호로: PersonTTS의 개인화 테스트 타임 스케일링
테스트 타임 스케일링(Test-Time Scaling, TTS)은 대규모 언어 모델이 답을 생성하는 순간에 추가 계산을 투입해 추론 성능을 높이는 방법이다. 여러 후보 답안을 만들고 비교하거나, 검증과 검색 단계를 추가하거나, 일정한 종료 조건에 도달할 때까지 추론을 이어가는 방식이 대표적이다. 더 많은 계산은 정확도를 높일 수 있지만, 동시에 응답 지연과 추론 비용도 증가시킨다.
실제 사용자는 정확도만을 최적화하지 않는다. 어떤 사용자는 더 오래 기다리더라도 높은 정답률을 원할 수 있고, 다른 사용자는 빠른 응답을 우선할 수 있다. 또 다른 사용자는 제한된 추론 예산 안에서만 서비스를 이용해야 한다. 따라서 정확도와 비용, 정확도와 지연시간 중 하나만을 기준으로 만든 최적 전략이 모든 사용자에게 적합하다고 보기는 어렵다.
논문 「From Pareto to Preference」는 이 문제를 개인화 테스트 타임 스케일링으로 정식화한다. 기존 TTS 연구가 정확도-비용 또는 정확도-지연시간과 같은 단일 자원 축의 파레토 전선을 개선하는 데 집중했다면, 이 연구는 사용자의 여러 요구를 동시에 만족시키는 비율을 최대화하는 실행 가능한 제어기를 찾는 데 초점을 맞춘다.
제어기는 테스트 타임 계산을 어떻게 배분할지 결정하는 정책이다. 예를 들어 후보를 몇 개 생성할지, 언제 검증을 수행할지, 추가 탐색을 계속할지, 어느 시점에 중단할지를 정할 수 있다. 핵심은 평균적으로 가장 높은 점수를 내는 제어기를 고르는 것이 아니라, 특정 사용자의 정확도 기준, 지연시간 한도, 비용 제약에 맞는 정책을 발견하는 데 있다.
PersonTTS의 주요 구성은 다음과 같다.
- 공동 요구 충족 평가: 정확도, 지연시간, 추론 비용을 따로 최적화하지 않고 하나의 요구 조합으로 평가한다.
- 요구사항 기반 초기화: 새로운 사용자 프로필에 대해 무작정 처음부터 탐색하지 않고, 요구가 유사한 프로필에서 찾은 제어기를 출발점으로 사용한다.
- 절차적 경험 추출: 이전 정책 탐색 과정에서 재사용 가능한 절차적 지침을 만들어 탐색 에이전트를 돕는다.
- 목표 프로필 재평가: 과거 경험을 활용하더라도 모든 후보는 목표 사용자 프로필에서 평가한다. 따라서 이전 결과를 단순히 복사하지 않는다.
실험은 AIME와 HMMT에서 수행됐으며, 보지 못한 사용자 프로필과 홀드아웃 문제를 포함한다. 논문 초록에 따르면 PersonTTS는 강력한 TTS 기준선보다 높은 공동 요구 충족률을 보였다. 후보 평가 예산이 동일한 조건에서도 사용자 간 경험을 재사용하면 정책 품질이 추가로 향상됐고, 정책 발견 에이전트에 필요한 시간과 비용도 크게 줄어들었다.
이 연구가 주는 의미는 TTS의 목표를 하나의 보편적인 효율 곡선을 개선하는 것에서, 사용자 선호에 맞는 추론 정책을 선택하는 것으로 확장했다는 데 있다. 실제 추론 서비스에서는 요금제, 디바이스 성능, 응답시간 요구에 따라 서로 다른 계산 정책을 배치하는 데 활용될 수 있다. 또한 TTS 평가도 최고 정확도나 단일 비용 지표만 보여주는 데서 벗어나, 여러 조건을 동시에 충족하는 비율을 함께 살펴볼 필요가 있다.
다만 제공된 초록에는 구체적인 수치가 제시되지 않았다. 서로 다른 모델과 작업, 실제 서비스 트래픽에서도 발견된 제어기가 안정적으로 작동하는지, 그리고 사용자 프로필 간 경험 재사용이 언제 효과적이지 않은지는 전체 논문과 후속 연구에서 확인해야 할 부분이다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…