아티클 목록으로
모델 평가

에이전트는 왜 느려지는가: Elo-per-token으로 본 테스트 시점 전략

약 3분 소요

들어가며

대규모 언어 모델이 한 번 답하는 시스템을 넘어, 답을 반복해서 수정하고 도구를 호출하며 여러 경로를 탐색하고 중단 시점까지 판단하는 에이전트가 되면서 테스트 시점 계산을 평가하는 일이 어려워졌다. 최종 점수만 보면 중간 과정에서 얼마나 효율적으로 개선했는지, 추가 토큰이 실제로 어떤 가치를 만들었는지 알기 어렵다.

Hugging Face Daily Papers에 소개된 이번 연구는 이 문제를 Elo-per-token 분석으로 다룬다. 긴 실행 궤적을 따라가며 에이전트가 초기에 얻은 이점을 언제 잃고 성능 향상이 둔화되는지 측정하는 것이 핵심이다.

중간 성과를 Elo 곡선으로 바꾸기

연구진은 중간 제출물에 연속적인 점수가 제공되는 개방형 과제를 대상으로 삼았다. 각 토큰 예산 지점에서 그때까지 발견한 최선의 해답을 기록한다. 따라서 답변 수정, 도구 사용, 대안 탐색에서 발생한 개선을 최종 결과 하나가 아니라 과정 전체에서 관찰할 수 있다.

과제마다 원래 점수의 척도가 다르기 때문에 단순 비교는 어렵다. 연구진은 Bradley-Terry 모델을 사용해 과제 내부의 해답 순서를 통합하고, 서로 다른 과제 사이에서도 비교할 수 있는 Elo 평점을 만들었다. 결과는 단일 성공률이 아니라 계산 예산에 따른 Elo 곡선이다.

주요 관찰은 다음과 같다.

  • 독립 샘플링은 이론적으로 성격을 규정할 수 있는 기준이며, Elo는 계산량의 로그에 대해 대체로 선형적으로 증가한다.
  • 에이전트는 초기에는 독립 샘플링보다 토큰을 Elo로 더 효율적으로 전환한다.
  • 세션 예산이 커질수록 한계 이득은 줄어들고, 결국 독립 샘플링 기준선보다 낮아질 수 있다.
  • 에이전트의 한계 Elo 증가량이 독립 샘플링과 같아지는 예산을 연구진은 스케일링 변곡점으로 정의한다.

실험 범위와 인간 참가자 비교

이 분석은 4개의 범용 에이전트와 4개의 개방형 벤치마크에 적용됐으며, 세션은 최대 1억 토큰까지 확장됐다. 또한 피드백을 사용하는 3개의 LLM 최적화 하니스를 통제된 단일 과제 개입 환경에서 조사했다. 범용 에이전트와 비교적 통제하기 쉬운 최적화 시스템을 함께 다룬 점이 특징이다.

연구진은 공통 AtCoder Heuristic Contest 과제에서 뛰어난 과거 인간 참가자와도 비교했다. 인간 참가자들은 대회 시간이 늘어날수록 초선형적인 개선을 이어갔다. 이는 인간이 피드백을 통해 학습하고 전략 자체를 바꿀 수 있음을 보여주며, 에이전트의 초기 성장 둔화가 문제의 본질적인 상한은 아닐 수 있음을 시사한다.

의미와 영향

이 연구의 중요한 점은 테스트 시점 스케일링을 “모델에 더 많은 토큰을 제공하는 일”에서 “추가 계산이 얼마나 효율적인가”라는 문제로 바꿔 바라본 데 있다. 앞으로는 최종 성공률뿐 아니라 토큰 하나가 만드는 추가 개선량과 현재 탐색 전략이 언제 효율을 잃는지도 평가해야 한다.

개발자에게 변곡점은 중단 시점, 전략 전환, 병렬 샘플링, 피드백 기반 최적화를 결정하는 기준이 될 수 있다. 에이전트가 느려질 때 단순히 예산을 더 늘리는 것만으로는 충분하지 않을 수 있다. 지속적인 학습, 피드백 활용, 탐색 정책 재구성이 다음 개선 과제가 될 가능성이 크다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
ProgramDistill, 실행 가능한 앱으로 코딩 에이전트를 평가하다
모델 평가
cctest.ai
모델 평가

ProgramDistill, 실행 가능한 앱으로 코딩 에이전트를 평가하다

Microsoft Research가 완전히 작동하는 참조 애플리케이션을 직접 탐색하고, 그 동작을 불완전한 코드베이스에서 재현할 수 있는지 평가하는 ProgramDistill을 공개했습니다. 재생 가능하고 검증 가능한 동작을 기반으로 기존 이슈 중심 평가의 빈틈을 다룹니다.

더 보기
CCTest · Blog
문제를 풀어도 이해한 것은 아니다: 추론 모델의 체계성 부족
모델 평가
cctest.ai
모델 평가

문제를 풀어도 이해한 것은 아니다: 추론 모델의 체계성 부족

새 연구는 추론 모델이 학습한 규칙을 구조적으로 동등한 과제로 옮겨 적용할 수 있는지 পরীক্ষা했다. 모델은 원래 과제를 해결하고도 요소를 재조합하거나 기호를 바꾼 변형 과제에서 자주 실패했다.

더 보기