아티클 목록으로
모델 평가

Agentic RAG 평가 예산, 질문 수 확대가 더 효과적인 이유

약 3분 소요

평가 예산 배분이 중요한 이유

Agentic RAG를 평가할 때는 각 질문을 한 번 실행하고 평균 점수만 계산하면 충분하지 않을 수 있습니다. 같은 질문에 여러 검색 궤적을 시도할 수도 있고, 하나의 궤적에서 답변을 여러 번 생성할 수도 있습니다. 반대로 한정된 모델 토큰과 호출 비용을 더 많은 질문을 처리하는 데 사용할 수도 있습니다. 세 방식은 모두 계산 자원을 소비하지만, 평가의 안정성과 통계적 정밀도에 미치는 영향은 서로 다릅니다.

이번 연구는 HotpotQA와 MuSiQue에서 검색-피드백 비교를 수행하며 이 문제를 분석했습니다. 단순한 성능 점수뿐 아니라 예산 배분의 정밀도, 읽기 효율, 비용 경계를 함께 살펴본 것이 핵심입니다.

주요 결과

  • 고정된 예산에서는 질문 범위를 넓히는 방식이 강력했습니다. 약 3414만~3439만 모델 토큰을 사용하는 조건에서 더 많은 질문을 평가하면 5회 반복 읽기보다 표준오차가 33% 낮았습니다. 3개의 검색 궤적과 비교해도 12.6% 낮았습니다. 시스템의 평균적인 성능을 추정하는 것이 목적이라면 소수 질문을 반복 실행하는 것보다 사례 수를 늘리는 편이 유리할 수 있습니다.
  • 예산 배분은 전체 실험 전에 예측할 수 있었습니다. 보관된 중첩 예측과 질문 정보만 이용한 예측은 최종 배분을 각각 4.0%, 3.5% 이내의 오차로 예측했습니다. 다만 깊이별 분석에서는 두 궤적 감사 이후 예측을 더 깊게 수행해도 뚜렷한 이점이 확인되지 않았습니다.
  • 한 번의 읽기가 항상 큰 손실을 만들지는 않았습니다. 동일한 토큰 예산에서 한 번 읽는 방식의 분산 페널티는 적합된 최적안과 비교해 0~9.9%였습니다. 그러나 Pro 조건에는 상당한 불확실성이 있으므로 반복 읽기가 불필요하다고 일반화해서는 안 됩니다.
  • 비용 우위는 가격 구조에 따라 달라졌습니다. 기록된 모델 요금 기준으로 검색 가격이 요청 1000회당 0~1달러일 때는 검색 궤적을 늘리는 것보다 질문 수를 늘리는 편이 나았습니다. 반면 질문 수 확대와 반복 읽기 중 어느 쪽이 더 비용 효율적인지는 아직 결론이 나지 않았습니다.
  • 온도 0은 답변 불일치를 줄였습니다. 온도를 0으로 설정하자 답변 불일치율은 14.3%에서 3.4%로 감소했습니다. 그러나 비교 정밀도는 비슷하게 유지됐습니다. 결정적 디코딩은 재현성을 높일 수 있지만, 평가가 더 잘 구분된다는 뜻은 아닙니다.

평가 설계에 주는 의미

시스템 전체의 평균 성능을 신뢰성 있게 추정하는 것이 목적이라면 질문 커버리지를 먼저 넓히는 것이 실용적인 기본값입니다. 검색 전략의 안정성을 분석한다면 여러 궤적이 필요할 수 있고, 답변 자체의 변동성을 감사하려면 반복 읽기가 의미를 가질 수 있습니다. 따라서 최적의 배분은 총 토큰 수만이 아니라 평가 목표에 따라 결정해야 합니다.

다만 이 결과는 두 벤치마크, 특정 검색-피드백 비교 방식, 기록된 비용 가정에 기반한 경험적 결론입니다. 질문 수와 반복 읽기의 비용 순위, Pro 조건의 분산 추정에는 여전히 불확실성이 남아 있습니다. 실제 평가에서는 과제 난도, 모델 가격, 디코딩의 무작위성, 배포 목적을 함께 고려해 예산을 설계해야 합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Learn2Play Bench, 낯선 게임에서 LLM 에이전트의 학습 능력을 검증하다
모델 평가
cctest.ai
모델 평가

Learn2Play Bench, 낯선 게임에서 LLM 에이전트의 학습 능력을 검증하다

Learn2Play Bench는 규칙을 미리 알려주지 않는 새로운 텍스트 게임으로 LLM 에이전트가 상호작용 경험에서 학습하는 능력을 평가한다. 연구 결과는 완전한 경험 기록과 에이전트 하네스 설계가 성능에 큰 영향을 줄 수 있음을 보여준다.

더 보기
CCTest · Blog
읽을 수 있는 것만으로는 부족하다: UltraText Bench가 검증한 이미지 생성의 텍스트 정확도
모델 평가
cctest.ai
모델 평가

읽을 수 있는 것만으로는 부족하다: UltraText Bench가 검증한 이미지 생성의 텍스트 정확도

UltraText Bench는 영어와 중국어의 밀집된 시각 텍스트를 대상으로 이미지 생성 모델을 여러 영역과 난이도에서 평가하는 벤치마크입니다. 텍스트의 선명도와 요청한 내용을 정확히 재현하는 능력은 서로 다를 수 있다는 점을 보여줍니다.

더 보기