아티클 목록으로
모델 평가

Embedding을 LLM으로 바꿔야 할까? 성능보다 큰 비용 격차

약 3분 소요

들어가며

대규모 언어 모델(LLM)이 문장을 벡터로 표현할 수 있게 되면서, 기존 텍스트 임베딩 파이프라인을 LLM으로 대체해야 하는지에 대한 관심이 커지고 있습니다. LLM은 검색 의도와 문맥을 더 유연하게 해석할 수 있지만, 유연성이 곧 운영 효율을 의미하지는 않습니다. 이번 연구는 모델 성능뿐 아니라 비용과 처리량까지 함께 비교했다는 점에서 실무적인 의미가 있습니다.

다양한 작업을 대상으로 한 비교

연구진은 6개 계열의 LLM 10종과 1억 1,800만에서 140억 개 파라미터 규모의 임베딩 모델 26종을 평가했습니다. 대상 과제는 분류, 의미적 텍스트 유사도(STS), 클러스터링, 쌍 분류, 검색 등 총 37개입니다. 특정 검색 점수만 비교하지 않고, 실제 임베딩 시스템에서 자주 발생하는 여러 작업을 함께 살핀 것입니다.

종합 결과는 LLM의 일방적인 승리가 아니었습니다. 가장 높은 점수를 받은 LLM인 Gemini 3.1 Pro는 77.6점, 최고 임베딩 모델은 77.2점으로 격차가 0.4점에 그쳤습니다. 일반적인 의미 표현 작업에서는 생성형 모델이라는 이유만으로 뚜렷한 우위가 생기지 않는다는 뜻입니다.

다만 작업별 강점은 분명히 갈렸습니다.

  • 추론이 필요한 검색: 질의 의도와 복잡한 관계를 판단해야 할 때 LLM이 앞섰습니다.
  • 분류: 전용 임베딩 모델이 더 강했으며, 반복적이고 대량인 처리에 적합합니다.
  • 클러스터링, STS, 쌍 분류: 두 모델군의 성능은 대체로 비슷했습니다.
  • 비용과 속도: 벤치마크 1회 비용은 LLM이 최대 154달러, 비슷한 수준의 임베딩 모델이 약 0.11달러로 최대 1,431배 차이가 났습니다. 같은 GPU에서 측정한 오픈 LLM의 토큰 처리 속도도 2.5배에서 736배까지 느렸습니다.

추론 토큰이 만드는 비용

LLM 추론 비용에서 reasoning token이 차지하는 비중은 28%에서 81%였습니다. 그런데 추론 예산을 줄인 실험에서는 대부분의 모델에서 검색 품질이 유지됐고, 일부 모델은 오히려 개선됐습니다. 따라서 항상 최대 추론 설정을 사용하는 것보다, 실제 업무가 요구하는 추론 수준을 측정하는 편이 합리적입니다.

품질과 비용을 함께 고려한 Pareto 전선에는 주요 임베딩 모델들과 Gemini 3.1 Pro 한 모델만 포함됐습니다. LLM은 복잡한 검색에서 유용하지만, 모든 벡터화 작업을 대체하는 범용 해법은 아니라는 의미입니다.

RAG 파이프라인에 주는 시사점

가장 현실적인 RAG 구조는 역할 분담입니다. 유사도 계산, 분류, 클러스터링처럼 빠르고 예측 가능한 처리가 필요한 영역에는 임베딩 모델을 사용합니다. 반대로 검색 결과를 질의 의도와 문맥에 따라 해석해야 한다면 LLM을 선택적으로 투입할 수 있습니다.

이 연구는 임베딩 모델의 종말을 말하지 않습니다. 핵심 질문은 어떤 단계에 정말 추론이 필요한가입니다. 파이프라인을 교체하기 전에는 정확도뿐 아니라 지연시간, 처리량, 호출 비용을 함께 측정해야 합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
SWE-bench Science가 드러낸 과학 소프트웨어 코드 수정의 난점
모델 평가
cctest.ai
모델 평가

SWE-bench Science가 드러낸 과학 소프트웨어 코드 수정의 난점

SWE-bench Science는 98개 GitHub 저장소와 20개 과학 분야를 대상으로 과학 소프트웨어 공학을 저장소 수준에서 평가합니다. 공개 테스트를 통과하는 것만으로는 과학적 의미를 보존한 수정이라고 볼 수 없다는 점을 보여줍니다.

더 보기
CCTest · Blog
ASR 모델은 정말 음성을 듣는가: 벤치마크 최적화의 함정
모델 평가
cctest.ai
모델 평가

ASR 모델은 정말 음성을 듣는가: 벤치마크 최적화의 함정

Hume AI의 연구는 자동 음성 인식 모델이 공개 벤치마크의 정답 문구를 재현하는 경향을 측정하는 방법을 제시했다. 일부 고득점 오픈소스 모델은 음성이 모순되거나 가려졌거나 모호한 상황에서도 참조 문장을 그대로 출력했다.

더 보기
CCTest · Blog
학습은 흔적을 남긴다: 잔차 가중치로 언어 모델 계보 검증
모델 평가
cctest.ai
모델 평가

학습은 흔적을 남긴다: 잔차 가중치로 언어 모델 계보 검증

호환 가능한 언어 모델 체크포인트가 가중치만으로 공통 조상을 드러낼 수 있는지를 검증한 연구가 나왔다. 잔차 구조에서 오해를 부를 수 있는 공유 성분을 제거하고 체크포인트 고유 구조를 비교하는 방식이다.

더 보기