아티클 목록으로
RAG·검색

UNREAL, 하나의 모델로 검색과 장문맥 증거 선택을 통합하다

약 3분 소요

들어가며

검색 증강 생성(RAG)과 장문맥 추론은 보통 서로 다른 시스템으로 설계됩니다. RAG는 외부 코퍼스에서 관련 문서를 찾아 프롬프트에 넣고, 장문맥 모델은 가능한 많은 자료를 한 번에 입력합니다. 하지만 두 접근법이 풀어야 하는 핵심 문제는 같습니다. 많은 정보 가운데 답변에 필요한 증거를 선별하는 일입니다. 논문 ‘UNREAL: Unifying Retrieval and Long-Context with a Single Model’은 이 선별 작업을 하나의 모델 내부 메커니즘으로 통합할 수 있는지 살펴봅니다.

UNREAL의 접근법

UNREAL은 동결된 대규모 언어 모델의 내부 표현을 이용해 텍스트 청크를 인코딩하고, 검색 질의도 같은 표현에서 생성합니다. 학습 가능한 추가 파라미터는 50만 개 미만이며, 기반 모델은 변경하지 않습니다. 별도의 대형 검색 모델을 새로 훈련하기보다, 언어 모델 자체가 가진 표현을 증거 선택에 활용하는 설계입니다.

이 선택기는 두 가지 상황에 적용됩니다. 먼저 전체 코퍼스에서 관련 청크를 고르는 검색 단계가 있습니다. 또 하나는 하나의 긴 프롬프트 안에서 방해 정보를 제거한 뒤 생성 모델에 전달하는 단계입니다. 따라서 UNREAL은 문서 검색과 장문맥 정리를 서로 다른 문제라기보다, 규모만 다른 동일한 증거 선택 문제로 바라봅니다.

보고된 성능

실험에는 약 30억 토큰과 2,100만 개 청크로 구성된 Wikipedia 인덱스가 사용됐습니다. 논문에 따르면 밀집형과 하이브리드형을 포함한 네 가지 UNREAL 백본이 기존의 검색기-재순위화 시스템을 모두 앞섰습니다. 최상의 모델은 HotpotQA 재현율을 49.1%에서 73.2%로, 2WikiMultiHopQA를 31.7%에서 60.1%로, MuSiQue를 8.8%에서 14.4%로 높였습니다.

검색 학습에 사용한 동일한 모듈은 장문맥 작업에도 적용됐습니다. 최대 128K 토큰을 사용하는 NoLiMa에서 정확도는 1.0%에서 24.83%로 상승했습니다. 256K 토큰 조건의 LV-Eval에서는 F1 점수가 49.97%에서 54.66%로 개선됐습니다. 전체 문맥을 그대로 처리하는 방식과 비교하면 약 32K 토큰부터 FLOPs와 첫 토큰까지의 시간도 줄었고, 문맥이 길어질수록 이점이 커진다고 보고됐습니다.

의미와 남은 과제

UNREAL의 핵심 의미는 더 큰 컨텍스트 창에 더 많은 텍스트를 무조건 채우는 대신, 언어 모델이 먼저 가치 있는 정보를 고르게 하자는 데 있습니다. 이 접근법이 다양한 모델과 데이터에서 재현된다면, 코퍼스 규모 RAG와 장문 프롬프트 추론에 동일한 선택 모듈을 사용할 수 있습니다.

다만 현재 제공된 자료만으로는 전문 분야 문서, 지속적으로 갱신되는 지식베이스, 실제 서비스용 인덱스에서의 성능까지 판단하기 어렵습니다. 다단계 질문에서는 겉보기에는 관련 없어 보이는 정보가 핵심 단서일 수 있으므로, 선택 과정의 누락도 주의해야 합니다. 앞으로는 재현율 유지, 실패 사례 분석, 인덱스 구축 비용이 중요한 검증 항목이 될 것입니다. 그럼에도 UNREAL은 검색과 장문맥 추론을 모델 내부의 증거 선택으로 연결하려는 구체적인 방향을 제시합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
ScholarCatalyst: AI는 새 연구를 촉발할 논문을 찾을 수 있을까
RAG·검색
cctest.ai
RAG·검색

ScholarCatalyst: AI는 새 연구를 촉발할 논문을 찾을 수 있을까

ScholarCatalyst는 단순히 주제가 비슷한 논문이 아니라, 특정 연구 프로젝트를 실제로 발전시킬 수 있는 논문을 검색하는 능력을 평가합니다. 저자들의 판단을 기반으로 한 실험에서 현재의 AI 에이전트는 전문가 수준에 미치지 못했습니다.

더 보기