UNREAL, 하나의 모델로 검색과 장문맥 증거 선택을 통합하다
들어가며
검색 증강 생성(RAG)과 장문맥 추론은 보통 서로 다른 시스템으로 설계됩니다. RAG는 외부 코퍼스에서 관련 문서를 찾아 프롬프트에 넣고, 장문맥 모델은 가능한 많은 자료를 한 번에 입력합니다. 하지만 두 접근법이 풀어야 하는 핵심 문제는 같습니다. 많은 정보 가운데 답변에 필요한 증거를 선별하는 일입니다. 논문 ‘UNREAL: Unifying Retrieval and Long-Context with a Single Model’은 이 선별 작업을 하나의 모델 내부 메커니즘으로 통합할 수 있는지 살펴봅니다.
UNREAL의 접근법
UNREAL은 동결된 대규모 언어 모델의 내부 표현을 이용해 텍스트 청크를 인코딩하고, 검색 질의도 같은 표현에서 생성합니다. 학습 가능한 추가 파라미터는 50만 개 미만이며, 기반 모델은 변경하지 않습니다. 별도의 대형 검색 모델을 새로 훈련하기보다, 언어 모델 자체가 가진 표현을 증거 선택에 활용하는 설계입니다.
이 선택기는 두 가지 상황에 적용됩니다. 먼저 전체 코퍼스에서 관련 청크를 고르는 검색 단계가 있습니다. 또 하나는 하나의 긴 프롬프트 안에서 방해 정보를 제거한 뒤 생성 모델에 전달하는 단계입니다. 따라서 UNREAL은 문서 검색과 장문맥 정리를 서로 다른 문제라기보다, 규모만 다른 동일한 증거 선택 문제로 바라봅니다.
보고된 성능
실험에는 약 30억 토큰과 2,100만 개 청크로 구성된 Wikipedia 인덱스가 사용됐습니다. 논문에 따르면 밀집형과 하이브리드형을 포함한 네 가지 UNREAL 백본이 기존의 검색기-재순위화 시스템을 모두 앞섰습니다. 최상의 모델은 HotpotQA 재현율을 49.1%에서 73.2%로, 2WikiMultiHopQA를 31.7%에서 60.1%로, MuSiQue를 8.8%에서 14.4%로 높였습니다.
검색 학습에 사용한 동일한 모듈은 장문맥 작업에도 적용됐습니다. 최대 128K 토큰을 사용하는 NoLiMa에서 정확도는 1.0%에서 24.83%로 상승했습니다. 256K 토큰 조건의 LV-Eval에서는 F1 점수가 49.97%에서 54.66%로 개선됐습니다. 전체 문맥을 그대로 처리하는 방식과 비교하면 약 32K 토큰부터 FLOPs와 첫 토큰까지의 시간도 줄었고, 문맥이 길어질수록 이점이 커진다고 보고됐습니다.
의미와 남은 과제
UNREAL의 핵심 의미는 더 큰 컨텍스트 창에 더 많은 텍스트를 무조건 채우는 대신, 언어 모델이 먼저 가치 있는 정보를 고르게 하자는 데 있습니다. 이 접근법이 다양한 모델과 데이터에서 재현된다면, 코퍼스 규모 RAG와 장문 프롬프트 추론에 동일한 선택 모듈을 사용할 수 있습니다.
다만 현재 제공된 자료만으로는 전문 분야 문서, 지속적으로 갱신되는 지식베이스, 실제 서비스용 인덱스에서의 성능까지 판단하기 어렵습니다. 다단계 질문에서는 겉보기에는 관련 없어 보이는 정보가 핵심 단서일 수 있으므로, 선택 과정의 누락도 주의해야 합니다. 앞으로는 재현율 유지, 실패 사례 분석, 인덱스 구축 비용이 중요한 검증 항목이 될 것입니다. 그럼에도 UNREAL은 검색과 장문맥 추론을 모델 내부의 증거 선택으로 연결하려는 구체적인 방향을 제시합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…