아티클 목록으로
RAG·검색

RAGU: 7B 모델로 GraphRAG 파이프라인을 다시 설계하다

약 3분 소요

도입

GraphRAG는 문서를 지식 그래프로 바꾼 뒤, 엔티티와 관계를 기반으로 검색해 LLM에 더 구조화된 근거를 제공하는 접근이다. 하지만 실제 시스템에서는 문제가 자주 발생한다. 한 번의 LLM 호출로 그래프를 추출하면 중복 엔티티와 불안정한 관계가 생기기 쉽고, 이를 보완하기 위해 32B 또는 72B급 모델을 쓰면 비용이 커진다. RAGU는 이 지점에서 다른 해법을 제시한다. 더 큰 모델을 쓰기보다, 추출과 그래프 정제를 나누고 작은 전용 모델을 활용하자는 것이다.

핵심 내용

  • 추출과 통합의 분리: RAGU는 지식 그래프 생성을 단일 단계로 처리하지 않는다. 두 단계의 타입 기반 엔티티·관계 추출, DBSCAN 기반 중복 제거, LLM 요약, Leiden 커뮤니티 탐지를 순차적으로 적용한다. 목표는 검색 단계에서 더 신뢰할 수 있는 깨끗한 그래프를 만드는 것이다.
  • 추출기에 필요한 능력 재정의: 저자들은 GraphRAG 파이프라인의 추출기가 방대한 세계 지식을 암기할 필요는 크지 않다고 본다. 필요한 것은 주어진 문맥을 이해하고, 관계를 뽑아내며, 국소적 맥락 안에서 추론하는 언어 능력이다. 0.5B부터 72B까지의 모델 실험에서 언어 능력은 모델 크기에 따라 완만하게 증가한 반면, 세계 지식은 훨씬 더 크게 증가했다고 설명한다.
  • Meno-Lite-0.1의 역할: Meno-Lite-0.1은 RAG 지향 언어 작업에 맞춰 미세조정된 7B 모델이다. 자료에 따르면 이 모델은 지식 그래프 구축에서 Qwen2.5-32B보다 상대 조화평균 기준 12.5% 높은 성능을 냈고, 영어 기반 엔드투엔드 GraphRAG 작업에서는 비슷한 수준을 보였다.
  • 의료 벤치마크 성과: GraphRAG-Bench Medical에서 RAGU는 모든 사실형 질문 레벨에서 가장 완전한 문맥을 검색했다고 보고됐다. 증거 재현율은 최대 0.84였고, 경쟁 시스템은 0.76 이하로 제시됐다. 합성 작업에서도 HippoRAG2를 앞섰으며, 다중 홉 사실형 QA에서의 격차는 답변 형식의 영향이 크다고 분석했다.
  • 실제 사용을 고려한 패키징: RAGU는 pip install graph_ragu로 설치할 수 있고 단일 GPU에서 실행 가능하다고 설명된다. NetworkX 또는 Neo4j, NanoVDB 또는 Qdrant 같은 교체 가능한 백엔드도 지원한다. 코드는 MIT 라이선스, 모델 가중치는 Apache-2.0으로 공개됐다.

의미와 영향

RAGU가 흥미로운 이유는 단순한 점수 향상이 아니라 GraphRAG의 비용 구조를 다시 보게 한다는 점이다. 지금까지는 더 큰 LLM이 더 좋은 그래프를 만든다는 가정이 강했지만, RAGU는 추출기의 역할이 주어진 텍스트를 구조화하는 데 있다면 전용 소형 모델도 충분히 경쟁력 있을 수 있음을 보여준다.

또한 GraphRAG의 품질은 추출 모델만으로 결정되지 않는다. 엔티티 병합, 요약, 커뮤니티 탐지, 저장소 추상화 같은 후처리 과정이 검색 품질과 근거 회수율을 크게 좌우한다. 기업 문서 검색, 의료 지식베이스, 전문 분야 QA에서는 답변 문장의 유창함보다 올바른 근거를 빠짐없이 찾는 능력이 더 중요할 수 있다.

다만 이번 결과는 저자들이 보고한 벤치마크에 기반하므로, 다른 도메인과 언어, 실제 운영 데이터에서 추가 검증이 필요하다. 그럼에도 RAGU는 비싼 API 기반 추출이나 거대한 로컬 모델 없이 GraphRAG를 구축하려는 팀에게 실용적인 오픈소스 선택지로 볼 만하다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
GRASP: Agentic RAG가 검색의 깊이를 스스로 조절하게 하다
RAG·검색
cctest.ai
RAG·검색

GRASP: Agentic RAG가 검색의 깊이를 스스로 조절하게 하다

GRASP는 Agentic RAG에서 언제 검색하고, 어떤 검색 방식을 쓰며, 어느 정도의 문맥까지 읽을지를 학습하는 강화학습 프레임워크다. 의미 검색, 키워드 검색, 문단 읽기를 조합해 다단계 추론에서 더 나은 증거 회수와 답변 품질을 목표로 한다.

더 보기