아티클 목록으로
RAG·검색

D-RAC, 멀티모달 문서 변환으로 기업용 RAG 수집 과정을 재설계하다

약 3분 소요

들어가며

기업 지식베이스에 들어오는 문서는 깔끔한 일반 텍스트가 아니다. PDF, DOCX, 슬라이드, 스프레드시트, 스캔 문서는 다단 편집, 여러 페이지에 걸친 표, 머리말과 꼬리말, 복잡한 제목 계층을 포함하는 경우가 많다. 기존 텍스트 추출기는 읽기 순서를 뒤섞고 표를 평면화하며 제목 구조를 잃어버릴 수 있다. D-RAC(Document Retrieval-Aware Chunking)는 청크 분할만이 아니라, 그 이전 단계인 문서 수집과 구조 복원의 문제를 겨냥한다.

작동 방식

D-RAC는 웹 콘텐츠를 대상으로 한 W-RAC를 렌더링 가능한 기업 문서 전반으로 확장한다. 주요 과정은 세 단계다.

  • 입력 형식 정규화: 모든 입력을 결정적으로 PDF로 변환하고 페이지 이미지로 렌더링한다. 문자만 추출하는 대신 원래의 시각적 배치를 보존하려는 접근이다.
  • 멀티모달 변환: 한 번의 멀티모달 언어모델 처리로 페이지를 검색 최적화 Markdown으로 바꾼다. 제목 계층은 명시적으로 표현하고 장식용 이미지는 제거하며, 표의 각 행은 관련 열 제목을 포함한 독립적인 문장으로 재작성한다.
  • 식별자 기반 계획: Markdown을 주소를 지정할 수 있는 요소로 결정적으로 파싱한 뒤, 경량 언어모델이 전체 본문을 다시 읽고 생성하지 않고 요소 ID만을 기준으로 청크 구성을 계획한다.

이 방식은 “16년 또는 20년”처럼 서로 다른 선택지를 모호한 하나의 표현으로 합치지 않는 것도 강조한다. 숫자, 조건, 열의 문맥을 보존하는 일은 검색 결과가 답변 생성 단계에서 올바르게 사용되는 데 중요하다.

주목할 이유

에이전트형 청크 분할 시스템은 문서 전체를 다시 생성하는 과정에서 많은 출력 토큰을 사용할 수 있다. 이 과정은 비용을 늘릴 뿐 아니라 원문이 바뀌거나 환각이 섞일 위험도 만든다. D-RAC는 멀티모달 모델의 개입을 문서 변환 단계로 제한하고, 이후 청크 분할에서는 원문을 재생성하지 않는다. 따라서 비용, 결정성, 처리 과정의 추적 가능성을 관리하기 쉬운 구조를 지향한다.

제공된 초록에 따르면 RAG-Multi-Corpus 벤치마크의 일부인 5개 기업 분야, 236개 문서와 795개 PDF 페이지를 72분 동안 변환하고 분할했으며 오류는 보고되지 않았다. 그러나 현재 자료에는 완전한 검색 품질 비교 수치가 없다. 따라서 처리 시간과 설계만으로 고정 길이 분할이나 기존 파서를 능가한다고 결론 내리기는 어렵다.

실패 지점은 상류로 이동한다

D-RAC에서는 PDF 정규화와 Markdown 변환의 정확도가 핵심 의존성이 된다. 여러 페이지를 가로지르는 표, 푸터에 들어간 제목, 병합 셀, 품질이 낮은 스캔 문서는 여전히 오해석을 유발할 수 있다. 변환 단계에서 구조가 손상되면, 검색 인식형 분할은 잘못된 콘텐츠를 더 정교하게 정리하는 데 그칠 수 있다. 실제 도입에서는 성능이 낮은 파서를 포함한 기준선, 페이지 간 표 사례, 전체 검색 지표를 함께 평가해야 한다.

D-RAC의 의미는 새로운 분할 규칙 하나를 추가한 데 있지 않다. 먼저 멀티모달 이해로 문서 구조를 복원한 뒤 결정적 파싱과 경량 계획을 적용하는 방식으로 RAG 수집 순서를 재설계했다는 점이 핵심이다. 이 변환 계층이 복잡한 레이아웃에서도 안정적으로 작동한다면, 이기종 기업 문서를 공통 검색 파이프라인에 넣는 실용적인 경로가 될 수 있다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물