D-RAC、マルチモーダル変換で企業RAGの文書取り込みを再設計
導入
企業のナレッジベースに入る文書は、きれいなプレーンテキストとは限りません。PDF、DOCX、スライド、表計算ファイル、スキャン文書には、段組み、ページをまたぐ表、ヘッダーやフッター、複雑な見出し階層が含まれます。一般的なテキスト抽出は読み順を崩し、表を平坦化し、見出し構造を失わせることがあります。D-RAC(Document Retrieval-Aware Chunking)は、チャンク分割だけでなく、その前段にある文書取り込みの問題を扱います。
仕組みの要点
D-RACは、Webコンテンツ向けのW-RACを、レンダリング可能な任意の文書形式へ拡張します。処理は大きく3段階です。
- 形式の正規化:入力文書を決定的にPDFへ変換し、ページ画像として扱います。文字だけを抜き出すのではなく、視覚的な配置を残すことが狙いです。
- マルチモーダル変換:1回のマルチモーダルLLM処理で、ページを検索向けMarkdownへ変換します。見出し階層を明示し、装飾的な画像を除き、表の各行を列見出しを含む自己完結した文章にします。
- IDベースのチャンク計画:Markdownをアドレス可能な要素へ決定的に解析し、軽量なLLMは本文を再生成せず、要素IDだけを見てチャンク構成を計画します。
この設計では、「16年または20年」のような選択肢を曖昧な一つの値へ統合しないことも重視されます。数値、条件、列の文脈を保てるかどうかは、検索結果を回答生成に利用するうえで重要です。
何が重要なのか
エージェント型のチャンク分割では、文書全体を再生成する段階に多くの出力トークンが必要になる場合があります。そこではコストだけでなく、元の内容を変えてしまうリスクも生じます。D-RACは、マルチモーダルモデルの処理を文書変換に限定し、その後の分割では元テキストを再生成しません。これにより、コスト、決定性、処理の追跡可能性を保ちやすくする設計です。
提供資料によると、RAG-Multi-Corpusベンチマークのうち、5つの企業分野にまたがる236文書、795ページのPDFを72分で変換・分割し、エラーゼロだったとされています。ただし、手元の資料には検索品質の完全な比較結果がありません。したがって、処理時間や設計だけから、固定長分割や従来型パーサーを上回ると断定することはできません。
上流の変換が新たな焦点になる
D-RACでは、PDF正規化とMarkdown変換の精度が重要なボトルネックになります。ページをまたぐ表、フッター内の見出し、結合セル、低品質スキャンなどは、依然として誤解釈の原因になり得ます。変換段階で構造が壊れれば、後段の検索対応分割は誤った内容を整理するだけになってしまいます。実運用では、低品質パーサーを含むベースライン、跨ページ表、エンドツーエンドの検索指標を評価すべきです。
D-RACの意義は、単に新しい分割規則を追加したことではありません。まずマルチモーダル理解で文書構造を回復し、その後に決定的解析と軽量な計画を適用するという、RAG取り込みの順序を再設計した点にあります。
コメント
ログイン状態を確認中…
コメントを読み込み中…