CANOPY、多模合RAGの証拠を質問に応じて適応的に圧縮
マルチモーダルRAGの説明では、関連するテキスト、表、画像、動画を検索し、それを生成モデルに渡すという流れがよく示される。しかし実運用では、検索後にもう一つの判断が必要になる。文書や動画をそのまま入力すれば無関係な情報が増え、固定長の細かいチャンクに分割しすぎれば、証拠を解釈するための周辺文脈が失われる。CANOPYは、この「各検索結果をどこまで残すか」という問題に取り組む。
仕組みの要点
- 検索結果を階層化する。 検索された項目を、元の領域に基づく階層として表現する。テキストなら文書、段落、文といった粒度を考えられ、異なるモダリティでも自然な領域と階層を利用できる。これにより、すべてを同じサイズで切り出す必要がなくなる。
- 証拠に基づいてノードを採点する。 正解証拠を使って微調整したノードエンコーダーが、質問に対する各領域の関連度を評価する。項目全体が関連しているかだけでなく、回答を支える部分を見つけることが目的だ。
- 親ノードを基準に細分化する。 子ノードを単独で判定するのではなく、親との相対的なスコア差を使う。広い親領域を文脈として残しつつ、特に有用な子領域だけを細かい粒度で保持できる。同じ項目の中に、異なる粒度の領域が併存する構成になる。ノードごとの削除に大規模言語モデルを呼び出す必要はない。
- 不足時には追加検索する。 圧縮処理は、最初から検索されなかった証拠を復元できない。そこでCANOPYはcriticを用いて、現在の証拠が十分かを確認する。不足していると判断すれば、欠けている情報を狙った追加検索を行い、新たな結果も圧縮してから読者入力に加える。
論文では、3300万件の異種項目からなるコーパス上で、5つのQAベンチマークを使って評価した。CANOPYは、比較された検索ベースラインより高い平均回答精度を示した。また、Qwen3-VL-8B-Instructを読者モデルとするルーティングなしの設定では、同じ反復処理と比べて、読者に入力する証拠トークンを14.2〜27.7%削減した。報告では回答品質も同程度に保たれている。アブレーションからは、マルチホップQAでの精度向上は圧縮そのものだけでなく、追加のターゲット検索に大きく依存することが示されている。
意義と残る課題
CANOPYの重要性は、検索とコンテキスト管理を一つの流れとして扱う点にある。検索は候補となる証拠の範囲を広げ、階層圧縮は各項目から読者に渡す量を調整し、criticは初回検索で証拠が揃わない場合を補う。テキスト、表、動画ごとに完全に別の圧縮器を設計するより、異種データに共通する処理手順に近い。
一方で、結果は初期検索の品質と階層構造の表現力に左右される。追加検索は多段推論の証拠不足を補える可能性がある反面、計算量や遅延を増やす。したがってCANOPYは、トークン数を無条件に減らす手法ではなく、証拠の完全性、入力コンテキストの大きさ、検索コストを動的に調整する枠組みとして捉えるのが適切だ。
コメント
ログイン状態を確認中…
コメントを読み込み中…