UNREAL:単一モデルで検索と長文脈の証拠選択を統合
概要
検索拡張生成(RAG)と長文脈推論は、これまで別々の技術として扱われることが多くありました。RAGは外部コーパスから関連文書を検索し、長文脈モデルは大量のテキストをそのままプロンプトに入れます。しかし、両者の中心課題は共通しています。大量の情報の中から、回答に必要な証拠を選ぶことです。論文「UNREAL: Unifying Retrieval and Long-Context with a Single Model」は、この選択を単一のモデル内部機構で実現できるかを検討しています。
手法の特徴
UNREALは、凍結した大規模言語モデルの内部表現を利用してテキストチャンクを符号化し、検索クエリも同じ表現から導出します。追加される学習可能パラメータは50万未満で、バックボーンは変更しません。大規模な外部検索モデルを新たに用意するのではなく、言語モデル自身の表現を証拠選択に利用する点が特徴です。
この選択機構は、二つの場面で使えます。コーパス全体から関連チャンクを取り出す検索と、長いプロンプトから無関係な情報を除去してから生成する処理です。つまりUNREALは、文書検索と長文脈の圧縮を異なる処理ではなく、異なる規模で行う同一の証拠選択問題として捉えます。
実験結果
評価には、約30億トークン、2100万チャンクから成るWikipediaインデックスが使われました。論文によれば、密な構成とハイブリッド構成を含む4種類のUNREALバックボーンが、既存の検索器と再ランキングモデルの組み合わせを上回りました。最良モデルの再現率は、HotpotQAで49.1%から73.2%、2WikiMultiHopQAで31.7%から60.1%、MuSiQueで8.8%から14.4%に上昇しています。
同じ検索訓練済みモジュールを長文脈タスクにも適用しました。最大128KトークンのNoLiMaでは、正解率が1.0%から24.83%に改善しました。256KトークンのLV-Evalでは、F1スコアが49.97%から54.66%になっています。全文脈を処理する方式と比べ、約32Kトークン以降ではFLOPsと初回トークンまでの時間も削減され、文脈が長くなるほど差が広がると報告されています。
意義と今後の課題
UNREALが示す重要な視点は、コンテキストを無条件に拡大するのではなく、言語モデル自身に高価値の情報を選ばせることです。手法が広く再現できれば、コーパス検索用のRAGと長いプロンプトの前処理に、共通の選択モジュールを利用できる可能性があります。
一方、今回の素材だけでは、専門分野の文書、頻繁に更新される知識ベース、実運用インデックスでの挙動までは判断できません。多段推論では、一見不要に見える情報が重要な場合もあり、選択による見落としも検証が必要です。今後は再現率の維持、失敗事例、インデックス作成コストが重要な評価軸になるでしょう。それでも、検索と長文脈推論をモデル内部の証拠選択で結び付ける試みとして、UNREALは明確な方向性を示しています。
コメント
ログイン状態を確認中…
コメントを読み込み中…