Agentic RAG評価予算はどう配分すべきか:質問数を優先
評価予算が問題になる理由
Agentic RAGの評価は、各質問を一度実行して平均スコアを計算するだけではありません。同じ質問に複数の検索軌跡を試すことも、1本の軌跡から回答を何度も生成することもできます。また、限られた計算資源を使って、より多くの質問を対象にする選択肢もあります。これらはすべてモデルのトークンやツール呼び出しを消費しますが、評価の精度と再現性への影響は同じではありません。
本研究は、HotpotQAとMuSiQueを対象にした検索・フィードバック比較を通じて、この配分問題を調べました。単なる精度の報告ではなく、予算配分の精密さ、読み出しの効率、費用の境界に注目している点が特徴です。
主な結果
- 固定予算では質問範囲の拡大が有力です。 約3414万〜3439万のモデル・トークンを使った条件では、5回の反復読み出しと比べ、より多くの質問を対象にした場合の標準誤差が33%低下しました。3本の検索軌跡と比べても12.6%低くなっています。システム全体の平均的な性能を推定したい場合、少数の質問を深く反復するより、対象数を増やす方が有効になりやすいことを示します。
- 配分は早い段階で予測できます。 保存済みのネスト型予測と、質問情報だけを使う予測は、最終的な配分をそれぞれ4.0%以内、3.5%以内の誤差で予測しました。ただし、深さ別の分析では、2本の軌跡による監査を超えて予測を深くしても、明確な利点は確認されませんでした。
- 1回の読み出しが常に不利とは限りません。 同じトークン予算で、1回読み出しを適合モデルの最適案と比較した分散ペナルティは0〜9.9%でした。ただし、Pro条件には大きな不確実性があるため、反復読み出しに価値がないと一般化することはできません。
- 費用面の結論は価格に依存します。 記録されたモデル料金の下では、検索価格が1000リクエスト当たり0〜1ドルの範囲なら、検索軌跡を増やすより質問数を増やす方が有利でした。一方、質問数と読み出し回数のどちらが費用対効果に優れるかは、まだ決着していません。
- 温度0は不一致を抑えます。 温度を0にすると回答の不一致率は14.3%から3.4%へ低下しましたが、比較精度はほぼ変わりませんでした。決定的なデコードは再現性を高めても、比較の識別力まで自動的に高めるわけではありません。
実務への示唆と限界
評価の目的がシステム全体の平均性能を安定して推定することなら、まず質問のカバレッジを広げるのが現実的な出発点です。検索方策そのものの安定性を調べる場合は複数軌跡、回答の揺らぎを中心に監査する場合は反復読み出しが意味を持つ可能性があります。つまり、最適な配分は総トークン数だけでなく、評価したい対象によって決まります。
ただし、この結論は2つのベンチマーク、特定の検索・フィードバック比較、記録された料金条件に基づく経験的な結果です。質問数と読み出しの費用順位や、Pro条件の分散推定には不確実性が残っています。実運用では、タスクの難しさ、モデル価格、デコードのランダム性、評価の目的を組み合わせて予算を設計する必要があります。
コメント
ログイン状態を確認中…
コメントを読み込み中…