IterSynth、役割分離で深層検索エージェントを再設計
導入
深層検索では、単に検索回数を増やせばよいわけではない。複雑な質問を分解し、何が不足しているかを判断し、次の検索を設計し、複数の情報源を根拠のある回答へまとめる必要がある。従来のReAct型エージェントでは、これらを一つの方策が同時に担うことが多い。さらに検索が長引くと、過去の思考や検索結果が文脈に積み重なり、重要な情報がノイズに埋もれやすくなる。IterSynthは、この二つの問題を役割分担と状態管理の両面から見直した。
PlannerとSynthesizerの交替
IterSynthは、別々のモデルを組み合わせるのではなく、同じパラメータを二つの役割として交互に実行する。
- Planner:現在の要約状態から未解決の情報要求を見つけ、次のサブクエリを作る。
- Synthesizer:新たに得られた証拠を確認し、検索の進展を要約へ取り込む。
ここで要約は、最後に回答を短くするための処理ではない。検索を継続するための永続的な状態として機能する。次のPlannerは、生の全履歴ではなく、限られた作業領域から再構成された状態を読む。そのため文脈の膨張を抑えながら、計画と証拠統合に異なる責務を持たせられる。
RDPOによる役割別の信用割当
新しい実行形式を安定して学習させるため、研究チームはRole-Decoupled Policy Optimization(RDPO)を提案した。最終回答の成否だけでなく、各ターンの評価基準も報酬に加え、PlannerとSynthesizerについて別々にグループ相対のアドバンテージを計算する。これにより、検索クエリが情報収集に役立ったか、要約更新が状態を改善したかを、それぞれの役割に近い信号として学習できる。
結果と意味
GAIA text-only、xBenchの各バージョン、BrowseComp、BrowseComp-ZHなどで、IterSynth-8Bは平均50.7を報告した。これは従来の8B以下のエージェントを4.2ポイント上回る。学習アブレーションでは、SFTの44.1から、結果報酬のみのGRPOで48.9、RDPOで50.7へ向上した。また、学習していないPlannerに置き換えると大きく性能が低下したとされ、役割分離が単なるプロンプト上の見せ方ではないことを示している。
要約を中心とした設計では、検索ラウンドは12回超からおよそ7〜8回となり、文脈上限への到達率は5%未満だった。等価な二モデル構成と比べ、推論時間も約13〜15%短縮されたという。さらにClaude-4.5-OpusやDeepSeek-V3.1では、ReActを上回るゼロショット改善も報告されている。
IterSynthの重要性は、エージェントの記憶を完全な履歴から修正可能な作業要約へ移した点にある。一方、要約が細部を落としたり誤りを引き継いだりする可能性は残るため、今後は証拠の追跡性と要約の忠実度を含めた検証が必要になる。
コメント
ログイン状態を確認中…
コメントを読み込み中…