記事一覧へ戻る
AIエージェント

IterSynth、役割分離で深層検索エージェントを再設計

読了目安 3 分

導入

深層検索では、単に検索回数を増やせばよいわけではない。複雑な質問を分解し、何が不足しているかを判断し、次の検索を設計し、複数の情報源を根拠のある回答へまとめる必要がある。従来のReAct型エージェントでは、これらを一つの方策が同時に担うことが多い。さらに検索が長引くと、過去の思考や検索結果が文脈に積み重なり、重要な情報がノイズに埋もれやすくなる。IterSynthは、この二つの問題を役割分担と状態管理の両面から見直した。

PlannerとSynthesizerの交替

IterSynthは、別々のモデルを組み合わせるのではなく、同じパラメータを二つの役割として交互に実行する。

  • Planner:現在の要約状態から未解決の情報要求を見つけ、次のサブクエリを作る。
  • Synthesizer:新たに得られた証拠を確認し、検索の進展を要約へ取り込む。

ここで要約は、最後に回答を短くするための処理ではない。検索を継続するための永続的な状態として機能する。次のPlannerは、生の全履歴ではなく、限られた作業領域から再構成された状態を読む。そのため文脈の膨張を抑えながら、計画と証拠統合に異なる責務を持たせられる。

RDPOによる役割別の信用割当

新しい実行形式を安定して学習させるため、研究チームはRole-Decoupled Policy Optimization(RDPO)を提案した。最終回答の成否だけでなく、各ターンの評価基準も報酬に加え、PlannerとSynthesizerについて別々にグループ相対のアドバンテージを計算する。これにより、検索クエリが情報収集に役立ったか、要約更新が状態を改善したかを、それぞれの役割に近い信号として学習できる。

結果と意味

GAIA text-only、xBenchの各バージョン、BrowseComp、BrowseComp-ZHなどで、IterSynth-8Bは平均50.7を報告した。これは従来の8B以下のエージェントを4.2ポイント上回る。学習アブレーションでは、SFTの44.1から、結果報酬のみのGRPOで48.9、RDPOで50.7へ向上した。また、学習していないPlannerに置き換えると大きく性能が低下したとされ、役割分離が単なるプロンプト上の見せ方ではないことを示している。

要約を中心とした設計では、検索ラウンドは12回超からおよそ7〜8回となり、文脈上限への到達率は5%未満だった。等価な二モデル構成と比べ、推論時間も約13〜15%短縮されたという。さらにClaude-4.5-OpusやDeepSeek-V3.1では、ReActを上回るゼロショット改善も報告されている。

IterSynthの重要性は、エージェントの記憶を完全な履歴から修正可能な作業要約へ移した点にある。一方、要約が細部を落としたり誤りを引き継いだりする可能性は残るため、今後は証拠の追跡性と要約の忠実度を含めた検証が必要になる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
AgentKernel:AIエージェントのための回避不能な安全カーネル
AIエージェント
cctest.ai
AIエージェント

AgentKernel:AIエージェントのための回避不能な安全カーネル

AgentKernelは、OSのセキュリティ原則をAIエージェントの実行基盤に取り込み、アイデンティティ、知覚、認知、実行の4領域を保護する構想です。プロンプトインジェクション、メモリ汚染、委譲の悪用、ツールの誤用を意味レベルで扱います。

続きを読む
CCTest · Blog
AIエージェントチームが「協力の仕方」そのものを学ぶ
AIエージェント
cctest.ai
AIエージェント

AIエージェントチームが「協力の仕方」そのものを学ぶ

Self-Organizing Agent Teams(SAT)は、固定メンバーのAIエージェントが過去の協業から、役割分担や対話の進め方、情報共有の方法を学ぶ仕組みです。数学・物理ベンチマークで、単体モデルや理想的な回答ルーターを上回る結果が報告されました。

続きを読む
CCTest · Blog
VHD-Play、解いたメカニズムから検証可能なエージェントRL環境を生成
AIエージェント
cctest.ai
AIエージェント

VHD-Play、解いたメカニズムから検証可能なエージェントRL環境を生成

VHD-Playは、環境を先に作って評価規則を後付けするのではなく、解を求めた数学的メカニズムからエージェント向け環境を生成する手法です。状態変化、隠れたパラメータ、遅延する結果を含む長期的な相互作用を学習できます。

続きを読む