Inherit-MAS:ワークフローと実行結果を継承するマルチエージェント進化
導入
マルチエージェントシステムでは、複数の大規模言語モデルを配置するだけでは十分ではない。各エージェントの役割、通信の流れ、利用できるツール、そして失敗後にどの部分を変更するかまで設計する必要がある。事前に作ったワークフローは複雑な課題に対応できないことがあり、逆にテスト時に全体を大きく書き換えると、すでに有効だった構成まで失う可能性がある。さらに、変更されていない処理を毎回最初から実行すれば、モデル呼び出しやツール呼び出しが重複する。
arXivで発表されたInherit-MASは、この問題に「継承」と「選択」の考え方を取り入れる。毎回新しいワークフローを作るのではなく、直近の候補を出発点として、評価で見つかった欠陥を局所的に修正する。同時に、条件が合う過去の実行結果を再利用することで、進化の計算コストを抑えようとする。
仕組みの要点
- 生成と評価を分離。 メタモデルが、専門的な役割を持つワーカーからなるワークフローを合成する。各ノードには役割、受け取る通信入力、利用可能なツール権限が定義される。実行後は、別にプロンプトされた判定モデルが候補を採点し、欠点を診断する。
- ワークフロー継承。 通常の改良ラウンドは、最後に完了した候補から始まる。判定で役に立たないと見なされた削除可能なノードを取り除き、診断された問題を解決するための検証済み編集を適用する。
- 実行継承。 新しい候補を実行する際、保存済み結果は、完全に解決されたリクエストと実行コンテキストが一致する場合に限って継承される。これにより、異なる条件で得られた古い結果を誤って流用することを避ける。
- 局所的な変更。 構造の改良と計算結果の再利用を分けることで、ワークフローを変更しつつ、影響を受けない処理の再実行を減らす。
報告された結果
GPT-4o-miniをワーカーに用いた実験では、WorkBenchで55.4%のcompletion、HotpotQA FullWikiで49.7%のjoint F1を達成したと報告されている。論文によれば、EvoAgent、EvoMAS、TacoMASを含む進化型マルチエージェントのベースラインを上回った。また、Qwen3-32Bをワーカーにした場合も、両ベンチマークでこれらのベースラインを超えたとしている。
実行継承を無効にして同じコントローラを再実行する設定との比較では、ワーカートークン使用量がWorkBenchで29.1%、HotpotQAで34.6%減少した。総トークン使用量の減少は、それぞれ5.3%と18.1%だった。ワーカー側の節約幅が総量より大きいことから、ワークフロー生成や判定など、別の処理も全体コストに影響していることが分かる。
意義と残る課題
Inherit-MASは、テスト時の改善を「全面的な再生成」ではなく、診断、局所編集、検証、選択の反復として捉え直す。多くの試行を必要とするエージェントシステムでは、ワークフローの変更を安定させ、モデルやツールへの高コストな呼び出しを減らす可能性がある。特に、リクエストとコンテキストの完全一致を要求する設計は、再利用の安全性を支える。
一方、提示された素材だけでは、各継承機構の独立した効果、編集に失敗した例、判定モデルの誤りについて詳しくは分からない。実際の効果は、再利用可能な結果の割合やワークフローの規模にも左右されるだろう。それでも本研究は、進化するエージェントシステムに対して、変更は局所的に、再利用は慎重に、次の改良は実行フィードバックに基づいて行うという実装上の指針を示している。
出典:arXiv
コメント
ログイン状態を確認中…
コメントを読み込み中…