記事一覧へ戻る
AIエージェント

Inherit-MAS:ワークフローと実行結果を継承するマルチエージェント進化

読了目安 4 分

導入

マルチエージェントシステムでは、複数の大規模言語モデルを配置するだけでは十分ではない。各エージェントの役割、通信の流れ、利用できるツール、そして失敗後にどの部分を変更するかまで設計する必要がある。事前に作ったワークフローは複雑な課題に対応できないことがあり、逆にテスト時に全体を大きく書き換えると、すでに有効だった構成まで失う可能性がある。さらに、変更されていない処理を毎回最初から実行すれば、モデル呼び出しやツール呼び出しが重複する。

arXivで発表されたInherit-MASは、この問題に「継承」と「選択」の考え方を取り入れる。毎回新しいワークフローを作るのではなく、直近の候補を出発点として、評価で見つかった欠陥を局所的に修正する。同時に、条件が合う過去の実行結果を再利用することで、進化の計算コストを抑えようとする。

仕組みの要点

  • 生成と評価を分離。 メタモデルが、専門的な役割を持つワーカーからなるワークフローを合成する。各ノードには役割、受け取る通信入力、利用可能なツール権限が定義される。実行後は、別にプロンプトされた判定モデルが候補を採点し、欠点を診断する。
  • ワークフロー継承。 通常の改良ラウンドは、最後に完了した候補から始まる。判定で役に立たないと見なされた削除可能なノードを取り除き、診断された問題を解決するための検証済み編集を適用する。
  • 実行継承。 新しい候補を実行する際、保存済み結果は、完全に解決されたリクエストと実行コンテキストが一致する場合に限って継承される。これにより、異なる条件で得られた古い結果を誤って流用することを避ける。
  • 局所的な変更。 構造の改良と計算結果の再利用を分けることで、ワークフローを変更しつつ、影響を受けない処理の再実行を減らす。

報告された結果

GPT-4o-miniをワーカーに用いた実験では、WorkBenchで55.4%のcompletion、HotpotQA FullWikiで49.7%のjoint F1を達成したと報告されている。論文によれば、EvoAgent、EvoMAS、TacoMASを含む進化型マルチエージェントのベースラインを上回った。また、Qwen3-32Bをワーカーにした場合も、両ベンチマークでこれらのベースラインを超えたとしている。

実行継承を無効にして同じコントローラを再実行する設定との比較では、ワーカートークン使用量がWorkBenchで29.1%、HotpotQAで34.6%減少した。総トークン使用量の減少は、それぞれ5.3%と18.1%だった。ワーカー側の節約幅が総量より大きいことから、ワークフロー生成や判定など、別の処理も全体コストに影響していることが分かる。

意義と残る課題

Inherit-MASは、テスト時の改善を「全面的な再生成」ではなく、診断、局所編集、検証、選択の反復として捉え直す。多くの試行を必要とするエージェントシステムでは、ワークフローの変更を安定させ、モデルやツールへの高コストな呼び出しを減らす可能性がある。特に、リクエストとコンテキストの完全一致を要求する設計は、再利用の安全性を支える。

一方、提示された素材だけでは、各継承機構の独立した効果、編集に失敗した例、判定モデルの誤りについて詳しくは分からない。実際の効果は、再利用可能な結果の割合やワークフローの規模にも左右されるだろう。それでも本研究は、進化するエージェントシステムに対して、変更は局所的に、再利用は慎重に、次の改良は実行フィードバックに基づいて行うという実装上の指針を示している。

出典:arXiv

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
LLMエージェントはなぜ特定の情報源を選ぶのか
AIエージェント
cctest.ai
AIエージェント

LLMエージェントはなぜ特定の情報源を選ぶのか

買い物、ホテル、学術検索を対象にした研究で、LLMエージェントが候補の適合度だけでなく、商品や情報の出所にも系統的な好みを示すことが分かりました。出所を隠す、情報を補う、出所に基づく推測を抑える指示を加えることで、その影響は弱められます。

続きを読む
CCTest · Blog
DeskForge、制御可能なデスクトップ環境でPC操作エージェントを学習
AIエージェント
cctest.ai
AIエージェント

DeskForge、制御可能なデスクトップ環境でPC操作エージェントを学習

DeskForgeは、実際のアプリケーションにスクリーンショット、アクセシビリティツリー、ウィンドウ形状情報を組み合わせ、PC操作エージェント向けの密な教師信号を生成する。GUIのターゲット特定だけでなく、長期タスクの達成率にも改善が報告された。

続きを読む
CCTest · Blog
行動する前に比較する:長期ツール利用エージェントの価値推定
AIエージェント
cctest.ai
AIエージェント

行動する前に比較する:長期ツール利用エージェントの価値推定

長期的なツール利用では、次の操作が今すぐ妥当かだけでなく、最終的なタスク成功につながるかを判断する必要があります。CITAは、実行前に候補となるツール呼び出しを比較する仕組みを提案します。

続きを読む