記事一覧へ戻る
AIエージェント

MILO:マルチエージェント進化でAgent Harnessを自動発見

読了目安 3 分

はじめに

長い手順を必要とするタスクでは、AIエージェントの能力は言語モデルだけで決まりません。どのように計画し、ツールを呼び出し、実行状態を管理し、外部環境と相互作用するかを定めるHarnessも重要です。モデルが更新されるたびに、従来のHarnessを人手で調整し直すのは大きな負担になります。MILO(Meta-evolutionary Island Orchestration)は、この設計作業を継続的な探索と進化の問題として扱います。

MILOの要点

  • 完全なHarnessを探索する:既存手法の多くはプロンプトやスキルなど、一部の部品だけを最適化します。MILOでは変異エージェントがHarness全体を書き換え、部品同士の組み合わせを一つのシステムとして評価します。
  • 探索の系譜を保持する:候補は島型の系譜ツリーに整理されます。採用された変更だけでなく、拒否された変異も負の証拠として記録し、同じ失敗を繰り返しにくくします。
  • 探索方法そのものを適応させる:オーケストレーターは系譜の接ぎ木、種分化、変異エージェントの再配置、探索カリキュラムの改訂を行います。探索戦略を固定せず、状況に応じて変更できる点が特徴です。
  • 複数モデルと課題で検証する:Terminal-Bench 2.1、PaperBench、DeepSWEを対象に、Opus 4.8とオープンウェイトモデルgpt-oss-120bを用いて評価しました。報告された比較では、MILOが発見したHarnessは8種類の先行Harnessと6種類の探索手法を上回りました。

意義と限界

Opus 4.8を使った場合、初期Harnessに対する解決率の向上は3ベンチマークでそれぞれ12.0%、28.3%、10.3%でした。Terminal-Bench 2.1では86.1±2.0%に達し、比較時点で公式ランキングに掲載された最高値83.8±2.3%を上回っています。

重要なのは、MILOが単に優れたHarnessを探すだけでなく、「探し方」も改善しようとしている点です。Harnessの設計空間が広がると、固定的な探索戦略は限られた方向を過度に追い、早期に似た候補へ収束する可能性があります。島構造は多様な探索経路を保ち、系譜メモリは成功例と失敗例の双方を次の判断につなげます。

一方で、タスクやモデル、ツール環境をまたぐ性能の移転、探索コスト、評価の信頼性、複雑なHarnessの解釈可能性は今後の課題です。それでもMILOは、エージェント開発が固定された実行手順の手作業管理から、運用手順を継続的に発見・改良する仕組みへ移行する可能性を示しています。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
PatchHolmes、リスト全体を比較するエージェントで脆弱性修正コミットを特定
AIエージェント
cctest.ai
AIエージェント

PatchHolmes、リスト全体を比較するエージェントで脆弱性修正コミットを特定

PatchHolmesは、ハイブリッド検索で候補を絞り込んだ後、エージェントに候補リスト全体を比較させ、脆弱性を修正したコミットを選ぶ。個別判定方式より高いトップ1検索精度を、少ない対話回数で実現した。

続きを読む
CCTest · Blog
検索エージェントはなぜ「共謀」するのか:CrossFitで自律進化の誤った改善を抑える
AIエージェント
cctest.ai
AIエージェント

検索エージェントはなぜ「共謀」するのか:CrossFitで自律進化の誤った改善を抑える

自律進化型の検索エージェントでは、提案者と解答者が同じ誤りに同意し、内部報酬だけが上昇する場合がある。CrossFitは、学習に使う情報源と評価経路を分離して、この問題を緩和する。

続きを読む
CCTest · Blog
失敗から学ぶAIエージェント:AEDが5万件のエラー診断データを公開
AIエージェント
cctest.ai
AIエージェント

失敗から学ぶAIエージェント:AEDが5万件のエラー診断データを公開

Agent Error Datasetは、LLMエージェントの失敗軌跡を検証可能な学習信号へ変換するデータセットです。50,228件のエラー診断ペアを通じて、失敗の原因分析と具体的な行動修正を結び付けます。

続きを読む