MILO:マルチエージェント進化でAgent Harnessを自動発見
はじめに
長い手順を必要とするタスクでは、AIエージェントの能力は言語モデルだけで決まりません。どのように計画し、ツールを呼び出し、実行状態を管理し、外部環境と相互作用するかを定めるHarnessも重要です。モデルが更新されるたびに、従来のHarnessを人手で調整し直すのは大きな負担になります。MILO(Meta-evolutionary Island Orchestration)は、この設計作業を継続的な探索と進化の問題として扱います。
MILOの要点
- 完全なHarnessを探索する:既存手法の多くはプロンプトやスキルなど、一部の部品だけを最適化します。MILOでは変異エージェントがHarness全体を書き換え、部品同士の組み合わせを一つのシステムとして評価します。
- 探索の系譜を保持する:候補は島型の系譜ツリーに整理されます。採用された変更だけでなく、拒否された変異も負の証拠として記録し、同じ失敗を繰り返しにくくします。
- 探索方法そのものを適応させる:オーケストレーターは系譜の接ぎ木、種分化、変異エージェントの再配置、探索カリキュラムの改訂を行います。探索戦略を固定せず、状況に応じて変更できる点が特徴です。
- 複数モデルと課題で検証する:Terminal-Bench 2.1、PaperBench、DeepSWEを対象に、Opus 4.8とオープンウェイトモデルgpt-oss-120bを用いて評価しました。報告された比較では、MILOが発見したHarnessは8種類の先行Harnessと6種類の探索手法を上回りました。
意義と限界
Opus 4.8を使った場合、初期Harnessに対する解決率の向上は3ベンチマークでそれぞれ12.0%、28.3%、10.3%でした。Terminal-Bench 2.1では86.1±2.0%に達し、比較時点で公式ランキングに掲載された最高値83.8±2.3%を上回っています。
重要なのは、MILOが単に優れたHarnessを探すだけでなく、「探し方」も改善しようとしている点です。Harnessの設計空間が広がると、固定的な探索戦略は限られた方向を過度に追い、早期に似た候補へ収束する可能性があります。島構造は多様な探索経路を保ち、系譜メモリは成功例と失敗例の双方を次の判断につなげます。
一方で、タスクやモデル、ツール環境をまたぐ性能の移転、探索コスト、評価の信頼性、複雑なHarnessの解釈可能性は今後の課題です。それでもMILOは、エージェント開発が固定された実行手順の手作業管理から、運用手順を継続的に発見・改良する仕組みへ移行する可能性を示しています。
コメント
ログイン状態を確認中…
コメントを読み込み中…