Marathoner:AIエージェントの超長期実行能力を鍛える
導入
現在のAIエージェントは、ツールの利用やコード生成、短い多段階ワークフローには対応できます。しかし、目標達成まで何時間も計画と実行を続ける必要がある課題では、元の目的から外れたり、失敗した操作を繰り返したり、終盤で進行を止めたりすることがあります。Ant Groupの研究チームが提案するMarathonerは、この「超長期の実行能力」を主な対象にしています。
手法のポイント
Marathonerは新しいモデル構造というより、長時間のタスクを想定したポストトレーニングのパイプラインです。
- 大規模なソフトウェア変更からタスクを作る。 GitHubの主要リリースPRのうち、1,000行を超える新規コードを含むものを基礎データとして利用します。単純なコーディング問題よりも、依存関係や中間的な失敗、明確な最終目標を含みやすい点が特徴です。
- 複数タスクを連結する。 生成したタスクを一つの長い課題につなぎ、実行の深さと難度を高めます。
- 拒否サンプリングで初期能力を作る。 強力な教師モデルと複数の実行ハーネスで候補軌跡を生成し、有効な軌跡を選んで基盤モデルを教師あり微調整します。
- サンドボックスで強化学習を行う。 学習済みモデルは独立した環境で実際にタスクを実行します。これにより、静的な回答の模倣ではなく、ツール利用、状態変化、エラーからの復旧を学習できます。
- 後半の行動に追加報酬を与える。 Later Stage Bonus Rewardは、実行の後半でも意味のある操作を続けるよう促します。序盤は活発でも、長い軌跡の後半で停滞する問題への対策です。
結果と意味
論文は、超長期タスクを含む5つのベンチマークで評価し、基盤モデルに対する一貫した大幅な改善を報告しています。また、比較対象となった強力な proprietary modelを上回ったとしています。追加分析では、難しい課題に対して10時間以上作業し、1,000回以上のツール呼び出しを行えると説明されています。ただし、提供された素材にはベンチマーク名、詳細なスコア、比較モデルの完全な設定がないため、最終的な評価には論文本文と再現実験の確認が必要です。
この研究の意義は、「粘り強さ」を測定・訓練可能なエージェント能力として扱おうとした点にあります。大規模なコード変更は長い依存関係を持つ現実的な課題の源になり、サンドボックスでのロールアウトはテキストだけの学習から動的な実行へと訓練を広げます。後半報酬も、長期実行で起きやすい性能低下に直接対応します。
一方、長く動き続けることが、そのまま理解や信頼性を意味するわけではありません。初期のミスを長時間拡大する可能性や、推論コスト、状態管理、最終結果の検証といった課題も残ります。Marathonerは汎用的な自律性の最終的な証明ではなく、重要な訓練の方向性として捉えるべきでしょう。
コメント
ログイン状態を確認中…
コメントを読み込み中…