長期実行エージェントは何をしたのか:証拠に基づく監督
長期タスクで失われる可視性
AIエージェントは、単純な質問応答や一度きりのツール利用から、ソフトウェア開発、データ分析、科学研究などの長期ワークフローへと役割を広げています。数時間、場合によっては数日続く実行の中で、エージェントは計画を立て、ツールを呼び出し、コードを変更し、中間結果に応じて方針を更新します。
その一方で、ユーザーが実行ログを最初から最後まで読むことは困難になります。問題は明らかな誤りだけではありません。要求に不足があれば、エージェントは独自の仮定で補う可能性があります。また、計画や実装をユーザーに知らせず変更することもあります。テストに合格していても、当初の要求から外れている場合があります。データの除外、評価指標の変更、実験条件の調整といった一見妥当な判断も、最終結果を大きく左右することがあります。
研究が評価する二つの能力
論文「What Did the Agent Actually Do? Evidence-Grounded Oversight for Long-Horizon Agents」は、監督を二つの観点から整理しています。
- 要求と行動の整合性:曖昧な仕様や、気付かれにくい実装上の変更を発見し、確認や追加指示につなげる。
- 重大な判断の把握と検証:必ずしも誤りとは限らないが、結果に影響する自律的な判断を示し、ユーザーが受け入れるか判断できる根拠を提示する。
この能力を測るため、研究者はAgentMonBenchを構築しました。SpecGAP、SilentSwap、FeedbackTraceという三つのサブセットを通じて、モデルが重要な判断を特定し、その裏付けとなる証拠を元の場所までたどれるかを評価します。単なる軌跡の要約ではなく、要求、行動、根拠の関係を理解できるかが焦点です。
EBGの仕組み
Evidence-Grounded Behavior Graph(EBG)は、追加学習を必要としない手法です。リポジトリ、対話、ツール呼び出し、実行成果物に含まれる出典付きの情報を行動単位にまとめ、行動同士の関係をグラフとして整理します。タスクに合わせたグラフ表示により、監督モデルは長く断片化したログ全体を検索するのではなく、行動を文脈の中で解釈し、元の証拠へ戻ることができます。
さらにEBGはCodex Harnessに組み込まれ、実行前、重要な変更の後、最終報告の前に確認ポイントを設けます。ユーザーは目的を先に明確化し、重大な変更を確認し、最後に根拠に基づいて結果を検証できます。
意義
八つのモデルを用いた実験では、多くの設定で、EBGが重大判断の特定と証拠の位置付けを改善したと報告されています。入力規模やハイパーパラメータを変えても、証拠を見つける効果は維持されました。実際の研究ワークフローを使った事例も、判断の確認や次の実行方針の支援に役立つ可能性を示しています。
この研究が示すのは、解釈可能性の対象をモデル内部から長期的な行動監査へ広げる必要性です。重要なのは、なぜそう推論したかだけでなく、何を変更し、どの判断が結果に影響し、どの証拠で確認できるかです。人間の監督は、全工程への常時参加ではなく、重要な瞬間に理解し、承認し、介入できる仕組みへ変わるかもしれません。
コメント
ログイン状態を確認中…
コメントを読み込み中…