ツール利用エージェントはなぜ失敗するのか:証拠から行動への断絶
導入
データベースを検索し、記録を更新し、外部システムにリクエストを送る AI エージェントにとって、最終結果が正しいかどうかだけでは安全性を測れません。たまたま正しい状態に到達していても、行動前に必要な証拠を確認していなければ、その処理は監査可能でなく、再現性もありません。
Hugging Face Daily Papers で紹介された本研究は、ツール利用エージェントの「証拠から行動へ」という連鎖を分析しました。焦点は、エージェントが行動の是非を判断できるかだけではなく、調査を完了し、証拠を確立した後に、適切な順序で実行できるかという点にあります。
主な発見
- 静的な判断能力は、実行能力を保証しない。 同じ V1 ケースで再評価された3つの構成では、静的精度が95%以上だった一方、対話的な成功率は52%以下でした。抽象的に正しい行動を選べても、実環境で調査と実行を正しく進められるとは限りません。
- 失敗は行動前に始まる。 V0 エピソードでは、必要な調査を終える前に停止した割合が21.7%〜62.9%でした。V1 の行動試行では、37.0%〜66.9%が必要な証拠の確立前に行われました。
- 証拠不足が自動的に慎重さを生むわけではない。 43件の V1 ケースで決定的な記録を1つ隠す介入を行ったところ、完了したエピソードの46.5%〜53.5%で、エージェントはなお行動しました。
- 複数ステップでは別の問題が現れる。 必要な証拠がそろった後の単一行動は概ね安定していました。しかし、依存関係のあるワークフローでは、未解決の前提条件や後続処理の未完了が明らかになりました。
評価方法
SafeActBench は、6つの業務領域にまたがる656件のケースで構成されています。プロトコルは、静的な行動判断、調査後に行動しない選択、単一行動、依存関係付きの複数行動へと段階的に進みます。これにより、判断の失敗、調査不足、実行の失敗を分けて観察できます。
研究では、出所情報と結び付いた Evidence Ledger も導入しました。どの情報が確立されたか、いつ利用可能になったか、行動がいつ起きたかを記録します。さらに決定論的な軌跡評価器が、重要な行動に事前の証拠が存在したか、後続の依存条件が満たされたかを判定します。LLM による主観的な判定に頼らず、記録された軌跡を直接評価する点が特徴です。
意義
エージェントの評価は、最終状態の正解率やタスク完了率だけでは不十分です。調査が完了していたか、証拠を追跡できるか、証拠の後に行動したか、複数ステップの前提条件をすべて満たしたかを確認する必要があります。
実運用では、証拠台帳、明示的な確認ゲート、依存関係を理解する実行器が有効な対策になり得ます。本研究は、「正しい行動を知っているか」から、「確立済みの証拠を使って正しく行動したか」へと、エージェント評価の焦点を移しています。
コメント
ログイン状態を確認中…
コメントを読み込み中…