APort Vault、AIエージェントの決済認可境界を検証
導入
AIエージェントが決済ツールを呼び出せるようになると、安全性は「危険な依頼を拒否できるか」だけでは測れない。重要なのは、送金の直前に受取人とポリシーを照合し、認可された操作だけを実行できるかどうかだ。Hugging Face Daily Papersで紹介された APort Vault は、この認可境界を検証するためのベンチマークである。
主な結果
- 攻撃ベースの大規模評価。 公開CTFで人間が作成した4,371件の攻撃を再生し、8研究機関の14モデル、5種類のポリシー設定、2つの再生トラックを対象にした。一方にはOpen Agent Passport仕様を実装した決定的な実行前チェックを置き、もう一方には置かない。評価数は合計225,964件に達した。
- 単一の成功率に集約しない。 各評価について、エージェントが要求を出したか、決済が実行されたか、ポリシーが呼び出しを拒否したか、受取人が認可されていたかを分けて記録した。これにより、異なる失敗要因を一つの数字に混ぜることを避けている。
- 要求率は設定に大きく左右された。 モデル単独のLevel 1から4では、要求率は10.9%、3.0%、0.1%、79.4%だった。ただし各攻撃は一つの設定にのみ属するため、ポリシーの違いと攻撃集団の違いを完全には分離できない。
- Level 4ではモデル間の傾向が近かった。 1,293件のLevel 4プロンプトを全モデルで評価したところ、要求率は71.2%から84.3%。809件では14モデルすべてが要求を出し、その後、同レベルで許可された受取人への決済が成功した。
- 差が明確になったのは認可境界。 Level 2から4では、モデル単独でパスポートが許可していない受取人への送金が76,842件中140件あった。一方、OAP層の背後では69,297件中0件だった。モデル、プロンプト、トラックをそろえた比較では105件対0件となった。
意義と限界
OAP層は、すべての決済を拒否して結果を改善したわけではない。層の背後でも25,370件の決済が実行され、評価対象となった25,640件の送金呼び出しのうち、ポリシーが拒否したのは187件だった。そのうち148件は許可されていない受取人に関するものだった。モデルの判断だけに依存せず、最終認可を決定的な制御層に移す設計の有効性が示唆される。
ただし、0件という結果は普遍的な安全性の証明ではない。攻撃集合、ポリシーレベル、再生環境が対象範囲を決めており、攻撃と設定も結び付いている。報告では、0件の結果は790のソースセッションにまたがり、セッション単位の上限は0.38%とされる。APort Vaultの重要性は、決済エージェントを評価する際、要求、実行、拒否、受取人認可を分けて測るべきだと示した点にある。
コメント
ログイン状態を確認中…
コメントを読み込み中…