記事一覧へ戻る
モデル評価

APort Vault、AIエージェントの決済認可境界を検証

読了目安 3 分

導入

AIエージェントが決済ツールを呼び出せるようになると、安全性は「危険な依頼を拒否できるか」だけでは測れない。重要なのは、送金の直前に受取人とポリシーを照合し、認可された操作だけを実行できるかどうかだ。Hugging Face Daily Papersで紹介された APort Vault は、この認可境界を検証するためのベンチマークである。

主な結果

  • 攻撃ベースの大規模評価。 公開CTFで人間が作成した4,371件の攻撃を再生し、8研究機関の14モデル、5種類のポリシー設定、2つの再生トラックを対象にした。一方にはOpen Agent Passport仕様を実装した決定的な実行前チェックを置き、もう一方には置かない。評価数は合計225,964件に達した。
  • 単一の成功率に集約しない。 各評価について、エージェントが要求を出したか、決済が実行されたか、ポリシーが呼び出しを拒否したか、受取人が認可されていたかを分けて記録した。これにより、異なる失敗要因を一つの数字に混ぜることを避けている。
  • 要求率は設定に大きく左右された。 モデル単独のLevel 1から4では、要求率は10.9%、3.0%、0.1%、79.4%だった。ただし各攻撃は一つの設定にのみ属するため、ポリシーの違いと攻撃集団の違いを完全には分離できない。
  • Level 4ではモデル間の傾向が近かった。 1,293件のLevel 4プロンプトを全モデルで評価したところ、要求率は71.2%から84.3%。809件では14モデルすべてが要求を出し、その後、同レベルで許可された受取人への決済が成功した。
  • 差が明確になったのは認可境界。 Level 2から4では、モデル単独でパスポートが許可していない受取人への送金が76,842件中140件あった。一方、OAP層の背後では69,297件中0件だった。モデル、プロンプト、トラックをそろえた比較では105件対0件となった。

意義と限界

OAP層は、すべての決済を拒否して結果を改善したわけではない。層の背後でも25,370件の決済が実行され、評価対象となった25,640件の送金呼び出しのうち、ポリシーが拒否したのは187件だった。そのうち148件は許可されていない受取人に関するものだった。モデルの判断だけに依存せず、最終認可を決定的な制御層に移す設計の有効性が示唆される。

ただし、0件という結果は普遍的な安全性の証明ではない。攻撃集合、ポリシーレベル、再生環境が対象範囲を決めており、攻撃と設定も結び付いている。報告では、0件の結果は790のソースセッションにまたがり、セッション単位の上限は0.38%とされる。APort Vaultの重要性は、決済エージェントを評価する際、要求、実行、拒否、受取人認可を分けて測るべきだと示した点にある。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
BI-AgentとBI-Benchが目指すエンドツーエンドBIの自動化
モデル評価
cctest.ai
モデル評価

BI-AgentとBI-Benchが目指すエンドツーエンドBIの自動化

新たな研究によると、最先端の大規模言語モデルでさえ、現実に近いBIタスクの正解率は50%未満です。研究チームは、データ検索から結合、変換、回答までを評価するBI-Benchと、ツール拡張型のBI-Agentを提案しました。

続きを読む
CCTest · Blog
AIがAI査読者を訓練するとき、科学的判断はどう縮小するのか
モデル評価
cctest.ai
モデル評価

AIがAI査読者を訓練するとき、科学的判断はどう縮小するのか

モデルが生成した査読文を次世代のAI査読者が学習すると、評価の分布と意味的多様性が縮小する可能性がある。研究チームはこの現象を「科学的判断の崩壊」と呼び、TrustReviewerによる緩和策を提案した。

続きを読む