記事一覧へ戻る
AIセーフティ

AIエージェントを自己監査させない:OBPEが統制をツール境界へ移す

読了目安 3 分

導入

AIエージェントに人間の認証情報を渡すと、その人がアクセスできる範囲は受け継げる。しかし、業務上その範囲をどこまで使うべきかという判断までは受け継げない。認証上は正当なリクエストでも、エージェントがアクセス可能なレコードを一括取得し、隠れた指示や秘密をコンテキストへ取り込み、担当範囲を超えた処理を完了する可能性がある。

論文「If Agents Were Angels, No Governance Would Be Necessary」は、こうした問題に対して Out-of-Band Policy Enforcement(OBPE)を提案する。ポイントは、プロンプトでモデル自身に制限を守らせるのではなく、エージェントとバックエンドの間に信頼できるポリシー境界を置くことだ。

OBPEの仕組み

OBPEは、ツール呼び出しの前後で複数の制御を適用する。

  • 操作と資源を承認する:操作の種類、対象リソース、呼び出し主体を確認する。
  • クエリを狭める:バックエンドへ送る前に条件を制限し、不要なデータ取得を防ぐ。
  • 応答を整形する:レコードやフィールドを除去し、必要に応じて値をマスクする。
  • 意味的ゲートを置く:引数の値や外部状態に応じ、承認済みの呼び出しも拒否または保留できる。

データポリシーの所有者は最大許可範囲を設定し、エージェント側のポリシーはその範囲を狭めることしかできない。論文は、提示された条件の下で、ポリシー計画の適用順序が結果を変えず、エージェント側のルールが許可上限を拡大できないことを示している。

評価結果と限界

著者らは、本番システムを簡略化したHTTPプロキシの試作版を公開し、型付きCedarポリシーコアとモデルの整合性をテストした。JiraとServiceNowのモック環境で、4つのモデルをOBPEの有無で比較し、20件の適応型レッドチーム課題を含む試験を実施した。保護データがコンテキストへ入る、回答に正確な値が現れる、禁止された効果が完了する、のいずれかをトレース失敗と定義している。

3,621回の試験では、失敗率が57.6%から0.2%へ低下した。クラスタ重み付けの低下幅は41.2ポイントで、95%信頼区間は27.7~54.9ポイントだった。一方、タスク履行率は79.1%から60.9%へ下がった。ただし、安全かつ有用な完了の組み合わせは21.8ポイント上昇した。安全性を高めるほど、単純な成功率だけでは評価しにくくなることが分かる。

主張には明確な限界もある。コンテキストに入らなかった値を回答から再構成した例や、フィルタ後の行数を手掛かりにした例があり、1回の実行を整形するだけでは情報非干渉性を証明できない。書き込み制御、永続的な承認、時間や集計に関するポリシーも評価対象外だった。

意味と影響

この研究の重要な示唆は、プロンプトだけにセキュリティの境界を担わせないことだ。モデルには行動案を作らせても、何を読めるか、どのデータを受け取れるか、外部効果を実行できるかは、外部ポリシー層が決めるべきだろう。

OBPEは完成されたガバナンスではない。副チャネル、複数ターンの相互作用、状態変化、承認済みの書き込みなどを追加で扱う必要がある。それでも、企業向けエージェントでは、ツール境界で最大許可を明示し、制御による有用性の低下も測定可能なコストとして扱う、という実装方針を示している。

出典:arXiv

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
LMSM、Linuxのセキュリティモジュール思想をLLMの実行時防御へ
AIセーフティ
cctest.ai
AIセーフティ

LMSM、Linuxのセキュリティモジュール思想をLLMの実行時防御へ

LMSMは、モデル内部の証拠、ポリシー判断、出力解放を分離し、解釈可能性の成果をLLMの実行時防御へ接続するフレームワークです。Qwen3-4Bの試作では、攻撃成功率を大幅に下げながら、監視なしの提供経路に近いスループットを維持しました。

続きを読む
CCTest · Blog
StepGuard、LLMエージェントのツール実行を一手ごとに監査
AIセーフティ
cctest.ai
AIセーフティ

StepGuard、LLMエージェントのツール実行を一手ごとに監査

StepGuardは、エージェントの行動履歴が完成するのを待たず、ツール呼び出しを実行する前に各アクションを安全性の観点から検査する。自動データ生成と安全性・有用性のバランスを意識した学習により、攻撃の抑制と過剰防御の低減を目指す。

続きを読む
CCTest · Blog
言語モデルの量子化が潜在的なバックドアを作動させる可能性
AIセーフティ
cctest.ai
AIセーフティ

言語モデルの量子化が潜在的なバックドアを作動させる可能性

新しい研究は、FP16などの高精度モデルが安全性検査を通過しても、INT8や4ビットに量子化した後の挙動まで保証されるわけではないと指摘しています。圧縮によって、潜在していた悪意ある挙動が表面化する可能性があります。

続きを読む