EvoSafeHarness、モデルと領域に合わせてAIエージェントの安全策を進化
導入
大規模言語モデルは、文章を生成するだけでなく、ツールを呼び出し、ファイルを編集し、取引を処理し、外部システムを操作するようになっています。その結果、間接的なプロンプトインジェクションや直接的な有害要求だけでなく、複数の行動が連鎖して生じるリスクも重要になりました。モデルの外側に安全ハーネスを置く方法は有効ですが、既存の仕組みは専門家が一度設計し、異なるモデルや領域へそのまま再利用することが少なくありません。
EvoSafeHarnessは、この一律適用の問題に対し、安全策は配備先に依存すると考えます。論文のフレームワークは、基盤モデルを凍結したまま、特定モデルと対象領域向けのハーネスを合成します。自然言語による安全ポリシーだけでなく、ツール呼び出しや実行時の行動を検査するコードも同時に探索する点が特徴です。
主なポイント
- モデルの挙動に合わせる。 モデルごとに指示への従い方や危険な行動の出やすさは異なります。厳しすぎるルールは、あるモデルでは有用性を大きく損なう一方、別のモデルには十分な防御にならない可能性があります。
- 領域固有の意味を扱う。 ファイル操作では権限、パス、順序が重要になり得ます。金融や取引の用途では、状態の変化や資金への影響、行動間の関係を確認する必要があります。
- ポリシーと実装を一体で探索する。 文章としての規則を作るだけでなく、どのツール呼び出しや軌跡の状態で規則を適用するかも最適化します。
- 新しい文脈で敵対的に評価する。 未知の文脈でレビューを行い、ベンチマーク例の暗記にすぎないルールを排除しようとします。
実験結果
4種類のエージェントベンチマーク群で、CaMeL、DRIFT、Progentなどの固定型防御より良い安全性・有用性のトレードオフを示したと報告されています。DecodingTrust-Agentでは平均攻撃成功率が45.6%から10.0%へ低下し、有用性のコストは3.3ポイントでした。15個の評価セルのうち14個で最良の結果となっています。
AgentDojoでは、攻撃成功率0.0%の状態で有用性82.8%を達成し、同じ攻撃成功率におけるCaMeLの有用性の2倍とされています。さらに、未見のAgentDynスイートへ変更なしで移行でき、Agent-SafetyBenchの全ての被験モデルで最良スコアを得たと報告されています。
意義と注意点
この研究は、汎用フィルターを追加する発想から、モデルの特性、領域知識、行動軌跡をまとめて設計する発想への転換を示します。一方、ベンチマークの結果だけで実運用の安全が保証されるわけではありません。新しいツール、権限設定、業務フロー、攻撃手法に対する継続的な監査が必要です。EvoSafeHarnessは監視やガバナンス、人による承認を置き換えるものではなく、配備用ハーネスの生成と評価を支援する枠組みとして捉えるのが適切です。
コメント
ログイン状態を確認中…
コメントを読み込み中…