AdvSim2Real、進化するプロンプトインジェクションに強いWebエージェントを訓練
導入
Webエージェントにとって、ページの内容をすべて信用することも、すべて無視することも現実的ではありません。ユーザーの依頼を実行するには、ページ上の文章、ボタン、フォーム、商品情報などを読む必要があります。一方で、第三者は同じページに「元の指示を無視せよ」「別の操作を行え」といった文を挿入できます。エージェントがページ上の指示をユーザーの意図と混同すれば、間接的なプロンプトインジェクションによってタスクの結果が変わります。
AdvSim2Realは、固定された攻撃例を追加するだけでなく、タスク、攻撃者、エージェントを共進化させる方法を提案します。著者らは三者を凍結したWeb世界モデル内で動かし、シミュレーションで得た能力と頑健性が実ブラウザーへ移るかを検証しました。
主なポイント
- 学習に適した難易度を自動で探す。 カリキュラムは、エージェントが約半分の確率で解けるタスクに報酬を与えます。簡単すぎる課題はすぐに学習価値を失い、難しすぎる課題は有効なフィードバックを与えにくいため、成功と失敗の境界を追跡します。
- 攻撃の見た目ではなく結果を評価する。 攻撃者が生成した文が不審に見えるだけでは不十分です。本来成功する実行を失敗へ変える注入だけが報酬対象になります。これにより、攻撃学習が実際のタスク結果と結び付きます。
- 三つの要素を同時に更新する。 エージェントは新しい攻撃と過去の攻撃の両方に対応し、エージェントの能力向上に合わせてタスク分布も変化します。固定データセットを解き終えると学習が止まる問題を抑えます。
- 能力と安全性を同時に改善する。 150件のWebタスクで、4Bエージェントの通常時の完了率は74.89%から81.33%へ、攻撃下では48.07%から57.48%へ向上しました。学習に使っていないKimi-K3攻撃者に対しても23.00%から30.72%へ上がり、相対改善率は33.6%でした。実ブラウザーの厳密な成功率は25.56%から44.44%になりました。
意義と限界
この研究の重要な点は、静的な悪意ある指示のリストではなく、現在のエージェントを実際に失敗させる攻撃を継続的に探す学習信号を設計したことです。攻撃者が文言や配置を変えられる現実の環境に対して、固定された防御訓練より近い設定だと言えます。
ただし、結果は報告された実験範囲で解釈する必要があります。シミュレーターは、すべてのWebサイトの構造、ツール操作、長期タスクの失敗を再現できるわけではありません。実ブラウザーへの移行結果も、運用時の安全性を証明するものではありません。今後はより多様なサイト、ツール、タスク、攻撃で検証する必要があります。
それでもAdvSim2Realは、世界モデルを使って低コストで反復可能な攻防訓練を行い、エージェントの成長に合わせて課題を更新する方向性を示しています。Webエージェントの安全性を、一度きりの微調整ではなく継続的なカリキュラムとして扱う提案です。
コメント
ログイン状態を確認中…
コメントを読み込み中…