SkillDRE、実行前検査と実行時フィードバックでエージェント技能を進化
導入
エージェントが再利用可能な技能パッケージに依存するようになると、安全性はモデル単体の問題ではなくなる。技能には自然言語による指示、実行可能なコード、タスク固有の資源をまとめて含められるため、作業能力を高める一方で、攻撃者が悪意ある挙動を組み込む余地も生まれる。論文「SkillDRE」は、複数の防御段階から得られる情報を利用して、悪意ある技能がどのように変化し得るかを検討している。
主なポイント
- 二つの防御段階を閉ループ化。 実行前スキャンを通過した技能でも、実行時防御によって目的を達成できない場合がある。逆に、実行結果を改善する修正が新たなスキャナー検出を招くこともある。
- スキャン結果と実行結果を併用。 SkillDREは、良性タスクと関連技能をもとに、タスクに条件付けられた悪意ある目的と検証可能な判定規則を構築する。その二つを固定したまま、技能の実装だけを結果に応じて改良する。
- 実行時の修正を再スキャン。 実行時フィードバックを得た後、修正版はそのまま提出されない。再び実行前段階に戻され、スキャンと最適化を経てから次の実行に進む。
- 通常のタスク能力も考慮。 悪意ある目標だけでなく、元の良性タスクを実行する能力の維持も条件に含めることで、現実的な偽装型リスクに近い評価を目指している。
結果と影響
SkillsBenchで4つの被験モデルを対象に評価した結果、SkillDREの平均攻撃成功率は45.28%となり、最も強いベースラインを40.3%上回った。最終提出された技能はSkillScanで検出されず、良性タスクの性能も概ね維持された。これは、すべての技能が安定して防御を回避できることを意味しない。しかし、攻撃者が複数の防御段階を観測できる場合、ある段階での合格だけではエンドツーエンドの危険性を十分に表せないことを示している。
防御側には、提出時の検査から実際の実行までを一体として評価することが求められる。また、技能がフィードバックに応じて変化する可能性も考慮しなければならない。バージョン管理、サンドボックス、行動監査、反復をまたぐ検出は、こうした適応に対抗するための重要な要素になる。
SkillDREの意義は、評価手法の盲点を示した点にある。再利用可能な技能がフィードバックによって改変できるなら、防御対象は固定されたサンプルではなく適応する対象となる。今後は、守備側の情報を過度に公開せず、再現性と監査可能性を備えたレッドチーム評価を整備する必要がある。
コメント
ログイン状態を確認中…
コメントを読み込み中…