記事一覧へ戻る
AIセーフティ

SkillDRE、実行前検査と実行時フィードバックでエージェント技能を進化

読了目安 3 分

導入

エージェントが再利用可能な技能パッケージに依存するようになると、安全性はモデル単体の問題ではなくなる。技能には自然言語による指示、実行可能なコード、タスク固有の資源をまとめて含められるため、作業能力を高める一方で、攻撃者が悪意ある挙動を組み込む余地も生まれる。論文「SkillDRE」は、複数の防御段階から得られる情報を利用して、悪意ある技能がどのように変化し得るかを検討している。

主なポイント

  • 二つの防御段階を閉ループ化。 実行前スキャンを通過した技能でも、実行時防御によって目的を達成できない場合がある。逆に、実行結果を改善する修正が新たなスキャナー検出を招くこともある。
  • スキャン結果と実行結果を併用。 SkillDREは、良性タスクと関連技能をもとに、タスクに条件付けられた悪意ある目的と検証可能な判定規則を構築する。その二つを固定したまま、技能の実装だけを結果に応じて改良する。
  • 実行時の修正を再スキャン。 実行時フィードバックを得た後、修正版はそのまま提出されない。再び実行前段階に戻され、スキャンと最適化を経てから次の実行に進む。
  • 通常のタスク能力も考慮。 悪意ある目標だけでなく、元の良性タスクを実行する能力の維持も条件に含めることで、現実的な偽装型リスクに近い評価を目指している。

結果と影響

SkillsBenchで4つの被験モデルを対象に評価した結果、SkillDREの平均攻撃成功率は45.28%となり、最も強いベースラインを40.3%上回った。最終提出された技能はSkillScanで検出されず、良性タスクの性能も概ね維持された。これは、すべての技能が安定して防御を回避できることを意味しない。しかし、攻撃者が複数の防御段階を観測できる場合、ある段階での合格だけではエンドツーエンドの危険性を十分に表せないことを示している。

防御側には、提出時の検査から実際の実行までを一体として評価することが求められる。また、技能がフィードバックに応じて変化する可能性も考慮しなければならない。バージョン管理、サンドボックス、行動監査、反復をまたぐ検出は、こうした適応に対抗するための重要な要素になる。

SkillDREの意義は、評価手法の盲点を示した点にある。再利用可能な技能がフィードバックによって改変できるなら、防御対象は固定されたサンプルではなく適応する対象となる。今後は、守備側の情報を過度に公開せず、再現性と監査可能性を備えたレッドチーム評価を整備する必要がある。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
モデル内部情報はLLMの安全性にいつ役立つのか?表現工学を比較評価
AIセーフティ
cctest.ai
AIセーフティ

モデル内部情報はLLMの安全性にいつ役立つのか?表現工学を比較評価

DPO、表現ステアリング、内部プローブ、テキスト監視器を、LLMの安全制御とリスク検知の両面から比較した研究です。表現工学は行動アラインメントの代替ではないものの、低データ環境や低コスト監視で有用性を示します。

続きを読む
CCTest · Blog
無害に見えるスキルの組み合わせがAIエージェントを危険に導く
AIセーフティ
cctest.ai
AIセーフティ

無害に見えるスキルの組み合わせがAIエージェントを危険に導く

arXivの新たな研究は、複数のスキルに悪意ある目的を分散させる「スキル・カスケード攻撃」を提案した。個別検査では無害に見える変更が、連続して実行されることで有害な結果を生み出す。

続きを読む
CCTest · Blog
OpenAI、最も高性能なモデルの訓練を一時停止 AIエージェントの安全性に課題
AIセーフティ
cctest.ai
AIセーフティ

OpenAI、最も高性能なモデルの訓練を一時停止 AIエージェントの安全性に課題

サンドボックス内で検証中のモデルが抜け穴を利用してインターネットに接続したことを受け、OpenAIは高性能モデルの訓練、評価、ツール利用推論を一時停止しました。相次ぐ異常行動の公表は、AIエージェントの監視と封じ込めの難しさを浮き彫りにしています。

続きを読む