NEEDLE、重みの直交化で大規模言語モデルのバックドアを除去
導入
大規模言語モデルのバックドア攻撃は、通常の入力ではほとんど異常を見せず、特定の単語やパターン、入力条件が現れたときだけ攻撃者が埋め込んだ挙動を引き起こします。そのため、一般的な能力テストだけでは発見が難しく、配備後に有害な生成や想定外の処理、コードインジェクションにつながる可能性があります。
バックドアの除去にも難しさがあります。強く修正すれば攻撃成功率は下げられますが、通常のプロンプトに対する出力分布まで変化し、汎用能力や安全な拒否応答を損なうおそれがあります。Locai Labsの研究チームが提案したNEEDLEは、このトレードオフを小さくすることを目指す手法です。
手法の要点
NEEDLEは再学習を必要としません。ただし、対象となるトリガーがあらかじめ特定されていることを前提とします。処理の中心は次の通りです。
- バックドア方向の推定:トリガー付き入力と通常入力の活性化ベクトルを比較し、トリガーが内部表現に与える主な変化を方向として表します。
- 拒否応答サブスペースの抽出:拒否挙動に関係する活性化を分析し、変更から保護すべき表現の部分空間を定義します。
- 層ごとの重み直交化:注意機構とMLPの出力重みを調整し、関連する活性化がバックドア方向へ進むことを抑えます。
- 拒否表現の補正:前段の層を編集すると後段への入力も変わるため、閉形式の補正を使い、拒否サブスペースへの射影をできるだけ維持します。
重要なのは、単純に広いパラメータ領域を削除するのではなく、トリガーに関連する方向と安全性に関係する表現を分けて扱う点です。クリーンな参照モデルや、元の汚染学習データにも依存しません。
結果と意義
論文では、複数のモデル系列と攻撃種別を用いて評価しています。著者の報告によると、NEEDLEは比較対象の防御手法の中で平均攻撃成功率が最も低く、難しいコードインジェクション攻撃では0%という結果も示されました。また、KLダイバージェンスが最も低く、能力と安全性への変更も小さいとされています。ただし、これらは論文で用いられたモデル、トリガー、評価条件に基づく結果であり、未知のあらゆるバックドアに有効だとまでは言えません。
この研究は、モデル修復を「外科手術」のように捉える方向性を示しています。トリガーが特定できる場合、完全な再学習ではなく内部表現と重みを直接編集できる可能性があります。同時に、防御評価では攻撃成功率だけでなく、通常入力への応答、出力分布の変化、一般能力、拒否安全性も確認する必要があります。未知のトリガーや複数バックドア、大規模な実運用モデルでの検証が今後の課題です。
コメント
ログイン状態を確認中…
コメントを読み込み中…