CLEAR:モデルの有用性を保つ動的なLLM安全アライメント
導入
大規模言語モデルの安全アライメントには、長く知られているトレードオフがある。安全データを使ってモデル全体を微調整すれば、有害な生成を抑えやすくなる一方、通常の質問への応答まで変化する可能性がある。過度に拒否する、あるいは本来の推論能力を失うといった問題につながり得る。イリノイ大学の研究チームが提案したCLEARは、安全介入を常時適用するのではなく、必要な場合に絞ることを目指す。
仕組み
CLEARはContinuous Latent Adapter Routingの略称である。基盤モデルを大きく書き換えるのではなく、モデルの隠れ状態を利用する軽量なゲートを追加し、安全用の低ランクアダプターの有効度を連続的に調整する。安全上の介入が必要だと判断される入力ではアダプターの影響を強め、無害なプロンプトでは余計な変更を小さくする、という考え方だ。
標準的なLoRAや安全SFTとの違いは、更新をモデルの全入力に一律に作用させない点にある。また、単純なオン・オフ切り替えではなく、内部表現に応じて介入の強さを滑らかに変える。これにより、危険な要求には安全側の補正を適用しつつ、通常のタスクでは基盤モデルの能力をできるだけ維持することを狙う。
報告された結果
論文は安全性と有用性のベンチマークでCLEARを評価している。Llama-3-8B-Instructでは、HarmBenchの攻撃成功率(ASR)が32.3%から0.5%に低下した。またGSM8Kでは、全体に適用するSFTやLoRAと比べて、正解率が最大7.1ポイント高かったと報告されている。提供された素材は、基盤モデルの有用性の大部分を維持できたとも説明している。ただし、完全な結果表、学習設定、計算量や推論遅延については、この概要だけでは確認できない。
意義と注意点
CLEARの意義は、安全アライメントの粒度を見直した点にある。安全機構をすべての入力に均等に適用するのではなく、モデルの内部状態に応じて調整可能な層として扱う。複数のモデルや攻撃手法、実運用環境でも同じ傾向が再現されれば、パラメータ効率のよい安全調整に新たな選択肢を与える可能性がある。
一方で、現時点の素材だけでは、未知の脱獄攻撃への耐性、他の基盤モデルへの一般化、追加モジュールの運用コストを判断できない。拒否応答の適切さやゲートの校正についても、より詳細な検証が必要だ。CLEARは安全性と有用性の衝突を解決した最終手段というより、選択的な安全介入を実現する有望な設計として捉えるのが妥当だろう。
コメント
ログイン状態を確認中…
コメントを読み込み中…