記事一覧へ戻る
AIセーフティ

CLEAR:モデルの有用性を保つ動的なLLM安全アライメント

読了目安 3 分

導入

大規模言語モデルの安全アライメントには、長く知られているトレードオフがある。安全データを使ってモデル全体を微調整すれば、有害な生成を抑えやすくなる一方、通常の質問への応答まで変化する可能性がある。過度に拒否する、あるいは本来の推論能力を失うといった問題につながり得る。イリノイ大学の研究チームが提案したCLEARは、安全介入を常時適用するのではなく、必要な場合に絞ることを目指す。

仕組み

CLEARはContinuous Latent Adapter Routingの略称である。基盤モデルを大きく書き換えるのではなく、モデルの隠れ状態を利用する軽量なゲートを追加し、安全用の低ランクアダプターの有効度を連続的に調整する。安全上の介入が必要だと判断される入力ではアダプターの影響を強め、無害なプロンプトでは余計な変更を小さくする、という考え方だ。

標準的なLoRAや安全SFTとの違いは、更新をモデルの全入力に一律に作用させない点にある。また、単純なオン・オフ切り替えではなく、内部表現に応じて介入の強さを滑らかに変える。これにより、危険な要求には安全側の補正を適用しつつ、通常のタスクでは基盤モデルの能力をできるだけ維持することを狙う。

報告された結果

論文は安全性と有用性のベンチマークでCLEARを評価している。Llama-3-8B-Instructでは、HarmBenchの攻撃成功率(ASR)が32.3%から0.5%に低下した。またGSM8Kでは、全体に適用するSFTやLoRAと比べて、正解率が最大7.1ポイント高かったと報告されている。提供された素材は、基盤モデルの有用性の大部分を維持できたとも説明している。ただし、完全な結果表、学習設定、計算量や推論遅延については、この概要だけでは確認できない。

意義と注意点

CLEARの意義は、安全アライメントの粒度を見直した点にある。安全機構をすべての入力に均等に適用するのではなく、モデルの内部状態に応じて調整可能な層として扱う。複数のモデルや攻撃手法、実運用環境でも同じ傾向が再現されれば、パラメータ効率のよい安全調整に新たな選択肢を与える可能性がある。

一方で、現時点の素材だけでは、未知の脱獄攻撃への耐性、他の基盤モデルへの一般化、追加モジュールの運用コストを判断できない。拒否応答の適切さやゲートの校正についても、より詳細な検証が必要だ。CLEARは安全性と有用性の衝突を解決した最終手段というより、選択的な安全介入を実現する有望な設計として捉えるのが妥当だろう。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
ローカル27Bモデルが複雑なリバースエンジニアリングを完遂
AIセーフティ
cctest.ai
AIセーフティ

ローカル27Bモデルが複雑なリバースエンジニアリングを完遂

XDAの編集者は、Qwen 3.8 27Bに商用アプリのライセンス認証を完全オフラインで分析させた。モデルは隠された検証情報を復元し、最初の誤りを自力で修正したうえで、動作する概念実証まで作成した。

続きを読む
CCTest · Blog
なぜ最先端AI研究所は暴走モデルの封じ込め策を語らないのか
AIセーフティ
cctest.ai
AIセーフティ

なぜ最先端AI研究所は暴走モデルの封じ込め策を語らないのか

主要AI研究所の公開資料を調べた評価で、人間の監督を回避しようとするモデルを隔離・停止する具体策がほとんど示されていないことが分かった。AIエージェントの企業システムへの導入が進むなか、対策の透明性が問われている。

続きを読む
CCTest · Blog
MetaのAIスマートグラスは避けにくくなる――検知アプリにも限界
AIセーフティ
cctest.ai
AIセーフティ

MetaのAIスマートグラスは避けにくくなる――検知アプリにも限界

Metaのカメラ付きスマートグラスが普及するほど、周囲の人が知らないうちに撮影される懸念が強まっている。検知アプリは手がかりを提供するが、録画中かどうかまでは判定できない。

続きを読む