ブラックボックスLLMを操る制御付きデコード攻撃の実像
大規模言語モデルの安全性は、危険な依頼に対して適切に拒否できるかどうかで評価されることが多い。しかし、Hugging Face Daily Papers で紹介された本研究は、より見えにくい攻撃面に注目した。モデルの重み、ロジット、トークン確率を取得できず、生成されたテキストだけが返るインターフェースでも、生成の軌跡を間接的に変えられるのかを検討している。
テキストだけでも残る情報
従来の制御付きデコード攻撃は、次のトークンの確率分布を直接参照することが多い。確率が分かれば、望ましい方向へ生成を進めやすいトークンを選べる。一方、一般的なAPIは内部の数値を公開せず、サンプリングされた文章だけを返す。複数回の出力から分布を推定する方法は考えられるものの、サンプル数が有限なら推定は疎でノイズも多い。さらに、生成の各位置で同じ処理を繰り返すと、問い合わせコストが大きくなる。
研究チームの観察では、成功する越獄の軌跡で大きな分布変化が起きる位置は、すべての生成位置ではなく一部に集中している可能性がある。そこで、各位置を均等に分析するのではなく、応答の接頭辞から介入の必要性を判断し、重要そうな地点にだけコストを配分する。
提案手法の三つの要素
- サンプルベースの分布再構成:複数の出力サンプルを集約し、観測されなかった候補の行動には事前分布を組み合わせる。目的は完全な確率分布の復元ではなく、制御に使える近似信号を得ることだ。
- リスクゲート付き残差制御:生成中の応答接頭辞を見ながら、分布の再構成と変更を行うべき位置を選ぶ。影響が小さいと判断した位置では、追加処理を避ける。
- 複数トークンの推測実行:まず候補となる接頭辞をまとめて生成し、対象モデルで検証する。介入が不要な部分をそのまま受け入れることで、対象モデルへの呼び出しを実質的に分散させる。
この設計の意義は、語彙全体の確率を正確に再現することから、生成軌跡を変え得る局所的な判断点を探すことへ重点を移した点にある。
評価と防御への示唆
素材によれば、評価は4つの対象エンドポイントと3つのベンチマークで行われ、多くの比較で最高の平均スコアを得た。ただし、具体的なエンドポイント名、成功率、問い合わせ回数は示されていない。そのため、すべてのモデルやAPIに同じ効果があると結論づけることはできない。
防御側にとっては、反復サンプリングの異常な利用、アシスタント接頭辞を使う継続要求、複数ターンにまたがる出力の変化を監視する必要性が示される。単発の拒否テストだけでなく、適応的なブラックボックス照会や生成過程への介入も安全評価に含めるべきだろう。確率を非公開にするだけでは、モデルの挙動に関する情報を完全に隠せない可能性がある。
コメント
ログイン状態を確認中…
コメントを読み込み中…