分割LLM学習で返送勾配が誘導データを無効化
導入
分割型LLM学習は、入力テキストをローカルに残したまま、モデルの一部をクラウドで実行する方式だ。一般的なプライバシー評価では、クラウドへ送る活性値から元の文章を復元できるか、つまり前向き通信が主な検査対象になる。しかし今回のシステムセキュリティ研究は、逆向き通信にあたる「返送勾配」が、入力の内容だけでなく、どの行が実データなのかという構造まで露呈させると指摘した。
漏えいの仕組み
対象の構成は、損失関数を保持する信頼ローカルノード(TLN)と、計算を担う非信頼クラウドノード(UCN)でできている。TLNは保護した活性値を送り、UCNはモデル計算後の出力を返す。TLNはローカルで損失から出力勾配を計算し、その勾配を再びクラウドへ送る。
匿名集合を広げるため、送信フレームには実データの行と合成した誘導行が混在する。ところが損失関数が誘導行を参照しない場合、それらの勾配は単に小さいのではなく、正確にゼロになる。クラウドは返送テンソルのゼロと非ゼロのパターンを読むだけで、実データが入っている行を判別できる。内容を隠すための仕組みが、行の識別情報を別の通信経路から与えてしまう形だ。
実験結果
- 評価手順は事前に固定され、既知の強度で漏えい信号を注入するテストによって、測定器が実際の漏えいを検出できることを確認した。
- 9個のシードで、各フレームの実データ行を毎回特定し、1回あたり4096件中4096件を識別した。
- フレーム内容への攻撃では、一定値を推測する基準より、100トークンあたり約1トークン多く復元した。改善幅は0.65〜1.50ポイントだった。
- ラベルをシャッフルした対照実験では復元が起きず、評価器が常に漏えいを報告しているわけではないことを示した。
- モデル品質を予算内に保つ構成でも同じ現象が観測され、実用性のない設定だけの問題ではなかった。
特に重要なのは評価結果の違いだ。前向きチャネルだけを対象にすると、システムはプライバシーと品質の両方の検査を通過した。返送勾配を含めると、同じプライバシー検査に失敗した。活性値だけを監査する評価は、通信全体の安全性を保証しない。
対策と意味
各勾配行をクリッピングし、誘導行も含めてノイズを加えると、検証されたゼロ値の漏えいは、留保データの交差エントロピー約0.01 natのコストで閉じられた。ただし、これは完全な安全性を意味しない。勾配には入力やラベルに関する情報が残り得るほか、複数ステップにわたる統計的な追跡によって、実データと誘導データを分離できる可能性もある。
分割学習のプライバシー境界は、原文がローカル外へ出たかどうかだけでなく、双方向のテンソル、マスク処理、ゼロ値の分布、そしてステップ間の相関まで含めて設計すべきだ。誘導データは、実データと同じように計算へ参加させるか、その勾配の構造を適切に隠さなければ、匿名化ではなく識別信号になり得る。
コメント
ログイン状態を確認中…
コメントを読み込み中…