人気の事実ほど忘れにくい:LLMアンラーニングを適応化するAdaPop
導入
大規模言語モデルに特定の知識を忘れさせる作業は、該当データの勾配を単純に反転させれば済む問題ではありません。事前学習データに何度も登場する事実は、まれな事実よりも深く符号化される可能性があります。そのため、忘却対象すべてに同じ強さの更新を適用すると、珍しい知識は消えても、人気のある知識が別の聞き方で再び現れることがあります。AdaPopは、この差を最適化に組み込む手法です。
AdaPopの仕組み
手法の中心は、事実ごとに記憶の強さが異なると考える点にあります。
- 人気度に応じた重み付け:各事実に、人気度に依存する指数を設定します。情報源として、Wikidataのサイトリンク数や、LLM-as-Judgeの評価などを利用できます。
- 局所的な確信度の利用:事実全体の人気度だけでなく、モデルが個々のトークンをどれほど確信して出力するかも参照します。これにより、サンプル単位の粗い重み付けより具体的な更新が可能になります。
- 保持側の制約を自動調整:忘却を強くしすぎると、無関係な能力まで損なうおそれがあります。AdaPopはdual-ascent制御器を使い、各エポックで保持ペナルティを調整し、忘却と保持のバランスを取ります。
報告された結果
論文要旨によると、3つのモデルファミリーと2つのベンチマークで評価を行いました。言い換えクエリでは、比較手法に比べて忘却対象の内容漏えいが約5分の1になり、敵対的な再定式化では約1.6倍少なくなりました。これらは論文の実験条件における値であり、すべてのモデルやデータセットにそのまま一般化できるとは限りません。
内部表現の分析でも、AdaPopを適用した忘却集合の隠れ状態は、アンラーニング前のモデルから比較的大きく移動しました。一方、保持集合の表現は元の状態に近く保たれています。つまり、モデル全体を大きく変えるのではなく、対象知識の周辺に更新を集中させる設計だと解釈できます。
意義と課題
AdaPopが示す重要な視点は、知識の削除に必要な予算を一律に配るのではなく、記憶されやすさに応じて配分することです。これは、プライバシー対応やデータガバナンス、モデルの継続的な保守に役立つ可能性があります。
ただし、人気度は記憶強度そのものではなく、外部指標やLLM評価にも偏りが入り得ます。今後は直接的な質問だけでなく、言い換え、敵対的プロンプト、モデル規模の違い、保持能力への影響を併せて検証する必要があります。AdaPopは問題を解決し切るものではありませんが、より対象を絞り、フィードバックを用いるアンラーニングへの一歩を示しています。
コメント
ログイン状態を確認中…
コメントを読み込み中…