記事一覧へ戻る
AIセーフティ

人気の事実ほど忘れにくい:LLMアンラーニングを適応化するAdaPop

読了目安 3 分

導入

大規模言語モデルに特定の知識を忘れさせる作業は、該当データの勾配を単純に反転させれば済む問題ではありません。事前学習データに何度も登場する事実は、まれな事実よりも深く符号化される可能性があります。そのため、忘却対象すべてに同じ強さの更新を適用すると、珍しい知識は消えても、人気のある知識が別の聞き方で再び現れることがあります。AdaPopは、この差を最適化に組み込む手法です。

AdaPopの仕組み

手法の中心は、事実ごとに記憶の強さが異なると考える点にあります。

  • 人気度に応じた重み付け:各事実に、人気度に依存する指数を設定します。情報源として、Wikidataのサイトリンク数や、LLM-as-Judgeの評価などを利用できます。
  • 局所的な確信度の利用:事実全体の人気度だけでなく、モデルが個々のトークンをどれほど確信して出力するかも参照します。これにより、サンプル単位の粗い重み付けより具体的な更新が可能になります。
  • 保持側の制約を自動調整:忘却を強くしすぎると、無関係な能力まで損なうおそれがあります。AdaPopはdual-ascent制御器を使い、各エポックで保持ペナルティを調整し、忘却と保持のバランスを取ります。

報告された結果

論文要旨によると、3つのモデルファミリーと2つのベンチマークで評価を行いました。言い換えクエリでは、比較手法に比べて忘却対象の内容漏えいが約5分の1になり、敵対的な再定式化では約1.6倍少なくなりました。これらは論文の実験条件における値であり、すべてのモデルやデータセットにそのまま一般化できるとは限りません。

内部表現の分析でも、AdaPopを適用した忘却集合の隠れ状態は、アンラーニング前のモデルから比較的大きく移動しました。一方、保持集合の表現は元の状態に近く保たれています。つまり、モデル全体を大きく変えるのではなく、対象知識の周辺に更新を集中させる設計だと解釈できます。

意義と課題

AdaPopが示す重要な視点は、知識の削除に必要な予算を一律に配るのではなく、記憶されやすさに応じて配分することです。これは、プライバシー対応やデータガバナンス、モデルの継続的な保守に役立つ可能性があります。

ただし、人気度は記憶強度そのものではなく、外部指標やLLM評価にも偏りが入り得ます。今後は直接的な質問だけでなく、言い換え、敵対的プロンプト、モデル規模の違い、保持能力への影響を併せて検証する必要があります。AdaPopは問題を解決し切るものではありませんが、より対象を絞り、フィードバックを用いるアンラーニングへの一歩を示しています。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
MetaのAIスマートグラスは避けにくくなる――検知アプリにも限界
AIセーフティ
cctest.ai
AIセーフティ

MetaのAIスマートグラスは避けにくくなる――検知アプリにも限界

Metaのカメラ付きスマートグラスが普及するほど、周囲の人が知らないうちに撮影される懸念が強まっている。検知アプリは手がかりを提供するが、録画中かどうかまでは判定できない。

続きを読む
CCTest · Blog
Claudeのネット接続が示したAI評価環境の盲点
AIセーフティ
cctest.ai
AIセーフティ

Claudeのネット接続が示したAI評価環境の盲点

Anthropicは過去141006回の評価実行を監査し、隔離されたはずの環境からモデルが公開インターネットへ到達した3件の事例を確認した。背景には、モデル単体の異常というより、出口制御と監視、評価環境の設計不備がある。

続きを読む
CCTest · Blog
Bounded Agents:マルチエージェントの委任権限を制御するAPC
AIセーフティ
cctest.ai
AIセーフティ

Bounded Agents:マルチエージェントの委任権限を制御するAPC

「Bounded Agents」は、委任された権限や予算、過去の行動を追跡するAgentic Principal Chain(APC)を提案します。モデルの判断だけに依存せず、複数の正当な操作が危険な結果につながるケースを外部の認可層で抑制します。

続きを読む