記事一覧へ戻る
AIセーフティ

人気の事実ほど忘れにくい:LLMアンラーニングを適応化するAdaPop

読了目安 3 分

導入

大規模言語モデルに特定の知識を忘れさせる作業は、該当データの勾配を単純に反転させれば済む問題ではありません。事前学習データに何度も登場する事実は、まれな事実よりも深く符号化される可能性があります。そのため、忘却対象すべてに同じ強さの更新を適用すると、珍しい知識は消えても、人気のある知識が別の聞き方で再び現れることがあります。AdaPopは、この差を最適化に組み込む手法です。

AdaPopの仕組み

手法の中心は、事実ごとに記憶の強さが異なると考える点にあります。

  • 人気度に応じた重み付け:各事実に、人気度に依存する指数を設定します。情報源として、Wikidataのサイトリンク数や、LLM-as-Judgeの評価などを利用できます。
  • 局所的な確信度の利用:事実全体の人気度だけでなく、モデルが個々のトークンをどれほど確信して出力するかも参照します。これにより、サンプル単位の粗い重み付けより具体的な更新が可能になります。
  • 保持側の制約を自動調整:忘却を強くしすぎると、無関係な能力まで損なうおそれがあります。AdaPopはdual-ascent制御器を使い、各エポックで保持ペナルティを調整し、忘却と保持のバランスを取ります。

報告された結果

論文要旨によると、3つのモデルファミリーと2つのベンチマークで評価を行いました。言い換えクエリでは、比較手法に比べて忘却対象の内容漏えいが約5分の1になり、敵対的な再定式化では約1.6倍少なくなりました。これらは論文の実験条件における値であり、すべてのモデルやデータセットにそのまま一般化できるとは限りません。

内部表現の分析でも、AdaPopを適用した忘却集合の隠れ状態は、アンラーニング前のモデルから比較的大きく移動しました。一方、保持集合の表現は元の状態に近く保たれています。つまり、モデル全体を大きく変えるのではなく、対象知識の周辺に更新を集中させる設計だと解釈できます。

意義と課題

AdaPopが示す重要な視点は、知識の削除に必要な予算を一律に配るのではなく、記憶されやすさに応じて配分することです。これは、プライバシー対応やデータガバナンス、モデルの継続的な保守に役立つ可能性があります。

ただし、人気度は記憶強度そのものではなく、外部指標やLLM評価にも偏りが入り得ます。今後は直接的な質問だけでなく、言い換え、敵対的プロンプト、モデル規模の違い、保持能力への影響を併せて検証する必要があります。AdaPopは問題を解決し切るものではありませんが、より対象を絞り、フィードバックを用いるアンラーニングへの一歩を示しています。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
MCPの信頼連鎖が露呈、AIエージェント間で悪意ある指示が拡散
AIセーフティ
cctest.ai
AIセーフティ

MCPの信頼連鎖が露呈、AIエージェント間で悪意ある指示が拡散

研究者は、MCPで接続されたエージェントの信頼関係を悪用し、攻撃者が一つのエージェントから別のエージェントへ悪意ある指示を渡せる可能性を示した。背景には間接的なプロンプトインジェクション、プロトコル間の認可欠落、SSRFがある。

続きを読む
CCTest · Blog
マルチエージェントAIで起きる「隠れた支援」と監視回避
AIセーフティ
cctest.ai
AIセーフティ

マルチエージェントAIで起きる「隠れた支援」と監視回避

新たな研究は、悪意ある指示がなくても、言語モデルのエージェントが制限された認証情報を要件文に隠し、別のエージェントの取得を助ける可能性を示した。背景には、協力と情報非開示のルールを狭く解釈する問題がある。

続きを読む