返回文章列表
AI 安全

事实越流行,模型越难忘掉:AdaPop让LLM卸载更有针对性

阅读约 2 分钟

导语

让大语言模型“忘记”指定知识,并不是简单地把相关参数往相反方向更新。模型对在预训练数据中反复出现的事实通常形成更牢固的表征,因此,同样的梯度压力对热门事实和冷门事实未必有效。论文《The More Popular, The Harder to Forget》提出 AdaPop,试图把“事实有多流行”纳入知识卸载过程。

核心方法

AdaPop的出发点是区分不同事实的记忆难度,而不是对整个遗忘集采取统一处理:

  • 引入流行度信号:方法为每个事实估计一个与流行度相关的指数。该信号可以来自外部代理,例如 Wikidata 的站点链接数量,也可以借助 LLM-as-Judge 等方式获得。
  • 结合局部置信度:除了事实层面的流行度,AdaPop还观察模型在局部令牌上的置信度,使遗忘目标能够更贴近具体输出,而非只依赖样本级别的粗粒度权重。
  • 动态调节保留约束:遗忘不应以破坏无关能力为代价。论文使用 dual-ascent 控制器,在每个训练周期调整保留惩罚,自动寻找忘记目标与保留目标之间的平衡。

实验观察

根据论文摘要,AdaPop在三个模型家族、两个基准上的测试中,相比其他方法,在改写查询下使被遗忘内容的泄漏量约降低至原来的五分之一;面对更具挑战性的对抗性改写,泄漏量约降低至原来的六成多。这里的结果针对论文所报告的实验设置,不能直接视为对所有模型和数据集的普遍保证。

内部表征指标也提供了另一角度:使用 AdaPop 后,遗忘集隐藏状态相较卸载前模型移动得更远,而保留集表示仍然保持接近。这说明该方法的目标并非让模型整体发生剧烈变化,而是尽量把更新集中在需要删除的知识上。

意义与局限

AdaPop的重要启发在于,知识卸载可能需要“按记忆难度分配预算”。流行度并不等同于事实重要性,也不一定能完美反映模型内部的记忆强度;外部代理和 LLM 评估本身还可能带来偏差。因此,未来评估不能只看标准提示是否失效,还应覆盖释义、对抗改写、不同模型规模以及保留能力变化。

如果这一思路得到进一步验证,知识卸载或许会从统一的参数修正,转向更细粒度、更具反馈控制的安全维护流程。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章