返回文章列表
记忆与上下文

EngramEdit:让大语言模型的事实知识可独立更新

阅读约 3 分钟

导语

大语言模型的知识更新,通常意味着重新训练、微调,或修改模型内部的大量参数。这样做不仅成本高,也容易牵一发而动全身:模型学会新事实的同时,可能忘记旧知识,甚至损害原有的通用能力。EngramEdit 关注的是另一条路径——把事实知识更多地放进条件记忆中,再只修改这部分记忆,而不是动 Transformer 主干。

条件记忆为何适合知识编辑

DeepSeek Engram 等架构会根据输入中的 n-gram,检索对应的学习型嵌入,并将其提供给语言模型。与把所有知识都压缩进主干参数相比,这种设计可以用较少的额外计算扩展模型容量,也为“知识存储”和“通用推理”解耦提供了可能。

但知识编辑并不是简单地改一个向量。表达同一事实的不同句子,可能触发不同的 n-gram;另一方面,一个 n-gram 嵌入又可能被多个事实共享。直接更新某个嵌入,容易让目标事实改变,却同时扰动其他预测。如何覆盖多种表达,并控制共享参数的副作用,是条件记忆编辑的关键难题。

EngramEdit 的方法

EngramEdit 分为两个主要步骤:

  • 首先,针对需要更新的事实,计算能够让模型输出新答案的目标记忆表示,并在多个表达方式上共同考虑,而不是只优化单个提示。
  • 随后,联合调整相关的共享 n-gram 嵌入,使它们在不同表达和不同编辑任务中接近目标表示。
  • 对复用频率较高的嵌入施加更强的更新惩罚,尽量避免改动会扩散到无关事实。

这种设计的核心不是寻找一个孤立的“知识参数”,而是把不同输入表达背后的共享记忆结构一起纳入编辑过程。它因此更接近对条件记忆接口进行定向更新。

实验与意义

论文报告称,EngramEdit 在目标事实编辑上取得接近完全的成功率。更新后的事实不仅能被模型用于未见过的表达,还能支持多跳推理;在链式思维提示下,其准确率接近最强基线的三倍。随着事实更新累积,模型的无关知识和一般能力总体上仍得到较好保留。

这项工作的重要价值,在于重新定义了“更新模型知识”的位置:如果事实存储确实可以与主干计算分开,那么未来的模型维护可能不必反复改动完整参数,而可以围绕一层相对独立、可追踪的条件记忆展开。对于需要持续修正事实、维护领域信息或管理模型版本的系统,这种思路具有潜在吸引力。

不过,现有材料主要呈现了方法与实验结论,尚不足以说明其在更大规模、更多类型事实或长期连续编辑中的全部表现。共享嵌入的保护策略能否在复杂知识网络中持续避免干扰,也仍需要更广泛的验证。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章