返回文章列表
记忆与上下文

幻觉不只是“没记住”:研究揭示压缩也会损伤事实回忆

阅读约 3 分钟

导语

当语言模型回答事实问题时,研究者通常先问:它是否见过这条信息?如果没见过,模型只能依靠猜测,幻觉似乎可以归因于知识覆盖不足。但一篇发表于 arXiv 的新论文指出,即使事实曾被模型观察到,也不意味着它能被无误地保存和调用。有限的内部记忆容量,可能让事实在写入时就发生“有损压缩”。

核心要点

  • 错误被拆成两部分:论文考虑一个无结构问答任务,其中有 N 个可能的问题、K 个可能的答案。学习者观察到 M 条训练事实,再将它们压缩到最多 B 比特的记忆中,测试时不能调用外部检索。
  • 覆盖不足带来基础错误率:对于从未观察到的问题,模型没有对应事实,只能在 K 个答案中猜测。若答案均匀分布,这部分错误率由随机猜测决定。
  • 见过也可能记错:对于已经观察到的事实,若每条事实可分配的平均记忆预算不足,压缩后的表示可能无法保留精确答案。论文用均匀 K 元来源在零一损失下的逆率失真函数,刻画这种压缩失真。
  • 一个统一下界:研究给出总体错误率的下界,由“已覆盖事实的压缩失真”和“未覆盖事实的随机猜测错误”两项组成。随着事实数量增加,若有效记忆没有同步增长,新增知识可能不只是难以覆盖,也会加剧已存知识的近似化。
  • 进行了理论与模型探针:作者报告了由理论推导的模拟,以及在现代语言模型上的受控事实注入实验,改变事实负载和有效可训练记忆,以观察理论预测的变化。不过摘要没有提供足以概括具体模型性能的详细结果。

意义与影响

这项工作的价值,在于把“模型不知道”和“模型记得不够精确”区分开来。前者更像覆盖问题,适合通过扩大训练数据、引入检索或改善知识更新来缓解;后者则涉及记忆分配、参数容量和信息组织方式。单纯增加事实数量,未必会线性提升闭卷问答能力:当存储预算固定时,模型可能需要在更多事实之间分配有限空间。

这一视角也为系统设计带来几个问题。模型是否应优先保存高价值事实,而不是平均记忆所有内容?长上下文究竟是在扩充可用记忆,还是只是把压缩压力推迟到推理阶段?检索系统能否将未覆盖事实从内部记忆问题转化为访问问题?在不确定时明确拒答,是否比输出一个被压缩扭曲的答案更可靠?

需要注意的是,论文研究的是均匀、无结构的理论任务,且作者明确表示这并不是完整的幻觉理论。真实语言模型拥有语义结构、参数共享、上下文学习和外部工具,这些因素都可能改变理论下界的适用方式。因此,更合适的解读是:该研究提供了一个可分离的分析维度,提醒我们评估事实性时,不仅要测量模型是否接触过知识,也要测量它在有限记忆下能否无损保留知识。

来源:arXiv

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
BeaconKV:用“信标查询”压缩长推理模型的 KV 缓存
记忆与上下文
cctest.ai
记忆与上下文

BeaconKV:用“信标查询”压缩长推理模型的 KV 缓存

长链式推理会让大模型的 KV 缓存随序列长度持续膨胀,成为推理部署中的主要内存瓶颈。BeaconKV 通过保存少量代表全局查询模式的“信标查询”,预测哪些历史上下文可能被再次访问,在压缩缓存的同时尽量维持推理效果。

阅读全文
CCTest · Blog
混合语言模型中的分工:注意力负责回忆,递归状态决定表达
记忆与上下文
cctest.ai
记忆与上下文

混合语言模型中的分工:注意力负责回忆,递归状态决定表达

一项针对 Qwen3.5 和 Falcon-H1 的研究发现,混合语言模型中的 KV 缓存与固定大小递归状态承担着截然不同的任务。注意力更像事实查找表,而递归状态则决定模型接下来用什么语言、以何种 persona 作答。

阅读全文