返回文章列表
记忆与上下文

LatentPress:让大模型直接读取连续记忆,绕开文本重建

阅读约 3 分钟

导语

长上下文并不只是“把更多Token塞进窗口”这么简单。对话历史和长文档越长,推理时需要处理的输入越多,注意力计算、缓存占用和读取延迟也会随之增加。现有压缩方法通常把内容整理成可读摘要,或者渲染成图像后交给视觉模型处理,但这两条路径都要求模型进行额外的文本生成、OCR或视觉解码。

论文《LatentPress: Context Compression Beyond Text and Vision》提出了另一种接口:不把压缩结果写成人类可读的文本,而是直接生成一组连续的记忆Token,让冻结的语言模型通过输入嵌入接口读取这些Token。换言之,压缩器服务的对象不再是人,而是下游模型本身。

核心方法

LatentPress由一个与读取器匹配的轻量写入器组成。它将对话历史或长文档映射为连续向量,再以较短的记忆序列交给冻结解码器。推理阶段无需把记忆重新转换成文字,因此绕开了摘要遗漏、文本重建和OCR识别等环节。

论文强调,该方案只训练一个规模较小的适配器,参数量约为420万至2620万,相对于解码器约占0.1%。在不同设置下,系统支持约4至16倍压缩。写入一段对话的耗时为43毫秒;与原始上下文或缓存后的OCR方案相比,记忆Token的读取速度提升约5至9倍。论文还报告称,写入速度大约是文本摘要或OCR重建的一个数量级。

实验结果

  • 在LongMemEval上,压缩率约为7.70倍时,LatentPress达到0.504准确率,高于未压缩证据的0.490。
  • 文本摘要基线准确率为0.184,OCR压缩方案的结果介于0.426和0.312之间,具体取决于设置。
  • 在LongBench-QA中,域内写入器在4至8倍压缩下可以达到或超过原始上下文读取表现;压缩到16倍时,性能落后于原始上下文。
  • 两项迁移实验分别考察了从UltraChat到LongMemEval,以及从LongMemEval衍生问答到未见过的LongBench文档领域的零样本迁移,结果用于验证这种软Token接口并非只适用于单一数据集。

意义与限制

LatentPress的价值不只是压缩比例,而是重新定义了“上下文压缩结果应该长什么样”。摘要适合人类检查,图像适合跨模态传输,但对于本来就通过向量表示处理信息的语言模型,连续记忆可能是一条更直接的机器接口。它有望减少长历史问答、文档问答和记忆增强应用中的输入处理开销,也避免在每次读取时重复进行文本或图像重建。

不过,结果也说明压缩并非越激进越好。LongBench-QA中16倍压缩已经落后于原始上下文,表明记忆Token仍然受到信息瓶颈影响。与此同时,冻结解码器和读取器匹配意味着这类表示可能依赖具体模型接口;跨模型复用、可解释性、错误定位以及更复杂任务上的稳定性,仍需要进一步研究。因此,LatentPress更像是面向模型的上下文基础设施方向,而不是对摘要或检索系统的全面替代。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章