返回文章列表
RAG 与检索

UNREAL:让同一个模型同时做好检索与长上下文筛选

阅读约 3 分钟

导语

检索增强生成(RAG)和长上下文推理通常被视为两条不同的技术路线:前者从庞大语料库中找出相关文档,后者则把尽可能多的内容直接放进模型上下文。但二者其实都在解决同一个问题——从大量信息中挑出真正有用的证据。论文《UNREAL: Unifying Retrieval and Long-Context with a Single Model》提出,能否让同一个模型内部机制覆盖这两种场景。

核心方法

UNREAL的全称是“用单一模型统一检索与长上下文”。它使用一个冻结的大语言模型,对文本块进行编码,并直接从模型内部表示中产生检索查询。新增的可训练参数少于50万,主干模型保持不变,因此其设计重点不是重新训练一个大型检索器,而是让已有语言模型具备模型原生的证据选择能力。

这一机制可以作用于两个层面:在整个语料库中挑选相关文本块,或在一个超长提示中删除干扰内容,再将筛选后的证据交给模型生成答案。换言之,UNREAL试图把“检索”和“上下文压缩”看成同一类选择任务,而不是分别依赖外部向量模型和长上下文模型。

实验结果

论文在一个包含约30亿词元、2100万个文本块的Wikipedia索引上进行评估。四种采用稠密或混合架构的UNREAL方案都超过了现有检索器加重排器系统。最佳结果中:

  • HotpotQA的召回率由49.1%提升至73.2%;
  • 2WikiMultiHopQA由31.7%提升至60.1%;
  • MuSiQue由8.8%提升至14.4%。

同一套选择模块也被用于长上下文任务。在最大128K上下文长度下,NoLiMa准确率从1.0%提升至24.83%;在256K长度的LV-Eval上,F1分数由49.97%提升至54.66%。此外,相比完整上下文推理,UNREAL大约从32K token开始减少计算量和首 token 延迟,且上下文越长,收益越明显。

意义与局限

UNREAL的价值不只是刷新几个检索指标,更在于提供了一种统一视角:RAG中的文档检索、长提示中的证据筛选,可能都可以由语言模型自身的内部表示驱动。若这一思路能够在更多模型和任务上稳定复现,未来的长上下文系统或许不必盲目扩大输入,而是先由模型选择高价值信息。

不过,现有材料主要展示了论文报告的基准结果,尚不足以判断其在不同领域语料、实时更新知识和复杂生产系统中的表现。证据选择本身也可能漏掉低频但关键的信息,因此实际部署仍需要关注召回覆盖、错误筛选和额外索引成本。总体而言,UNREAL展示了连接检索与长上下文推理的一条有吸引力的路径。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章