返回文章列表
RAG 与检索

RAG 扩展性研究:为什么语料越大,BM25 越占优势

阅读约 3 分钟

导语

在 RAG 系统中,检索环节到底该用传统 BM25、向量检索、图索引,还是让 Agent 自己逐步搜索?过去很多评测只在固定语料规模、不同数据集或不同设置下比较方法,很难回答一个更接近真实部署的问题:当语料库不断变大时,哪种范式的准确率、成本和延迟更能站得住?

论文《BM25 Wins at Scale》试图补上这一空白。研究团队在一个受控设置中,把语料规模划分为 28 个严格嵌套层级,整体跨度约 450 倍,同时保持问题集合以及一组固定的相关文档和对抗文档不变。这样一来,变量主要集中在“语料变大”本身,而不是数据集差异。

核心要点

  • 没有绝对赢家,只有规模相关的交叉点。 在最小的共享语料层级上,File-System Agent 表现领先。它可以像浏览文件系统一样顺序探索,有一定推理和路径选择能力。
  • Agent 的成本随规模暴露。 在基础语料层级,File-System Agent 消耗的查询 token 是其他方案的 39 倍;随着搜索空间扩大,顺序探索越来越难覆盖足够多的候选内容,效果也开始下降。
  • BM25 在约 1000 万语料 token 附近反超。 研究显示,当语料增长到这一量级后,BM25 超过 File-System Agent,并在之后所有更大的共享层级保持领先;到最大规模时,领先幅度接近 20 个百分点。
  • BM25 也是低成本 Pareto 前沿的重要锚点。 它不需要基于 LLM 的构建过程,索引和查询成本相对可控,因此在准确率与成本之间形成了很强的实用平衡。
  • 稠密检索效率不错但准确率不足。 向量检索在效率上仍有吸引力,但在该研究的共享设置下,整体准确率没有超过 BM25。
  • 图式 RAG 面临构建瓶颈。 图索引方案在部署规模前可能遭遇构建成本墙;即便采用可扩展变体,在共享层级上也未能超过 BM25。

意义与影响

这项研究的重要性不在于简单宣称“BM25 打败一切”,而在于提醒 RAG 系统设计者:规模会改变方法之间的优劣关系。小语料下,Agent 式搜索可以通过局部探索和推理获得优势;但当语料库增大,系统更需要一种能在全局范围内快速排序候选文档的机制。

对工程团队而言,结论很直接:在没有充分证据前,不应轻易把复杂 Agent、图索引或昂贵构建流程当成默认方案。BM25 这类词法检索虽然传统,却在大规模、低成本、可部署性方面仍然非常有竞争力。更现实的架构可能不是“用 Agent 取代检索”,而是先用 BM25 等方法完成高召回候选发现,再让 Agent 或读者模型在更小范围内推理、重排和生成答案。

因此,这篇论文给 RAG 领域带来的启发是:评测不应只看单点准确率,还要看语料增长后的成本曲线、延迟和构建门槛。对于真实世界的知识库问答、企业搜索和长尾文档检索,扩展性本身就是能力的一部分。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章