RAG 扩展性研究:为什么语料越大,BM25 越占优势
导语
在 RAG 系统中,检索环节到底该用传统 BM25、向量检索、图索引,还是让 Agent 自己逐步搜索?过去很多评测只在固定语料规模、不同数据集或不同设置下比较方法,很难回答一个更接近真实部署的问题:当语料库不断变大时,哪种范式的准确率、成本和延迟更能站得住?
论文《BM25 Wins at Scale》试图补上这一空白。研究团队在一个受控设置中,把语料规模划分为 28 个严格嵌套层级,整体跨度约 450 倍,同时保持问题集合以及一组固定的相关文档和对抗文档不变。这样一来,变量主要集中在“语料变大”本身,而不是数据集差异。
核心要点
- 没有绝对赢家,只有规模相关的交叉点。 在最小的共享语料层级上,File-System Agent 表现领先。它可以像浏览文件系统一样顺序探索,有一定推理和路径选择能力。
- Agent 的成本随规模暴露。 在基础语料层级,File-System Agent 消耗的查询 token 是其他方案的 39 倍;随着搜索空间扩大,顺序探索越来越难覆盖足够多的候选内容,效果也开始下降。
- BM25 在约 1000 万语料 token 附近反超。 研究显示,当语料增长到这一量级后,BM25 超过 File-System Agent,并在之后所有更大的共享层级保持领先;到最大规模时,领先幅度接近 20 个百分点。
- BM25 也是低成本 Pareto 前沿的重要锚点。 它不需要基于 LLM 的构建过程,索引和查询成本相对可控,因此在准确率与成本之间形成了很强的实用平衡。
- 稠密检索效率不错但准确率不足。 向量检索在效率上仍有吸引力,但在该研究的共享设置下,整体准确率没有超过 BM25。
- 图式 RAG 面临构建瓶颈。 图索引方案在部署规模前可能遭遇构建成本墙;即便采用可扩展变体,在共享层级上也未能超过 BM25。
意义与影响
这项研究的重要性不在于简单宣称“BM25 打败一切”,而在于提醒 RAG 系统设计者:规模会改变方法之间的优劣关系。小语料下,Agent 式搜索可以通过局部探索和推理获得优势;但当语料库增大,系统更需要一种能在全局范围内快速排序候选文档的机制。
对工程团队而言,结论很直接:在没有充分证据前,不应轻易把复杂 Agent、图索引或昂贵构建流程当成默认方案。BM25 这类词法检索虽然传统,却在大规模、低成本、可部署性方面仍然非常有竞争力。更现实的架构可能不是“用 Agent 取代检索”,而是先用 BM25 等方法完成高召回候选发现,再让 Agent 或读者模型在更小范围内推理、重排和生成答案。
因此,这篇论文给 RAG 领域带来的启发是:评测不应只看单点准确率,还要看语料增长后的成本曲线、延迟和构建门槛。对于真实世界的知识库问答、企业搜索和长尾文档检索,扩展性本身就是能力的一部分。
评论
正在确认登录状态……
正在加载评论……