返回文章列表
RAG 与检索

AutoIndex:把“文档如何入库”变成可学习的检索优化问题

阅读约 2 分钟

导语

在 RAG 和企业搜索系统中,很多优化精力通常放在更强的向量模型、更复杂的重排器,或少量固定的 chunk 大小、重叠窗口等参数上。论文 AutoIndex: Learning Representation Programs for Retrieval 则把问题前移:检索质量不只取决于“怎么搜”,也取决于“文档以什么形态被索引”。

AutoIndex 的核心观点是,文档表示不应被视为上线前一次性决定的预处理配置,而应成为可以根据验证反馈持续优化的对象。

核心要点

  • 学习“表示程序”而非单纯调参:AutoIndex 将原始文档到索引内容的转换过程定义为可执行程序。这些程序可以对文档进行切片、信息增强、归一化、重加权或重组,再交给检索系统索引。
  • 检索器保持固定:实验中 BM25 在所有任务里保持不变,研究重点不是换模型,而是验证索引前的文档表示是否能单独带来收益。
  • 验证集驱动搜索:每轮迭代中,智能体会分析当前程序造成的检索失败,合成候选更新,并在重新建索引后用验证指标筛选。只有能改善检索质量的更新才会被保留。
  • 覆盖异构任务:作者在 CRUMB 基准的 8 个检索任务上评估 AutoIndex。相较于“整篇文档直接用 BM25 建索引”的静态基线,学习到的程序在所有任务上都提高了 Recall@100。

结果与意义

论文报告称,AutoIndex 平均带来 +8.4% Recall@100+8.3% nDCG@10 的提升;单项任务最大提升分别达到 +30.5% Recall@100+43.6% nDCG@10。这些数字的关键在于:它们不是通过替换 BM25、加入新重排器或引入更强语义模型得到的,而是来自文档进入索引前的表示学习。

这对 RAG 工程有直接启发。许多系统的瓶颈并非总在生成模型或向量检索本身,而可能藏在文档组织方式里。例如长文档是否应该拆成主题段、表格和标题是否需要额外展开、不同字段是否应被赋予不同权重,这些都可能显著影响召回与排序。

当然,AutoIndex 仍需要验证集、重复建索引和候选程序评估,实际成本取决于语料规模和任务稳定性。但它提出了一个值得关注的方向:把“索引设计”从人工经验工程,推进到由任务反馈驱动的自动化优化流程。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章