RAG索引扩容后答案为何变了?一项面向兼容性的重复审计
检索增强生成(RAG)系统通常被视为“模型加上外部知识库”。当知识库扩容或重新索引时,用户往往期待系统只是获得更多证据,已有问题的答案应当保持基本稳定。然而,一篇发表于 Hugging Face Daily Papers 的研究显示,事实并非如此:在模型标识、提示词、检索策略、证据数量、输出渲染方式以及暴露出来的生成参数都不变的情况下,仅仅扩大索引,就可能让同一个问题得到不同答案。
研究者把这种现象称为“准确率盲区中的答案 churn”。它之所以容易被忽略,是因为准确率只统计答对或答错。一次更新可能让部分问题变对,也让另一部分问题变错,最终总体分数几乎不变,但用户实际看到的答案已经发生了变化。同时,生成模型本身就可能在同一快照下重复回答不一致,因此简单比较更新前后各跑一次,会把普通随机性误判成索引更新的影响。
研究的核心方法是“快照兼容性审计”(Snapshot Compatibility Audit):
- 在同一数据快照上重复生成,测量系统固有的重复分歧;
- 在索引扩容前后进行交叉比较,测量总的答案变化;
- 用跨快照分歧减去同快照重复分歧,估计由语料或索引变化带来的额外 churn;
- 同时采用标准化精确匹配和盲语义判断,避免只依赖字符串是否完全相同。
在预注册的400道 Natural Questions 实验中,研究者将冻结的 FineWeb 前缀从1个分片扩展到7个分片。结果显示,标准化精确匹配口径下的额外 churn 为6.44个百分点,盲语义口径下为10.25个百分点,但精确匹配准确率只下降1.50个百分点。进一步的事后分析发现,有40道题出现了重复运行仍然稳定、但跨快照发生语义翻转的情况。另一个预注册的200题 TriviaQA实验得到规模较小但方向一致的 churn;值得注意的是,其精确匹配准确率变化方向相反。使用第二个 DeepSeek 生成器和另一套服务配置进行的100题结果盲后验复现实验,也观察到8.75个百分点的语义额外 churn,即使精确匹配准确率反而上升了3个百分点。
这项工作并不是在证明索引扩容必然损害性能,而是在提醒工程团队重新定义“兼容更新”。对于问答产品、评测基准和需要稳定输出的智能体,准确率提升并不能保证旧答案不会被悄然改写。未来的 RAG 发布流程应把快照、检索结果、答案差异和重复稳定性纳入回归测试,并将“效用”与“答案兼容性”作为两类并列指标。只有这样,系统才能在获得新知识的同时,清楚说明哪些既有回答发生了变化,以及这些变化是否值得接受。
评论
正在确认登录状态……
正在加载评论……