返回文章列表
模型评测

Agentic RAG评测如何花预算:多测问题优于反复重跑

阅读约 3 分钟

导语

Agentic RAG 的评测并不只是“跑一次、算一个准确率”。一个系统可以在同一道题上执行多条搜索轨迹,也可以对同一条轨迹重复生成答案,还可以把有限预算用于覆盖更多问题。三种做法都会消耗模型 token 和调用费用,但它们对评测稳定性与结论泛化性的贡献并不相同。

来自 Carnegie Mellon University 的这项研究,围绕问题数量、搜索轨迹数量和重复读取次数,分析 Agentic RAG 评测应该如何分配预算。研究在 HotpotQA 和 MuSiQue 上采用检索—反馈比较设置,并从分配精度、读取效率及成本边界等角度进行考察。

核心发现

  • 扩大问题覆盖更能降低估计误差。 在约 3414 万至 3439 万模型 token 的预算区间内,相比把预算用于五次重复读取,覆盖更多问题可将标准误降低 33%;相比使用三条搜索轨迹,标准误降低 12.6%。这说明,当目标是估计系统的整体表现时,增加样本问题往往比在少数问题上反复运行更划算。
  • 预算规划可以被较早预测。 研究使用归档的嵌套预测和仅基于问题的预测,对最终预算分配进行预估,误差分别控制在 4.0% 和 3.5% 以内。不过,深度子集分析没有显示:在完成两条轨迹审计之后,继续增加预测深度能带来明确优势。
  • 单次读取未必明显吃亏。 在相同 token 预算下,与拟合出的最优方案相比,只读取一次产生的方差惩罚为 0 至 9.9%。但这一结果存在较大的 Pro 不确定性,因此不能简单推广为“重复读取没有价值”。
  • 成本结论取决于费用结构。 按记录的模型费用计算,当搜索价格为每 1000 次请求 0 至 1 美元时,增加问题数量优于增加搜索轨迹。至于扩大问题数和增加重复读取谁更便宜、更值得,研究尚未给出确定排序。
  • 温度零提升了结果一致性。 将温度设为零后,答案分歧率从 14.3% 降至 3.4%,但比较精度大致相近。这意味着确定性解码可以减少噪声,却不必然提高比较本身的辨别能力。

意义与局限

这项工作给评测工程带来的直接启示是:如果预算有限,优先扩大问题覆盖通常是更稳健的起点;只有在问题数量已经足够,或研究特别关注搜索策略的稳定性时,才有理由把更多资源投向多轨迹或重复读取。与此同时,预算规划并非只能依赖完整实验,早期的嵌套预测或问题级预测也可能帮助研究者提前决定资源分配。

不过,结论应被理解为特定数据集、比较设置和费用假设下的经验结果,而不是所有 Agentic RAG 系统的通用定律。尤其是问题与重复读取之间的费用排名尚未解决,Pro 相关方差估计也存在不确定性。未来评测仍需结合任务难度、模型价格、解码随机性以及系统实际使用目标,设计更细粒度的预算策略。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章