返回文章列表
AI 智能体

Iris:用“爬升式”训练把搜索智能体推向更难的问题

阅读约 2 分钟

导语

搜索型智能体的难点,不只是找到一条相关网页,而是能够拆解问题、沿着多个实体和链接逐步检索,并在有限上下文中保留真正有用的证据。论文《Iris: Climbing to the Search Frontier》提出 Iris-mini 与 Iris-pro,试图从数据构造、训练流程和推理管理三个层面提升这类能力。

核心方法

  • 从网页结构反向构造任务。 研究团队以网页及其出链为基础,提炼实体图并设计多跳关系。题目中的非答案实体会被改写成描述性指代,避免模型仅靠实体名称或字符串匹配猜答案。
  • 筛掉“模型不需要搜索”的问题。 只有当参考模型无法闭卷回答、但在获得支持证据后能够解决的问题,才会被纳入数据集。这让任务更接近真实的信息检索场景。
  • 轨迹与轮次双重过滤。 生成的搜索过程会先经过轨迹级筛选,再进行单轮操作级筛选,之后用于监督微调。模型随后在在线搜索环境中接受强化学习,奖励判断器和观察摘要器都部署在训练集群内。
  • SFT-RL 交替“爬升”。 每轮强化学习得到的高难度、已解决且更高效的轨迹,会回流到下一轮监督训练。相比只进行一次 SFT 或持续采样 RL,这种循环试图不断抬高可学习任务的难度,同时保留有效的搜索行为。
  • 把上下文当作推理能力的一部分。 对过长的搜索过程,系统会在请求级别中断,并从已提交的前缀继续下一步。评测同时比较启用和关闭上下文管理的结果,并固定工具、上下文限制与评判器,减少变量干扰。

结果与意义

论文报告称,在启用上下文管理时,Iris-mini 在 BrowseComp、BrowseComp-ZH、DeepSearchQA 和 HLE 上的成绩分别为 82.2、84.8、86.9 和 52.3;Iris-pro 的对应成绩为 88.6、85.1、92.9 和 56.4。所有结果都来自单一 ReAct 智能体,没有使用子智能体或测试时验证。

这项工作的价值首先在于,它把搜索智能体训练从“给模型配一个搜索工具”推进到对任务难度、轨迹质量和上下文状态进行系统设计。其次,实验提醒开发者:在多跳检索中,如何压缩、保留和恢复观察结果,可能与模型规模本身同样重要。不过,现有材料主要呈现论文所报告的基准结果,实际部署中的成本、延迟和对搜索工具变化的适应性仍需进一步观察。研究团队计划发布模型权重以及数据构造、训练和评测的完整流程,这将有助于社区复现和检验这些结论。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章