返回文章列表
AI 智能体

IterSynth:让深度搜索智能体分工规划与综合

阅读约 3 分钟

导语

深度搜索并不只是让大模型多搜几次网页。面对复杂问题,智能体需要拆解任务、判断还缺什么信息、选择下一步查询,并把分散证据组织成可靠答案。现有 ReAct 式系统通常让同一个策略同时完成这些工作,搜索轮次增加后,完整历史也会不断堆积,重要线索容易被噪声淹没。IterSynth 试图从“如何分工”和“如何保存状态”两方面重新设计这一流程。

核心思路:两个角色,一个共享模型

IterSynth 不采用两个完全独立的模型,而是让同一套参数在两个角色之间交替切换:

  • Planner:读取当前的紧凑状态,识别尚未解决的信息需求,生成下一条子查询;
  • Synthesizer:检查新获得的证据,将有用内容整合进不断演化的摘要中。

在这种循环里,摘要不再只是搜索结束后的压缩产物,而是贯穿整个过程的持久状态。下一轮规划主要依赖重建后的有限工作区,而不是完整保留所有搜索轨迹。这样既降低了上下文长度带来的干扰,也让规划与证据综合这两类能力在流程层面得到区分。

RDPO:让训练信号对应具体角色

仅改变提示流程并不足以保证长程搜索稳定运行。为此,研究者提出 Role-Decoupled Policy Optimization(RDPO)。该方法在最终答案奖励之外加入逐轮的评价标准,并分别针对 Planner 和 Synthesizer 计算组内相对优势。换言之,某一轮查询是否有效、某次摘要更新是否改善了状态,可以获得更贴近自身职责的反馈,而不必完全由最终答案成败来承担信用分配。

实验结果与解读

在 GAIA text-only、xBench、BrowseComp 及 BrowseComp-ZH 等长程搜索任务上,IterSynth-8B 的平均得分为 50.7,较此前最强的 8B 级智能体高 4.2 个百分点。训练消融显示,SFT 得分为 44.1,加入仅基于结果的 GRPO 后升至 48.9,采用 RDPO 后达到 50.7。研究还报告称,替换掉未经训练的 Planner 会造成明显性能下降,说明角色分工本身并不是简单的提示包装。

工程层面,摘要驱动的有限上下文使搜索轮次从 12 次以上减少到约 7—8 次,耗尽上下文的比例低于 5%,相较等价的双模型部署,推理时间降低约 13%—15%。此外,IterSynth 也可以作为与模型无关的提示范式,在 Claude-4.5-Opus 和 DeepSeek-V3.1 上相对 ReAct 获得零样本增益。

意义与局限

IterSynth 的价值不只在于提高一个 8B 模型的分数,更在于提出了一种可复用的智能体状态管理方式:把搜索记忆从“完整轨迹”转成“可持续修订的工作摘要”。这可能有助于构建更节省上下文、更容易训练和部署的研究型智能体。不过,摘要本身也可能丢失细节或引入错误,因此摘要质量、证据可追溯性以及在更多任务上的稳定性,仍是后续评估重点。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
AI 智能体团队开始学习“如何协作”,而不只是各自思考
AI 智能体
cctest.ai
AI 智能体

AI 智能体团队开始学习“如何协作”,而不只是各自思考

一项关于 Self-Organizing Agent Teams 的研究显示,固定成员的智能体团队可以从少量协作经验中学习角色分工、对话阶段和信息流组织方式。在数学与物理任务上,这种自组织协作明显超过单个最强智能体及理想化答案路由器。

阅读全文