IterSynth:让深度搜索智能体分工规划与综合
导语
深度搜索并不只是让大模型多搜几次网页。面对复杂问题,智能体需要拆解任务、判断还缺什么信息、选择下一步查询,并把分散证据组织成可靠答案。现有 ReAct 式系统通常让同一个策略同时完成这些工作,搜索轮次增加后,完整历史也会不断堆积,重要线索容易被噪声淹没。IterSynth 试图从“如何分工”和“如何保存状态”两方面重新设计这一流程。
核心思路:两个角色,一个共享模型
IterSynth 不采用两个完全独立的模型,而是让同一套参数在两个角色之间交替切换:
- Planner:读取当前的紧凑状态,识别尚未解决的信息需求,生成下一条子查询;
- Synthesizer:检查新获得的证据,将有用内容整合进不断演化的摘要中。
在这种循环里,摘要不再只是搜索结束后的压缩产物,而是贯穿整个过程的持久状态。下一轮规划主要依赖重建后的有限工作区,而不是完整保留所有搜索轨迹。这样既降低了上下文长度带来的干扰,也让规划与证据综合这两类能力在流程层面得到区分。
RDPO:让训练信号对应具体角色
仅改变提示流程并不足以保证长程搜索稳定运行。为此,研究者提出 Role-Decoupled Policy Optimization(RDPO)。该方法在最终答案奖励之外加入逐轮的评价标准,并分别针对 Planner 和 Synthesizer 计算组内相对优势。换言之,某一轮查询是否有效、某次摘要更新是否改善了状态,可以获得更贴近自身职责的反馈,而不必完全由最终答案成败来承担信用分配。
实验结果与解读
在 GAIA text-only、xBench、BrowseComp 及 BrowseComp-ZH 等长程搜索任务上,IterSynth-8B 的平均得分为 50.7,较此前最强的 8B 级智能体高 4.2 个百分点。训练消融显示,SFT 得分为 44.1,加入仅基于结果的 GRPO 后升至 48.9,采用 RDPO 后达到 50.7。研究还报告称,替换掉未经训练的 Planner 会造成明显性能下降,说明角色分工本身并不是简单的提示包装。
工程层面,摘要驱动的有限上下文使搜索轮次从 12 次以上减少到约 7—8 次,耗尽上下文的比例低于 5%,相较等价的双模型部署,推理时间降低约 13%—15%。此外,IterSynth 也可以作为与模型无关的提示范式,在 Claude-4.5-Opus 和 DeepSeek-V3.1 上相对 ReAct 获得零样本增益。
意义与局限
IterSynth 的价值不只在于提高一个 8B 模型的分数,更在于提出了一种可复用的智能体状态管理方式:把搜索记忆从“完整轨迹”转成“可持续修订的工作摘要”。这可能有助于构建更节省上下文、更容易训练和部署的研究型智能体。不过,摘要本身也可能丢失细节或引入错误,因此摘要质量、证据可追溯性以及在更多任务上的稳定性,仍是后续评估重点。
评论
正在确认登录状态……
正在加载评论……