返回文章列表
AI 智能体

DeepSearch-World:可验证环境如何让搜索代理自我进化

阅读约 2 分钟

导语

这项工作聚焦的是一个老问题:工具使用型代理如何真正从自己的经验中变强。传统监督微调依赖固定的教师轨迹,更新快但上限受限;强化学习虽然允许试错,但在长链路网页任务里,稀疏奖励往往很难提供足够清晰的学习信号。DeepSearch-World 的思路,是先把“搜索”这件事放进一个确定性、可复现、可验证的环境里,再让代理在这个环境中进行自蒸馏式进化。

核心要点

  • DeepSearch-World 是训练底座:它把搜索与页面阅读工具做成可复现流程,便于判断代理每一步是否朝正确方向前进。
  • 数据规模明确:环境包含 420K 个多跳问答任务,这些任务来自实体级随机游走构造。
  • 支持自我改进所需的行为:论文强调了进度验证、基于事实的反思以及失败恢复等能力,这些都是长链路代理能否持续进化的关键。
  • DeepSearch-Evolve 是训练策略:它并不是一次性微调,而是反复执行轨迹生成、过滤、数据混合和再训练,让模型逐步吸收更优经验。
  • 结果具有参考价值:在没有借助更强模型蒸馏的前提下,DeepSearch-World-9B 在 BrowseComp、GAIA 和 HotpotQA 上分别达到 31.2%61.5%93.4%

这项工作的意义

这篇论文的重要性在于,它把“会不会自我提升”这个问题,从模糊的开放环境,转移到了一个更可控的验证场景中。对网页代理来说,真正难的不是偶尔答对,而是在长任务里知道自己走偏了、能否及时回退、能否根据证据修正搜索路径。DeepSearch-World 的价值就在于把这些能力纳入训练闭环,让模型不只是模仿答案,而是学习如何持续逼近答案。

从研究角度看,这也回应了当前两个瓶颈:一是纯监督学习依赖高质量轨迹,二是稀疏奖励难以支撑长程决策。可验证环境提供了介于两者之间的路径:既保留试错空间,又能让轨迹质量被可靠筛选。论文还计划开源环境、训练池、验证集、模型与代码,这会降低后续研究自改进搜索代理的门槛。

Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章