AREX:让深度研究智能体在验证中递归改进
导语
深度研究类智能体正在从“多搜几轮资料”走向“会不会自我修正”。BAAI 等作者在论文 AREX: Towards a Recursively Self-Improving Agent for Deep Research 中提出的 AREX,正是围绕这一问题展开:当一个研究任务同时包含多个约束时,智能体不应只依赖更长的搜索链路,而应在研究过程中不断验证、暴露缺口,并用这些缺口指导下一步行动。
这篇工作的关键观察是“发现—验证不对称”:找到一个同时满足所有条件的答案可能很昂贵,但验证一个候选答案是否满足某项约束,往往可以拆成更可控的检查步骤。AREX 试图把这种不对称转化为智能体能力,让模型在长程研究中形成递归式自我改进。
核心要点
- 内外双循环架构:AREX 包含内层研究循环和外层自我改进循环。内层负责检索、收集证据并形成临时答案;外层则对答案进行按约束审计,找出尚未解决的声明、证据缺口或错误方向。
- 从“继续搜索”变成“定向修补”:传统深度搜索智能体容易在庞大信息空间中继续扩散。AREX 的外层审计会把问题重新组织为更具体的后续研究目标,使下一轮搜索更聚焦于未满足约束。
- 自主上下文更新工具:长程任务会产生大量交互历史,直接保留全部上下文既昂贵又容易干扰推理。AREX 学习一种无需外部模型的上下文更新工具,将历史压缩为紧凑的改进状态,保留已验证证据和未解决约束。
- 面向长程学习的训练设计:论文提到,AREX 通过已验证的合成任务、高质量轨迹进行 agentic mid-training,并结合长程强化学习。为缓解最终奖励稀疏问题,训练过程强调那些获得决定性证据或纠正错误研究方向的关键步骤。
- 不同规模模型实例化:作者实例化了一个 dense 4B 模型和一个 122B-A10B 的混合专家模型,并已公开模型权重,同时提供在线应用入口。
意义与影响
AREX 的价值不只在于“让智能体搜索更久”,而在于把研究过程显式拆成可验证、可追踪、可回溯的状态演化。对于复杂问答、竞品调研、文献综述、事实核查等任务,这类框架有望减少长程推理中的漂移:智能体不再把临时答案当成终点,而是把它当作下一轮审计和修正的起点。
同时,AREX 对上下文管理的强调也很重要。随着智能体任务跨度变长,瓶颈不只是模型能力,还包括“哪些信息应该被留下、以什么形式留下”。将历史压缩为包含证据和约束的改进状态,可能比单纯扩大上下文窗口更接近可持续的长程智能体路线。
不过,从公开摘要看,论文没有在素材中给出完整指标细节,因此仍需结合原文评估其在 BrowseComp、WideSearch、DeepSea 等基准上的具体表现,以及递归改进在真实开放研究场景中的稳定性。总体而言,AREX 代表了深度研究智能体的一个清晰趋势:从搜索驱动,转向验证驱动、状态驱动的自我改进。
评论
正在确认登录状态……
正在加载评论……