AREX-2:让智能体在长周期迭代中持续变强
导语:从“一次作答”走向持续改进
许多大语言模型智能体能够生成答案,却未必擅长在获得反馈后持续修正。AREX-2关注的正是这一差距:智能体能否在测试阶段反复检查、修改并执行方案,最终得到明显优于初始版本的结果。研究团队将这种能力称为“自我提升”,并认为它并不是单一技巧,而是由两项相互补充的能力构成。
两个关键能力
- 反思能力:识别当前方案中的问题,提出比现有解更好的版本。
- 长周期执行能力:在多轮迭代中保持目标、利用新反馈,并让后续行动真正建立在前一轮结果之上。
只有反思而没有长期执行,智能体可能提出改进意见,却无法把改进落实到底;只有执行而缺少有效反思,多轮操作也可能变成重复劳动。AREX-2的核心假设是,这两种能力具有一定的跨领域特征,因此不必完全依赖目标应用场景本身来学习。
训练思路:选择可验证、能奖励持续迭代的任务
为获得适合监督的训练数据,研究团队从机器学习和算法编程两个领域合成长周期改进轨迹。这些任务通常能够提供较明确的反馈或评价结果,方便判断一次修改是否真的带来提升,也更适合记录“尝试—执行—检查—再改进”的连续过程。
研究结果显示,基于Qwen3.8-27B构建的AREX-2智能体在MLE-bench Lite上获得81.8分,在Frontier-CS上获得70.7分。更值得关注的是,它没有局限在训练数据对应的技术任务中:在深度研究相关评测中,BrowseComp、HLE、GAIA和DeepSearchQA的成绩分别为84.0、52.6、92.2和93.8。摘要还指出,随着可用迭代轮次增加,系统仍能继续提升,而不是很快进入停滞状态。
意义与局限
AREX-2提供了一条不同于单纯扩大模型规模的路径:通过构造“长期改进轨迹”,把模型训练重点从一次性生成答案,转向管理连续的问题解决过程。如果这一思路能够在更多任务上稳定迁移,未来智能体或许能更好地处理需要多次实验、验证和修订的工作。
不过,现有素材主要披露了研究假设、训练领域和基准结果,尚未提供完整的轨迹构造细节、对照实验、成本分析及各轮次的具体曲线。因此,AREX-2的效果究竟来自反思数据、长周期训练,还是两者的组合,仍需要结合论文全文和代码进一步判断。
评论
正在确认登录状态……
正在加载评论……