返回文章列表
AI 智能体

AREX-2:让智能体在长周期迭代中持续变强

阅读约 2 分钟

导语:从“一次作答”走向持续改进

许多大语言模型智能体能够生成答案,却未必擅长在获得反馈后持续修正。AREX-2关注的正是这一差距:智能体能否在测试阶段反复检查、修改并执行方案,最终得到明显优于初始版本的结果。研究团队将这种能力称为“自我提升”,并认为它并不是单一技巧,而是由两项相互补充的能力构成。

两个关键能力

  • 反思能力:识别当前方案中的问题,提出比现有解更好的版本。
  • 长周期执行能力:在多轮迭代中保持目标、利用新反馈,并让后续行动真正建立在前一轮结果之上。

只有反思而没有长期执行,智能体可能提出改进意见,却无法把改进落实到底;只有执行而缺少有效反思,多轮操作也可能变成重复劳动。AREX-2的核心假设是,这两种能力具有一定的跨领域特征,因此不必完全依赖目标应用场景本身来学习。

训练思路:选择可验证、能奖励持续迭代的任务

为获得适合监督的训练数据,研究团队从机器学习和算法编程两个领域合成长周期改进轨迹。这些任务通常能够提供较明确的反馈或评价结果,方便判断一次修改是否真的带来提升,也更适合记录“尝试—执行—检查—再改进”的连续过程。

研究结果显示,基于Qwen3.8-27B构建的AREX-2智能体在MLE-bench Lite上获得81.8分,在Frontier-CS上获得70.7分。更值得关注的是,它没有局限在训练数据对应的技术任务中:在深度研究相关评测中,BrowseComp、HLE、GAIA和DeepSearchQA的成绩分别为84.0、52.6、92.2和93.8。摘要还指出,随着可用迭代轮次增加,系统仍能继续提升,而不是很快进入停滞状态。

意义与局限

AREX-2提供了一条不同于单纯扩大模型规模的路径:通过构造“长期改进轨迹”,把模型训练重点从一次性生成答案,转向管理连续的问题解决过程。如果这一思路能够在更多任务上稳定迁移,未来智能体或许能更好地处理需要多次实验、验证和修订的工作。

不过,现有素材主要披露了研究假设、训练领域和基准结果,尚未提供完整的轨迹构造细节、对照实验、成本分析及各轮次的具体曲线。因此,AREX-2的效果究竟来自反思数据、长周期训练,还是两者的组合,仍需要结合论文全文和代码进一步判断。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
用户改主意后,LLM Agent 为什么还在执行旧指令?
AI 智能体
cctest.ai
AI 智能体

用户改主意后,LLM Agent 为什么还在执行旧指令?

一项新研究将“意图漂移”定义为可测量的多轮交互失败:用户已经撤回或修改的要求,仍会影响模型回答和工具操作。研究者提出 IntentFlux 基准与 StateForge 方法,显示显式维护当前状态能够改善表现,但无法完全弥合单轮任务与多轮对话之间的差距。

阅读全文