返回文章列表
AI 智能体

Agentic ESOpt:用进化策略降低长程智能体微调门槛

阅读约 3 分钟

导语

随着语言模型从单轮问答走向多步骤任务,智能体需要持续规划、调用工具并根据环境反馈调整行为。交互轮数增加后,任务轨迹往往更加分支化,奖励却可能只在最终结果处出现。这使得传统基于反向传播的智能体强化学习面临新的工程与算法压力。论文《Agentic ESOpt》提出,进化策略(Evolution Strategies,ES)或许能成为长程智能体微调的另一条路径。

核心要点

  • 从梯度优化转向参数空间搜索。 传统强化学习通常依赖反向传播,需要在训练过程中保存大量中间状态和梯度信息。Agentic ESOpt则围绕当前语言模型参数采样扰动,让不同参数版本分别以推理方式运行,再利用任务奖励评估这些候选版本。
  • 以轨迹奖励驱动参数更新。 方法对候选扰动的结果进行奖励加权,并在线更新当前参数。其关键思路不是逐步拆解长轨迹中的每个动作,而是直接观察完整轨迹对参数扰动的反馈,从而避免随着任务变长而不断细化奖励归因。
  • 降低大模型全参数微调的显存门槛。 论文强调,ES只需要接近推理阶段的显存使用方式,却可以进行全参数优化。这里的优势主要体现在训练内存形态,而不意味着计算成本自动消失:候选模型需要反复执行任务,采样效率和推理预算仍是重要问题。
  • 支持参数与上下文共同演化。 由于ES通过较轻量的黑盒反馈接口工作,它可以与提示词、技能描述以及测试时计算等策略组合。Agentic ESOpt因此被设计为参数空间和上下文空间协同调整的框架,而不是只修改模型权重。

意义与待验证问题

这项工作的价值在于重新审视长程智能体后训练的优化对象。强化学习擅长利用可微训练体系之外的任务奖励,但在长轨迹、稀疏反馈和大模型规模同时出现时,反向传播管线可能成为瓶颈。ES把问题改写为“哪些参数扰动带来了更好的完整任务结果”,在信用分配上更直接,也更容易接入外部评测器或复杂工具环境。

不过,这种路线并非没有代价。黑盒搜索通常需要大量候选评估;当单次任务本身很长时,重复推理可能带来显著时间和算力开销。与此同时,轨迹级归因虽然避免了逐步信用分配,也可能提供较粗粒度的优化信号。现有素材主要介绍方法动机与框架设计,未披露具体基准、性能提升幅度或与其他方法的详细对比,因此暂时更适合将其看作一种面向长程智能体的训练范式探索,而不是已经被全面验证的替代方案。

如果后续实验能够证明其在更大模型、复杂工具链和更长任务上的稳定性,ES有望成为强化学习之外的一种补充,尤其适合显存受限、奖励函数以黑盒形式存在的智能体训练场景。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章