返回文章列表
AI 智能体

让终端智能体持续进阶:环境演化如何补上训练难题

阅读约 3 分钟

导语

终端智能体要真正完成软件操作、文件处理和多步骤命令执行,训练环境必须既可交互,又能可靠验证结果。问题在于,随着模型变强,简单的合成任务很快失去挑战性;如果环境难度停留不变,强化学习得到的反馈就会越来越有限。来自腾讯混元团队的论文提出“环境演化”,试图让训练环境像课程一样,随模型能力持续升级。

核心方法

传统的环境合成通常从零开始生成任务。对能力较强的模型而言,这些任务可能过于容易,无法暴露新的薄弱点。近期的协同演化方法会根据模型的在线 rollout 结果,生成接近当前可学习边界的环境,但它受制于 on-policy 数据:环境生成依赖当前策略,泛化能力和持续供给学习信号的能力都可能受到限制。

论文的关键思路是把环境升级从当前策略的在线反馈中部分抽离出来,采用 off-policy 的方式逐步增加难度,并在训练过程中按代次安排这些环境。作者从多轮学习目标出发,归纳出三种会影响环境难度的演化方向,再通过一个经过循环设计的多智能体 harness 执行环境修改与生成。这样,环境不再是一次性产物,而是能够围绕任务结构和交互过程逐代变化的训练资源。

具体而言,这套方法关注的不只是任务是否完成,还关注多轮交互中的行动链、验证条件和整体解决过程。环境演化因此可以被理解为一种面向长程任务的“课程学习”:先保留可验证的任务目标,再逐步增加完成目标所需的推理、操作与协调成本。

实验结果

论文使用 Hy4 preview、Claude Opus 5 和 GPT-5.6 Sol 进行定量 rollout,结果显示,经过演化的环境能够稳定地产生更高难度的任务。随后,作者在 Qwen3.6-27B 与 Qwen3.6-35B-A3B 上进行简单的长程强化学习训练,并在 Terminal-Bench 2.1 上分别取得 14.4 和 18.0 个百分点的性能提升。

需要注意的是,这些结果说明环境演化有助于训练和基准表现,并不意味着所有终端任务都能自动获得同等收益。环境的可验证性、演化方向是否覆盖真实失败模式,以及生成任务与实际使用场景之间的差距,仍然是落地时需要检验的问题。

意义与影响

这项工作的价值在于,它把终端智能体训练的重点从“增加任务数量”推进到“持续管理任务难度”。对于长程强化学习而言,模型越强,越需要能够同步升级的环境,否则训练很容易陷入低信息反馈。将环境按代次组织、并通过多智能体工具链进行演化,也为构建更大规模的可验证交互训练体系提供了一个方向。

更广泛地看,未来终端智能体的竞争不只取决于模型参数或上下文长度,也取决于能否建立覆盖生成、验证、难度控制和训练调度的环境基础设施。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章