QwenGyre:为超长程智能体训练解决 GPU 空转与轨迹冗余
导语
当智能体从一次问答走向代码仓库修改、复杂任务执行等长流程工作时,在线强化学习面临的瓶颈不再只是模型推理速度。一次 rollout 可能持续数小时,包含数百次模型—环境交互,并产生接近 1M token。执行时长的巨大波动,会让训练集群出现 GPU 等待;而任务中的分支路径又可能反复探索相似过程,进一步推高数据处理和训练成本。
Qwen 团队在论文中提出 QwenGyre,目标是为这类 extreme-long(xlong)horizon 任务提供端到端在线强化学习框架。它试图同时处理资源利用率和轨迹效率两个问题,而不是单纯增加算力或缩短单次推理时间。
核心要点
- 弹性调配 rollout 与训练资源。 QwenGyre 可以在采样和参数训练之间动态重新分配 GPU,且不需要中断正在执行的任务。这样一来,当部分 rollout 因环境交互变慢时,空闲资源仍有机会投入训练环节。
- 处理非线性分支历史。 框架中的轨迹处理器会重建分支执行历史,使不同路径之间的关系能够被纳入后续处理,而不是简单把每条路径视作互不相关的样本。
- 利用部分进展信号。 对尚未完整结束的执行过程进行进展评分,有助于从长任务中提取更细粒度的训练信息,降低完全依赖最终结果的限制。
- 去除重复路径。 通过识别并删除冗余轨迹,QwenGyre 试图控制训练数据规模,避免复杂分支导致样本数量失控。
实验结果与意义
论文报告称,在 Qwen 3.8 2.4T、每次 rollout 约 700K token 的设置下,QwenGyre 经过 48 个步骤训练后,将 NL2RepoBench 的结果从 52.5% 提升到 58.5%,即绝对提升 6 个百分点。针对不同训练数据领域的评估还显示,该框架相较 Colocate 的最高加速比为 1.85 倍,相较 Async 的最高加速比为 1.78 倍。
这些结果说明,超长程智能体的强化学习效率不仅取决于模型本身,也取决于执行系统如何管理不确定的任务时长,以及如何将复杂轨迹转化为可训练数据。QwenGyre 的价值在于把调度、轨迹重建、进展评分和去重放进同一套流程中,为代码代理等需要长期交互的应用提供了一个系统层面的优化方向。
不过,现有素材主要给出了框架概览和汇总结果,尚不足以判断不同组件各自的贡献、额外调度开销或在更多模型与任务上的稳定性。因此,这些加速和性能提升应理解为论文所报告设置下的结果,而不是对所有 xlong 任务的普遍保证。
评论
正在确认登录状态……
正在加载评论……