返回文章列表
强化学习

Agent Lightning v1.0:让强化学习真正适配智能体运行框架

阅读约 2 分钟

导语

当大语言模型开始调用搜索、终端或代码执行工具时,模型本身只是智能体的一部分。真正决定它如何观察环境、组织上下文、选择下一步动作的,往往是外部的 agent harness,也就是智能体运行框架。Agent Lightning v1.0关注的正是一个容易被忽略的问题:如果训练阶段与部署阶段使用同一套框架,强化学习应该如何接入?

核心要点

  • 训练对象从模型扩展到运行框架。 论文将这种范式称为“harnessed agentic RL”。与传统智能体强化学习由训练引擎控制环境循环不同,这里由部署时的 harness 负责工具调用和流程推进,训练器只观察一连串 LLM 请求—响应记录。
  • 代理式架构降低了接入门槛。 Agent Lightning通过LLM端点代理,将任意智能体框架与强化学习训练连接起来。这样,原本已经用于实际部署的智能体,不必大幅改写交互逻辑,就有机会进入后训练流程。
  • 工程细节会直接影响训练效果。 请求与响应如何重新分词、多个调用如何合并成样本、奖励如何分配到不同调用、损失如何归一化,以及训练后端如何调度,都会影响稳定性和效率。论文指出,这些问题在现有框架中往往没有被充分说明。
  • 实现强调轻量和可复现。 Agent Lightning v1.0约由3500行代码构成,支持通用智能体框架,并覆盖指令跟随、搜索和编程智能体场景。针对代码智能体,作者还提供了数据清洗流程与完整训练脚本。

实验结果与意义

在编程智能体实验中,研究者使用6000个训练样本和相对有限的计算资源,对Qwen3.5-9B进行强化学习。模型在SWE-bench Verified上的成绩由41.8%提升到56.4%,绝对提升14.6个百分点。这个结果的重点不仅在于分数提升,也在于它展示了较小规模数据和较轻量基础设施支持代码智能体强化学习的可能性。

更重要的是,Agent Lightning把“智能体框架如何参与训练”从实现细节提升为独立研究问题。未来,智能体能力的提升可能不只依赖更大的基础模型,也取决于训练系统能否准确理解多轮工具调用、动态上下文和复杂控制流。该框架提供了一个相对简洁的实验入口,有助于研究者比较不同样本组织和训练调度策略。不过,现有材料主要介绍框架设计与代表性结果,尚不足以说明其在所有任务、模型和运行框架上的普适表现。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
SAF-OPD:让强化学习与在线蒸馏更稳定地合流
强化学习
cctest.ai
强化学习

SAF-OPD:让强化学习与在线蒸馏更稳定地合流

SAF-OPD 关注一个训练大模型时常见但容易被低估的问题:可验证奖励强化学习与在线蒸馏各有优势,简单相加却可能让训练提前失去探索能力。论文提出的 SAF 通过调节教师信号的强度与时机,在数学推理和代码生成任务中带来更稳定的收益。

阅读全文