返回文章列表
代码智能体

LEGO-RL:让编码智能体在原生运行框架中完成强化学习

阅读约 3 分钟

导语

让大模型学会写代码,难点并不只在于生成一段正确代码。真实的编码智能体通常运行在较长流程中,需要调用终端、读取仓库、执行测试、接收反馈,甚至在上下文过长时进行压缩。这样的原生Harness更接近实际产品,却不天然适配策略梯度强化学习:环境可能崩溃,奖励可能被投机利用,训练器看到的动作概率也可能与推理时的真实行为脱节。

LEGO-RL的目标,是在不修改Harness内部控制流的情况下,把这些原生运行流程接入可扩展的强化学习训练。研究团队使用GSPO训练稀疏混合专家模型Qwen3.5-35B-A3B,并在三种编码智能体Harness上进行验证。

核心要点

  • 用进程内代理对齐训练与执行。 LEGO-RL将LLM调用代理置于Harness进程内部,捕获原始生成流,让训练侧能够进行更细粒度的token级对齐和对数概率重算。即使Harness对上下文进行了压缩或重新序列化,训练器仍可基于更接近实际生成过程的信息完成优化。
  • 用沙箱编排提升执行可靠性。 框架支持可扩展的沙箱调度、镜像缓存和分阶段防护,意在降低环境故障对结果信号的污染,并减少智能体通过特殊行为获取虚假奖励的空间。
  • 把训练过程变得可观测。 集成插件能够自动完成验证与监控,Live UI则用于查看更细粒度的轨迹信息,帮助研究者定位工具调用、执行结果和奖励之间的问题。
  • 跨Harness取得提升。 在SWE-bench Verified上,OpenHands SDK的成绩由64.0%提升至70.4%,Claude Code由62.4%提升至68.2%,OpenCode由57.2%提升至66.6%。

意义与影响

这项工作的重要性不只是给出一个新的训练组件,而是把“模型策略优化”和“智能体运行时”视为一个需要共同校准的系统。对于编码任务而言,模型输出往往只是长链路中的一步;如果训练阶段忽略Harness的上下文管理、工具协议和异常处理,离线得到的策略未必能在真实环境中复现。

LEGO-RL的思路是尽量保留原生Harness的行为,再从代理、沙箱和观测层补齐强化学习所需的接口。这种方式有望降低将研究模型接入不同编码框架的改造成本,也为比较不同Harness对训练效果的影响提供统一基础。不过,现有素材主要披露了总体设计和三组结果,尚不足以判断各组件的独立贡献、训练成本以及对更多任务和模型的泛化能力。其实际价值仍需要更完整的实验细节和社区复现进一步验证。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章