OpenForgeRL:把真实 Agent Harness 接进端到端强化学习训练
导语
Agent 的能力越来越依赖“推理 harness”:它们负责多轮对话、工具调用、状态管理,以及与外部系统交互。Claude Code、Codex、OpenClaw 这类系统展示了强大的工程能力,但也带来一个训练难题:现有开源 SFT/RL 框架通常擅长处理相对标准的模型输入输出,却很难原生表达有状态、多进程、带工具和环境交互的完整推理流程。
OpenForgeRL 关注的正是这个断点。它不是重新发明一个 Agent harness,而是让研究者可以在原本真实使用的 harness 和环境里,对 Agent 做端到端训练。
核心要点
- 训练与推理解耦:OpenForgeRL 用一个轻量代理接管 harness 发起的模型调用,同时把这些调用记录成可供标准 RL 代码库使用的训练数据,例如接入 veRL。
- 环境隔离与规模化 rollout:框架引入 Kubernetes 编排器,让每次 rollout 运行在独立远程容器中。这样,不同任务、工具链、浏览器或桌面环境可以被更安全地并行管理。
- 面向真实 harness:论文强调“harness-native”训练,即不要求研究者把 Codex、OpenClaw 或 GUI Agent 的复杂流程重写成简化模拟器,而是在部署时使用的推理结构上直接收集轨迹、更新模型。
- 覆盖多类 Agent 场景:验证范围包括工具/Claw 型 Agent,以及多模态 GUI、浏览器和电脑使用 Agent。OpenForgeClaw 在 ClawEval 上达到 31.7 pass^3、55.9 pass@3,在 QwenClawBench 上达到 33.7;OpenForgeGUI 在 OSWorld-Verified、Online-Mind2Web、WebVoyager 上分别达到 37.7、63.0、72.3。
意义与影响
OpenForgeRL 的价值不只在分数。它把 Agent 训练从“离线模仿一个理想流程”推进到“在真实 harness 中学习行为”。这对研究 Agent 的可靠性尤其重要,因为很多关键能力并不只由底座模型决定,还由工具选择、调用顺序、自检策略和环境反馈共同塑造。
论文还指出,不同 harness 的可学习性差异明显;强化学习能提升自我验证、工具覆盖率和多步计划完成度,但错误恢复等关键能力仍然薄弱。这意味着 OpenForgeRL 更像是一块基础设施:它降低了开放社区训练真实 Agent 的门槛,也让研究者有机会系统比较 harness 设计、训练算法与环境复杂度之间的关系。
对于开源 Agent 生态来说,这类框架的意义在于把“会用提示词驱动工具”进一步推向“能在实际工具链中被训练和改进”。如果后续代码、任务和复现实验足够开放,它可能成为连接 Agent 产品形态与 RL 研究栈的重要中间层。
评论
正在确认登录状态……
正在加载评论……