返回文章列表
AI 智能体

OpenForgeRL:把真实 Agent Harness 接进端到端强化学习训练

阅读约 2 分钟

导语

Agent 的能力越来越依赖“推理 harness”:它们负责多轮对话、工具调用、状态管理,以及与外部系统交互。Claude Code、Codex、OpenClaw 这类系统展示了强大的工程能力,但也带来一个训练难题:现有开源 SFT/RL 框架通常擅长处理相对标准的模型输入输出,却很难原生表达有状态、多进程、带工具和环境交互的完整推理流程。

OpenForgeRL 关注的正是这个断点。它不是重新发明一个 Agent harness,而是让研究者可以在原本真实使用的 harness 和环境里,对 Agent 做端到端训练。

核心要点

  • 训练与推理解耦:OpenForgeRL 用一个轻量代理接管 harness 发起的模型调用,同时把这些调用记录成可供标准 RL 代码库使用的训练数据,例如接入 veRL。
  • 环境隔离与规模化 rollout:框架引入 Kubernetes 编排器,让每次 rollout 运行在独立远程容器中。这样,不同任务、工具链、浏览器或桌面环境可以被更安全地并行管理。
  • 面向真实 harness:论文强调“harness-native”训练,即不要求研究者把 Codex、OpenClaw 或 GUI Agent 的复杂流程重写成简化模拟器,而是在部署时使用的推理结构上直接收集轨迹、更新模型。
  • 覆盖多类 Agent 场景:验证范围包括工具/Claw 型 Agent,以及多模态 GUI、浏览器和电脑使用 Agent。OpenForgeClaw 在 ClawEval 上达到 31.7 pass^3、55.9 pass@3,在 QwenClawBench 上达到 33.7;OpenForgeGUI 在 OSWorld-Verified、Online-Mind2Web、WebVoyager 上分别达到 37.7、63.0、72.3。

意义与影响

OpenForgeRL 的价值不只在分数。它把 Agent 训练从“离线模仿一个理想流程”推进到“在真实 harness 中学习行为”。这对研究 Agent 的可靠性尤其重要,因为很多关键能力并不只由底座模型决定,还由工具选择、调用顺序、自检策略和环境反馈共同塑造。

论文还指出,不同 harness 的可学习性差异明显;强化学习能提升自我验证、工具覆盖率和多步计划完成度,但错误恢复等关键能力仍然薄弱。这意味着 OpenForgeRL 更像是一块基础设施:它降低了开放社区训练真实 Agent 的门槛,也让研究者有机会系统比较 harness 设计、训练算法与环境复杂度之间的关系。

对于开源 Agent 生态来说,这类框架的意义在于把“会用提示词驱动工具”进一步推向“能在实际工具链中被训练和改进”。如果后续代码、任务和复现实验足够开放,它可能成为连接 Agent 产品形态与 RL 研究栈的重要中间层。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章