返回文章列表
AI 智能体

NexForge:用需求驱动的任务合成扩展 LLM Agent 能力

阅读约 3 分钟

导语

LLM Agent 的能力提升,越来越取决于是否有足够多、足够真实、且可执行的训练任务。NexForge 这篇论文关注的正是这个瓶颈:现有许多数据合成方法往往绑定在特定工具、代码仓库、技能图谱或预设环境上。这样做虽然便于验证,却会带来明显成本——每扩展一个领域都要重新搭建底层“素材场”,任务分布也容易反映工具和环境本身的偏差,而不是真实用户需求。

NexForge 的思路是把起点从“有什么工具可用”改为“需要训练什么能力”。它以高层能力需求为输入,自动合成多样化、可执行的 Agent 任务,并生成专家执行轨迹,用于监督微调等后训练流程。

核心要点

  • 需求驱动,而非基底驱动:NexForge 不把任务生成绑定到某个固定仓库、工具集或技能图谱,而是先分析现实需求,形成代表性场景和任务画像。
  • 分布感知的任务编译:框架会根据能力覆盖与任务分布生成具体任务指令,尽量避免合成数据只围绕少数环境或模板打转。
  • 自动补齐执行环境:对每个任务指令,NexForge 会自动检索或构建所需文件、依赖和运行配置,使任务不只是文本描述,而是可运行、可验证的环境。
  • 生成专家轨迹用于训练:框架还会合成专家 rollout,产出可用于 SFT 的训练轨迹,帮助模型学习长程操作和工具使用过程。
  • 实验结果指向规模效应:论文称,在不依赖特定领域基础设施的情况下,NexForge 生成了 3.6K 个终端任务和 2K 个办公任务,将 Qwen3.5-35B-A3B Base 在 Terminal-Bench 2.0 上从 22.5% 提升到 52.0%,在 GDPval 上从 813 Elo 提升到 1338 Elo。进一步扩展到 43.2K 个终端任务后,Terminal-Bench 2.0 达到 58.4%。

意义与影响

这项工作的价值不只在于“又做了一批合成数据”,而在于提出了一种更接近产品需求的 Agent 数据生产范式。对终端 Agent、办公自动化 Agent 乃至更广泛的工具型智能体来说,真正困难的不是单个任务的求解,而是如何覆盖大量长尾需求,并让训练数据保持可执行、可验证、可扩展。

NexForge 还被描述为 Nex-N2 模型家族的核心数据引擎。论文称,在进一步扩展后,NexForge 合成数据参与训练的 Nex-N2 系列公开模型,将 Qwen3.5-35B-A3B 在 Terminal-Bench 2.1 上提升到 75.3%,在 GDPval 上提升到 1585 Elo。对于开源 Agent 模型而言,这说明数据工程本身可能成为追赶闭源系统的重要杠杆。

当然,摘要中仍有一些问题需要读者回到论文细节中核实,例如任务质量控制、专家轨迹可靠性、真实需求建模方式,以及这些任务是否会对特定评测形成间接适配。但整体来看,NexForge 把 Agent 训练数据的扩展问题,从“手工搭环境”推进到了“按能力需求自动造环境”的方向。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章