GraphForge:用证据图谱构建更可靠的工作型智能体训练任务
导语
要让智能体真正完成工作,它不仅要理解一段指令,还要能够阅读不同格式的文件、调用工具、协调多个步骤,并最终交付可检查的结果。问题在于,这类训练任务很难规模化构建:完全由模型生成的文件往往缺少真实工作的复杂性,而直接使用真实文件又容易缺少明确、可执行的评测标准。
GraphForge试图从“文件之间的证据关系”出发解决这一问题。该框架面向工作型智能体的数据合成,核心不是单独生成任务或文档,而是同时构建工作区、任务描述与验证机制。
核心方法
- 从职业场景种子开始:研究者先使用与职业相关的种子控制任务类型和多样性,再为每个种子组装由真实文件组成的工作区。
- 建立证据图谱:图谱记录工作区中文件及其关系,为任务中的事实、要求和产出提供依据。
- 让任务和评分标准可追溯:任务说明从证据图谱中推导,评分标准中的每个条件也都关联到能够验证它的文件,减少“要求无法证明”或“结果无法检查”的情况。
- 先测试,再修订:在收集智能体执行轨迹前,系统会进行初步执行测试;如果任务或评分标准与原始文件不匹配,修订智能体会进行修复。
- 将标准用于后训练:除监督微调外,研究还使用证据锚定的评分标准,从模型自身执行结果中筛选候选,开展拒绝微调。
实验结果与意义
论文报告称,在OpenHands环境下,使用2169条GraphForge轨迹微调Qwen3.6-27B后,GDPVal得分达到1445.7,较基线提升65.7。在Claude Code环境下,Workspace-Bench-Lite和SpreadsheetBench II分别达到63.7和24.0,提升幅度分别为7.7和13.7。进一步的拒绝微调在三个基准上都带来额外改进,说明由证据支持的评分标准不仅能评估结果,也可以成为训练数据筛选信号。
GraphForge的价值在于,它把工作型智能体训练中的几个难点连接起来:真实文件提供环境复杂度,证据图谱提供任务约束,执行测试保证任务可操作,锚定文件的评分标准则提供结果验证路径。相比只追求任务数量的合成流程,这种设计更重视任务是否能被执行、结果是否能被解释和复核。
当然,现有材料主要展示了框架思路和基准结果,尚不足以判断其对更多职业、文件类型或更长流程任务的泛化能力。未来值得关注的是,真实文件的授权与隐私处理、图谱构建成本,以及自动评分标准在开放式交付物上的稳定性。无论如何,GraphForge指出了一条重要方向:高质量智能体数据的关键,不只是生成更多任务,而是让任务、工作空间与验证证据形成闭环。
评论
正在确认登录状态……
正在加载评论……