返回文章列表
AI 智能体

GraphForge:用证据图谱构建更可靠的工作型智能体训练任务

阅读约 3 分钟

导语

要让智能体真正完成工作,它不仅要理解一段指令,还要能够阅读不同格式的文件、调用工具、协调多个步骤,并最终交付可检查的结果。问题在于,这类训练任务很难规模化构建:完全由模型生成的文件往往缺少真实工作的复杂性,而直接使用真实文件又容易缺少明确、可执行的评测标准。

GraphForge试图从“文件之间的证据关系”出发解决这一问题。该框架面向工作型智能体的数据合成,核心不是单独生成任务或文档,而是同时构建工作区、任务描述与验证机制。

核心方法

  • 从职业场景种子开始:研究者先使用与职业相关的种子控制任务类型和多样性,再为每个种子组装由真实文件组成的工作区。
  • 建立证据图谱:图谱记录工作区中文件及其关系,为任务中的事实、要求和产出提供依据。
  • 让任务和评分标准可追溯:任务说明从证据图谱中推导,评分标准中的每个条件也都关联到能够验证它的文件,减少“要求无法证明”或“结果无法检查”的情况。
  • 先测试,再修订:在收集智能体执行轨迹前,系统会进行初步执行测试;如果任务或评分标准与原始文件不匹配,修订智能体会进行修复。
  • 将标准用于后训练:除监督微调外,研究还使用证据锚定的评分标准,从模型自身执行结果中筛选候选,开展拒绝微调。

实验结果与意义

论文报告称,在OpenHands环境下,使用2169条GraphForge轨迹微调Qwen3.6-27B后,GDPVal得分达到1445.7,较基线提升65.7。在Claude Code环境下,Workspace-Bench-Lite和SpreadsheetBench II分别达到63.7和24.0,提升幅度分别为7.7和13.7。进一步的拒绝微调在三个基准上都带来额外改进,说明由证据支持的评分标准不仅能评估结果,也可以成为训练数据筛选信号。

GraphForge的价值在于,它把工作型智能体训练中的几个难点连接起来:真实文件提供环境复杂度,证据图谱提供任务约束,执行测试保证任务可操作,锚定文件的评分标准则提供结果验证路径。相比只追求任务数量的合成流程,这种设计更重视任务是否能被执行、结果是否能被解释和复核。

当然,现有材料主要展示了框架思路和基准结果,尚不足以判断其对更多职业、文件类型或更长流程任务的泛化能力。未来值得关注的是,真实文件的授权与隐私处理、图谱构建成本,以及自动评分标准在开放式交付物上的稳定性。无论如何,GraphForge指出了一条重要方向:高质量智能体数据的关键,不只是生成更多任务,而是让任务、工作空间与验证证据形成闭环。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
用户改主意后,LLM Agent 为什么还在执行旧指令?
AI 智能体
cctest.ai
AI 智能体

用户改主意后,LLM Agent 为什么还在执行旧指令?

一项新研究将“意图漂移”定义为可测量的多轮交互失败:用户已经撤回或修改的要求,仍会影响模型回答和工具操作。研究者提出 IntentFlux 基准与 StateForge 方法,显示显式维护当前状态能够改善表现,但无法完全弥合单轮任务与多轮对话之间的差距。

阅读全文