返回文章列表
AI 智能体

DART-SD:用拓扑感知纠正多轮工具调用智能体

阅读约 3 分钟

导语

多轮工具调用智能体往往不是“从头到尾只有一条正确路线”。当一个任务包含多个彼此独立、但最终都必须完成的子目标时,智能体可以先查天气再订票,也可以先订票再查天气。不同顺序可能都通向同一个有效状态,但传统的监督微调或轨迹级强化学习,通常把示范过程当作一条固定序列来学习。

字节跳队提出的 DART-SD,试图解决这种“把多条有效路径压成一条”的问题。论文将其称为拓扑塌缩:模型不只可能学不到正确答案,还可能因为偏离示范顺序而被错误惩罚,进而降低策略多样性。

核心方法

  • 把轨迹提升为状态图。 DART-SD 构建交互状态转移图(ISTG),用状态和转移关系描述工具调用过程。对于顺序无关的子目标,图中会出现多条分支;这些分支随后在共同完成任务时汇合,形成类似“菱形”的结构。
  • 寻找真正的失败位置。 在自主 rollout 产生的失败轨迹中,框架识别关键拓扑断点(CTB)。这个断点并不等同于轨迹末尾的失败结果,而是指从某一步开始,后续路径已经偏离了可恢复的成功区域。
  • 检索恢复参考。 确定断点后,DART-SD 从成功支持的路径中寻找可用的恢复参考,帮助模型学习如何从当前状态继续完成任务,而不是机械复制一条完整示范轨迹。
  • 只修正错误之后的部分。 自蒸馏训练时,损失主要施加在断点之后生成的恢复步骤上;断点之前已经正确的推理前缀则受到保护,避免梯度更新将其改坏。这构成了从全局强制模仿到局部拓扑修正的转变。

实验与意义

根据论文介绍,DART-SD 在五个工具使用基准、两种模型规模上进行评估,并持续优于较强的全轨迹监督和强化学习基线。一个值得关注的结果是,Qwen3-8B 学生模型在部分基准上超过了规模更大的教师模型。不过,素材没有提供具体任务、指标数值或统计显著性,因此这一结论仍应结合论文完整实验表格解读。

这项工作的价值不只是增加一种训练技巧。它提醒研究者,工具调用智能体的学习目标可能天然具有图结构,而非普通语言建模中的线性序列结构。如果训练方法能够识别哪些步骤已经有效、哪些步骤才需要修复,就有机会同时保留策略多样性和错误恢复能力。对实际智能体而言,这也更贴近真实执行:工具调用失败后,系统通常需要从当前状态补救,而不是把整个任务推倒重来。

当然,DART-SD 也依赖状态图构建、断点识别和成功路径检索的质量。如何降低这些环节的成本,并验证方法在更开放、更长链条任务中的稳定性,仍是后续需要回答的问题。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章