CAST:用可验证批评训练提升长程工具调用代理可靠性
导语
当大语言模型开始处理退款、医疗服务等需要连续调用工具的任务时,真正困难的并不是生成一次正确回复,而是在很长的交互过程中持续理解状态、遵守领域规则,并在关键动作执行前发现风险。一次看似细小的错误,例如将退款操作指向错误订单,可能直接导致任务不可逆地失败。更棘手的是,这类错误未必每次运行都会出现,只有在重复试验中才会暴露出代理可靠性不足。
一篇题为《CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents》的论文提出 CAST,尝试把“批评”从提示词层面的临时检查,转化为可以用于训练的系统性监督信号。
核心方法
CAST 的重点不是简单增加一个事后评分器,而是从稀疏的任务结果出发,重建更细粒度的动作级监督:
- 分析完整轨迹:结合长程交互中的工具调用、环境状态和最终结果,判断各个动作是否合理。
- 生成结构化理由:针对部分可观测、规则交织的环境,说明某个动作为何有效、为何存在风险,或违反了什么约束。
- 训练批评模型:让模型学习验证动作,而不只是给整条轨迹贴上成功或失败标签。
- 优化策略模型:利用批评模型构造批评感知训练数据,使策略模型在行动前更重视状态和政策约束。
这一路径回应了现有方法的一个缺口:基于提示词的批评代理可以提供解释,但未必能稳定沉淀为训练信号;而单纯的优化方法通常只有稀疏结果,缺少丰富的验证理由。CAST 试图在两者之间建立一条可训练的桥梁。
实验观察
论文在动态工具调用基准上对 Qwen3 系列模型进行微调,并在 Retail 等任务中评估多次运行下的可靠性。摘要称,CAST 在 Retail 任务的 pass^4 指标上超过 GPT-OSS-120B 十个百分点以上;在 Telehealth 的域外设置中,还带来额外九个百分点的提升。这里的重点并非某一次调用是否正确,而是代理能否在重复试验和连续步骤中稳定完成任务。
意义与边界
CAST 的价值在于重新定义了代理训练中的“错误信息”:最终失败结果只是一个信号,真正有助于改进模型的内容,还包括错误发生在哪一步、当时缺少什么状态判断,以及该动作为何违反任务政策。若这种动作级理由能够可靠生成,代理就有机会从“做错后被判定失败”转向“执行前主动验证”。
不过,现有素材只披露了方法概述和部分结果,尚不足以判断批评理由的生成成本、不同模型规模下的收益,或其在更多工具类型中的泛化能力。后续仍需关注批评模型是否会传递错误判断,以及结构化监督在真实部署中的延迟与维护成本。
评论
正在确认登录状态……
正在加载评论……