让智能体先算再做:长程工具调用中的比较价值估计
导语
当大语言模型从“回答问题”转向“调用工具完成任务”,一次看似局部的选择,往往会改变后续全部路径。搜索、读取、写入或调用外部 API 等动作都可能更新任务状态,并影响下一步能够采取的行动。对于这类长程工具使用,智能体不能只判断某个调用是否合理,还需要提前估计它是否有助于最终完成任务。
论文《Choosing Before Acting: Comparative Value Estimation for Long-Horizon Tool-Use Agents》关注的正是这一问题。作者提出 Comparative Inference for Tool-use Agents(CITA),并训练 Comparative Inference Model(CIM),让模型在执行动作之前,对同一上下文中的候选工具调用进行比较。
核心要点
- 从结果奖励转向步骤价值。 长链路通常只在任务结束时获得成功或失败信号,奖励距离具体决策越远,越难判断哪一步造成了结果。CITA试图为下一次工具调用提供更细粒度的长期价值估计。
- 关键是比较,而非孤立打分。 日志往往只记录智能体实际选择的调用,却没有说明其他候选方案会带来什么结果。CITA因此围绕同一上下文下的替代调用构造比较式监督,估计某个动作相对于其他动作的潜在贡献。
- 融合三类监督信号。 CIM的训练信号来自已观察到的工具行为、贝叶斯工具图模拟器提供的可扩展监督,以及基于大语言模型的语义比较判断。这样的组合试图弥补真实轨迹缺少反事实选择的问题。
- 在执行前辅助决策。 CIM输出的是候选调用支持最终任务成功的可能性,智能体可以据此选择更有前景的下一步,而不是完全依赖生成模型的即时直觉。
意义与影响
这项工作的价值,在于把工具使用智能体的训练目标从“事后判断整条轨迹”推进到“事前比较下一步”。它没有把每个动作简单视为独立分类,而是强调动作与后续状态、可用工具及最终结果之间的联系。对于需要多轮检索、规划和外部操作的任务,这种价值估计可能帮助系统减少早期错误的累积。
根据论文摘要,CITA在三个工具使用基准和多种骨干大语言模型上持续改善了Tool F1与任务成功表现,额外分析也显示,CIM能够学习到用于比较工具选择的步骤级价值估计。不过,这些结果仍应结合论文完整实验设置理解;摘要没有提供具体提升幅度,也没有说明模拟器监督在不同任务中的相对贡献。总体而言,CITA提供了一条清晰思路:让智能体在“采取行动”之前,先比较行动可能通向的未来。
来源:arXiv
评论
正在确认登录状态……
正在加载评论……