EarlyEval:让智能体评测不必每次跑到最后
导语
随着大语言模型智能体开始处理代码修复、终端操作和多工具协作,评测已经从“回答是否正确”变成了观察一段完整的行动轨迹。问题在于,一次智能体基准测试往往需要多轮思考、调用工具和读取反馈。对于前沿模型而言,跑完一轮评测可能花费数百甚至数千美元;在模型迭代中反复执行同一套测试,成本会迅速累积。
此前降低评测成本的思路,主要是蒸馏基准、减少测试任务数量。EarlyEval 关注的是另一处浪费:一个任务已经显露出成功或失败迹象后,是否还需要让智能体继续运行到结束?
核心方法:从中间轨迹判断终局
EarlyEval 的基本假设是,智能体的最终结果常常会在执行尚未完成时显现。例如,代码修改已经偏离参考方案、工具调用持续出现异常,或者解决路径已经形成并开始验证,这些中间信号可能足以提示任务走向。
框架为每一步执行收集行为、文本和参考解决方案相关特征,并训练两个轻量级 LightGBM 分类器:一个预测任务成功,另一个预测任务失败。系统会对分类结果进行校准;当任一分类器的置信度越过设定阈值时,便提前停止该任务。由于分类器本身开销较低,EarlyEval 的目标是在每一步增加极少额外成本,换取后续模型调用的省略。
实验结果与边界
作者在 SWE-bench Verified、TerminalBench 和 Toolathlon 三个智能体基准上进行评估。结果显示,EarlyEval 可减少约 13%—26% 的智能体执行步骤;在不同设置下,输入 token 最多减少 44.1%,输出 token 最多减少 29.4%。预测准确率处于 89%—97% 区间,而每个智能体的 resolve rate 平均只发生约一到两个百分点的变化。
这些结果说明,提前终止并非简单地用一个粗糙规则截断轨迹,而是在成本节约与评测可靠性之间进行校准。不过,预测错误仍可能带来两类风险:把尚未完成的成功任务判为失败,或让失败轨迹过早结束而掩盖真实行为。置信度阈值的选择、特征在新模型和新任务上的迁移能力,都会影响实际收益。
意义与影响
EarlyEval 提供了与“减少任务数量”互补的评测优化方向:不一定删掉测试题,也可以缩短每道题的运行过程。对于需要频繁回归测试的智能体开发团队,这意味着评测系统可以根据中间证据动态分配计算预算,把完整运行资源留给仍然具有不确定性的任务。
更重要的是,这项工作把智能体评测从静态结果比较推进到轨迹级成本管理。未来,类似方法或许能够与任务筛选、模型路由和动态预算分配结合,但其有效性仍需要在更多基准、模型和执行策略上验证。当前更稳妥的定位,是将 EarlyEval 视为一种轻量级的评测加速器,而不是完整执行的替代品。
评论
正在确认登录状态……
正在加载评论……