返回文章列表
模型评测

ClawProBench:让智能体评测从“答对”走向“做对”

阅读约 3 分钟

导语

当大模型开始调用工具、读写文件、发送消息或启动子智能体时,只看最终答案已经很难完整描述它的能力。一个智能体可能碰巧给出正确结果,却使用了错误证据、绕过了安全边界,或在重复运行时表现不稳定。ClawProBench试图把评测对象从单一模型扩展为“模型加运行时配置”,并用完整执行轨迹记录智能体是如何完成任务的。

核心要点

  • 评测单位发生变化。 研究将失败来源拆分为证据获取、运行时路由、安全控制和重复执行等环节。这样,最终答案相同的两个系统,也可能因过程质量不同而得到不同评价。
  • 覆盖真实运行时能力。 ClawProBench基于OpenClaw构建,场景涉及工作区工具,以及浏览、记忆、消息、日程、技能和子智能体等原生运行时能力。
  • 提供两条评测轨道。 完整轨道包含102个场景,强调实时工作区和原生运行时路由;冻结留出集包含68个场景,采用封闭世界的JSON输出契约,更适合稳定比较不同配置。
  • 评分不只看正确率。 系统从轨迹中提取正确性、过程质量和效率,并设置安全门控;如果执行触及安全问题,单纯的结果正确也不能掩盖风险,同时保留失败证据供审计。
  • 稳定性会改变排名。 在留出集上,至少一次通过的pass@k-any为0.6638,而连续三次严格通过率为0.2890,说明“偶尔做对”与“持续做对”之间存在明显差距。

实验观察

论文评估了68种配置的完整轨道结果,以及37种配置的冻结留出集结果。完整轨道中,安全门控后的平均轨迹得分最高为0.7671。工作区实时任务的平均表现为0.6415,原生运行时任务为0.5238,后者更容易暴露工具调用、路由和状态管理方面的问题。完整轨道与冻结留出集的排名仅呈弱一致性,Spearman相关系数为0.1300;如果只按正确率排名,也会与过程感知、安全门控或严格通过标准产生明显差异。

意义与影响

ClawProBench的价值不在于再增加一个静态题库,而在于提醒行业:智能体评测必须把运行环境和执行过程纳入协议。对于开发者,轨迹数据可以帮助定位是模型推理、工具选择还是权限控制出了问题;对于使用者,严格多次通过率比一次成功更接近真实部署中的可靠性;对于基准设计者,冻结留出集则有助于减少针对公开任务的过拟合。

不过,这套基准以OpenClaw为实例,结果首先反映的是特定运行时中的能力差异。未来若要进行更广泛的横向比较,还需要跨运行时的统一接口、可复现环境和更清晰的安全判定标准。即便如此,它已经给出了一个重要方向:评估智能体时,不应只问“答案对不对”,还要问“过程是否安全、有效,而且能否稳定复现”。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章