安全智能体评测不能只看成功率:成本才是落地关键
导语
安全智能体正在从演示场景走向更接近实战的网络安全工作流:发现漏洞、编写利用、完成 CTF,也可能协助 SOC 分析告警、查询日志、梳理攻击链。但一个常被忽略的问题是:智能体不是“免费思考”的。每一次模型推理、每一次工具调用、每一次遥测查询和外部信息增强,都会消耗预算。
论文《Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents》正是围绕这一点展开。作者认为,安全智能体评测如果只报告“最高成功率”,会高估其在真实环境中的可用性。更合理的方式,是把成功率放到成本约束下观察,并区分模型推理成本与工具使用成本。
核心要点
- 从“能不能做成”转向“花多少钱做成”:传统评测常给模型较充裕的推理预算,关注其在漏洞发现、渗透测试、CTF 等任务中的峰值能力。论文指出,这类结果有参考价值,但无法回答企业真正关心的问题:在有限预算内,哪个模型更划算、更稳定。
- 同时覆盖进攻与防御任务:研究使用了面向进攻场景的 Cybench 挑战,以及面向防御调查的 Splunk BOTS v1 任务。前者更接近 CTF 与攻防推理,后者更贴近 SOC 分析员在日志和遥测系统中调查事件的过程。
- 固定成本下比较模型表现:作者没有只看最优结果,而是在不同成本水平下比较模型,并将开销拆分为推理支出与工具支出。这能更清楚地看出模型是靠“多想”提升表现,还是靠更有效地调用工具完成任务。
- 红队任务与蓝队任务呈现不同扩展规律:论文指出,进攻型 CTF 表现会随着测试时计算增加而改善,经过扩展的开源权重模型有机会接近前沿闭源系统,同时保持成本竞争力。相对地,防御型 SOC 调查并不会简单随着推理预算增加而等比例提升。
- 防御场景更考验操作纪律:在 SOC 调查中,成功更依赖是否能有节制地使用工具、有效浏览遥测数据、选择性地进行信息增强,而不只是模型本身的推理能力。换言之,一个“会查、会停、会筛选”的智能体,可能比一个只会消耗大量 token 的模型更实用。
意义与影响
这项研究提醒行业,安全智能体的评测指标需要更贴近运营现实。对企业安全团队而言,模型是否能在实验室环境中跑出高分固然重要,但更关键的是它能否在固定预算、复杂工具链和真实告警噪声下提供稳定帮助。
它也为开源模型提供了一个更务实的比较框架:如果在某些进攻型任务中,通过测试时计算扩展可以接近前沿闭源模型,并且成本仍然可控,那么开源权重模型在安全自动化中的价值会更容易被量化。与此同时,防御智能体的短板也更清晰:未来提升重点可能不只是更大的模型,还包括更好的工具策略、日志导航能力、成本控制机制和 SOC 原生评测环境。
总体来看,论文的核心贡献不是提出一个单一冠军模型,而是推动安全智能体评测从“榜单分数”走向“经济效率与运营适配”。这对于判断哪些 AI 安全代理今天已经可用、哪些仍停留在实验阶段,具有直接参考意义。
评论
正在确认登录状态……
正在加载评论……