返回文章列表
模型评测

KaliBench:把网络安全工具调用拆成可验证的命令生成能力

阅读约 3 分钟

导语

在网络安全工作流中,让模型“知道该用什么工具”只是第一步。真正落地时,模型还必须把分析人员的意图转换成能够直接执行的命令:工具名称要正确,选项与参数要匹配,参数顺序和语法也不能出错。一个看似细小的命令行错误,就可能让后续流程失效。KaliBench 正是针对这一环节提出的细粒度基准。

核心要点

  • 聚焦自然语言到 CLI 的转换。 与偏重安全知识问答或完整智能体任务的评测不同,KaliBench 直接检查模型能否为 Kali Linux 工具生成目标命令。
  • 覆盖范围较广。 数据集包含 8504 组查询—命令对,涉及 1642 个工具、23 个能力维度以及 5 个安全阶段,试图呈现网络安全工具使用中的多样需求。
  • 强调可复现的判定。 研究采用基于资料的构建流程,并对命令进行确定性规范化,同时考虑工具别名,从而减少仅因表达形式不同造成的评测偏差。
  • 同时检查语义与执行性。 验证流程结合大模型审查、沙箱终端执行和人工复核,不只判断命令“看起来是否合理”,也关注它能否在受控环境中运行。
  • 支持训练信号。 由于评测结果可以由命令结构和规则化判定得到,KaliBench 还被设计为能够提供无需运行时环境的可验证奖励,用于相关模型训练。

结果意味着什么

摘要披露的实验覆盖三种评测模式,以及通用模型和网络安全专用开放权重模型的 24 种配置。现有开放权重模型的精确命令准确率最高也没有超过 42%。这个结果说明,网络安全工具调用并不是把通用代码生成能力简单迁移过来就能解决的问题。模型可能选对工具,却绑定了错误的参数;也可能理解了任务目标,却因标志位、值或参数顺序出错而无法执行。

KaliBench 的价值首先在于把“工具使用能力”拆解成更容易诊断的指标。研究者可以进一步区分模型是在工具选择、参数构造,还是命令格式上失败。其次,确定性规范化和别名感知机制有助于提高不同模型、不同实验之间的可比性。最后,运行时无关的验证奖励为训练提供了较低成本的反馈方式,减少每次评估都依赖完整执行环境的需要。

当然,这一基准主要衡量命令生成,不等同于完整的安全运营能力。真实任务还涉及权限、上下文、输出解析、风险控制和多步决策。因此,KaliBench 更适合作为网络安全智能体评测体系中的基础组件:先确认模型能稳定生成正确命令,再考察它能否在安全约束下完成更长链路的任务。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
PhysVista:用“感知—推理—评估”闭环检验 VLM 的物理智能
模型评测
cctest.ai
模型评测

PhysVista:用“感知—推理—评估”闭环检验 VLM 的物理智能

PhysVista 提出一个面向视觉语言模型的物理智能评测框架,将物理状态感知、动力学推理与物理合理性判断纳入同一认知闭环。基准同时覆盖真实视频与 AI 生成视频,用于检验模型是否真正理解动态世界,而不只是识别画面内容。

阅读全文
CCTest · Blog
OpenTumorBoard:让大模型接受真实肿瘤多学科讨论考验
模型评测
cctest.ai
模型评测

OpenTumorBoard:让大模型接受真实肿瘤多学科讨论考验

OpenTumorBoard从219场公开肿瘤委员会会议中整理出611个病例和近两万轮讨论,为评估模型参与复杂、多专家协作式临床决策提供了新基准。结果显示,即使是前沿通用模型和医疗模型,在复现专家回答与委员会结论方面仍有明显差距。

阅读全文