HarnessRisk:从全生命周期评估智能体工具链安全
随着大语言模型从聊天窗口走向工作区、自动化流程和工具调用系统,决定安全边界的已不只是模型本身。所谓 agent harness,负责连接工具与扩展、维护持久化状态、管理权限,并代表模型执行外部操作。一旦这些环节出现漏洞,模型即使能够识别部分风险,也可能在完整工作流中做出不安全的动作。
HarnessRisk 试图把这类问题从单点攻击测试,扩展为覆盖部署生命周期的系统性评估。基准将安全划分为六个阶段:Harness Configuration(harness 配置)、Capability Extension(能力扩展)、Runtime Operation(运行时操作)、State Persistence(状态持久化)、Action Control(行动控制)和 Incident Recovery(事件恢复)。这样的划分关注的不是某一种具体提示注入,而是攻击如何在不同职责之间传播并产生后果。
核心要点
- 基准包含 128 个沙盒案例。每个案例都设置一个正常的用户目标,同时把对抗性指令嵌入不可信的工作流工件中,模拟更接近真实使用环境的风险来源。
- 评估不只看任务是否完成,还结合 Utility、Attack Success Rate、Persistence 和 Detection 四项指标,分别考察任务效用、攻击成功、影响是否持续以及系统是否发现风险。
- 在三种 harness、六个语言模型和 14 种模型与 harness 配置中,攻击成功率从 12.6% 到 80.9% 不等;任务效用仍处于 75.0% 至 97.6% 之间。这说明“工作完成得好”并不等于“执行过程足够安全”。
- Harness Configuration 在三种 harness 中都是最脆弱阶段。攻击可以借助原本获得授权的工作流,进一步改变安全敏感参数,因而绕过只关注内容层面的防护。
- 风险识别与安全行动之间存在落差。部分配置在超过 90% 的运行中检测到风险,但仍保持较高的攻击成功率,表明告警能力不能直接替代执行控制。
这项工作的意义在于,它把评估对象从孤立的模型响应,推进到“模型加 harness 配置”的部署单元。对于开发者而言,安全测试需要覆盖权限、配置变更、状态写入、工具调用和恢复流程,而不能只测模型能否拒绝一条恶意指令。对于评测研究而言,Persistence 和 Detection 等维度也有助于区分一次性失败、可延续影响以及事后才被发现的风险。
当然,现有摘要只披露了基准规模、实验范围和主要发现,尚不足以判断不同模型、harness 或具体防护机制的详细排名。HarnessRisk 更重要的启示,是提醒业界把智能体视为一个持续运行的系统:安全边界必须贯穿配置、执行、记忆、行动和恢复,而不是停留在模型输出这一层。
评论
正在确认登录状态……
正在加载评论……