返回文章列表
AI 安全

DeepSeek Harness间接提示注入测试:工具链仍需安全隔离

阅读约 3 分钟

导语

当大模型代理能够读取文件、处理工具返回值并调用外部能力时,提示注入的风险就不再局限于用户输入。攻击者可以把指令藏在网页、文件、工具结果或其他间接内容中,等待代理在后续任务里将其当成可信上下文。来自AI-Infra-Guard团队的一项研究,专门评估了DeepSeek Harness(DSH)面对这类攻击时的表现。

研究如何进行

研究使用AI-Infra-Guard构造测试、注入受控“污染”内容、运行DSH并收集完整执行轨迹。实验共包含14,560次受控执行,覆盖16个间接内容渠道、文本和文件两种载体、35个载荷目标,以及12种攻击方法和一个未修改基线。

测试尽量保留了DSH原有的代理循环、工具注册、模型适配器和会话事件路径。与此同时,研究者将源工具和敏感操作目标替换为本地测试夹具,因此测试中即使出现尝试执行敏感动作,也只会被记录,不会造成外部副作用。这一点使结果更适合用于安全评估,而不是现实环境中的攻击演示。

研究采用两种判定方式:一种是确定性的规则评估器RuleJudge,另一种是基于语义理解的LLMJudge。两者对“成功”和“部分服从”的判断并不完全一致。数据显示,文本模式下,伪造完成信息攻击在LLMJudge下达到17.0%的最高攻击成功率;文件模式下,隐藏Unicode攻击在RuleJudge下达到25.5%,技能渠道则达到16.0%。此外,LLMJudge判定部分服从的比例为7.3%,高于RuleJudge的2.0%。这些数字不应被理解为所有部署环境中的固定失效率,但说明评估标准会显著影响风险画像。

核心要点

  • 文件载体并不天然比文本更安全,隐藏字符等表示层技巧可能改变代理对内容的理解。
  • 工具结果、附加上下文和技能渠道都可能成为不可信指令进入代理决策链的入口。
  • 规则评估便于复现,但可能难以覆盖语义上的“部分执行”或边界行为。
  • 研究没有让测试动作触及真实外部系统,结果反映的是受控条件下的行为倾向,而非现实攻击损失。

意义与影响

这项工作提示,代理安全不能只依赖系统提示词或模型拒答能力。只要不可信内容能够与工具调用、任务状态和敏感数据流发生连接,就需要在两者之间设置额外的控制层,例如对内容来源进行标记、限制工具权限、在高风险调用前进行独立校验,并对执行轨迹进行审计。研究也表明,安全测试应同时结合规则判定与语义判定,关注代理是否出现了部分服从,而不只是最终是否完成攻击目标。

对于开发者而言,DSH的价值不仅在于暴露了若干具体攻击面的差异,也在于提供了一套可复用的评估思路:保留真实代理路径,隔离外部副作用,记录可审计轨迹,再从多个角度判断行为。相关代码已公开,后续系统可以据此扩展到更多工具、载体和持久化上下文场景。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章