返回文章列表
AI 安全

PIMiner:用智能体自动挖掘提示注入风险

阅读约 2 分钟

导语

随着 LLM 智能体开始连接工具、读取外部内容并代表用户执行任务,提示注入已经从“模型会不会被话术误导”的问题,升级为智能体安全体系中的核心风险。来自宾夕法尼亚州立大学的论文《Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming》提出 PIMiner,希望用一个自动化智能体系统,更高效地发现提示注入漏洞。

核心要点

  • 问题背景:提示注入会让智能体在处理网页、邮件、文档等外部输入时偏离原始指令,可能导致越权执行、泄露信息或完成攻击者指定的任务。
  • 现有方法局限:论文指出,当前较强的提示注入红队方法多依赖强化学习训练攻击模型,但这类模型在迁移到新的目标 LLM 时,泛化能力往往不足。
  • PIMiner 的思路:系统在训练阶段依次面对多个“数据集—目标模型”组合,从零开始构建一个策略库。到测试阶段,这个策略库可直接用于此前未见过的目标 LLM,不需要额外训练。
  • 低查询成本:PIMiner 在每个测试样本上只需要少量目标智能体查询,论文举例约 10 次,这对实际安全评估更有吸引力。
  • 实验表现:在 IPIArena 上,PIMiner 对 Gemini-2.5-Pro 的 ASR 为 76.2%,对 GPT-5.1 为 61.9%,对 Claude-Sonnet-4.5 为 42.9%。在 AgentDojo 上,对应结果分别为 86.7%、53.3% 和 40.0%。

意义与影响

这项工作的关键并不只是“攻击成功率更高”,而是把红队测试从单一攻击器训练,推进到可复用策略挖掘。对于安全团队来说,若攻击策略能够跨模型迁移,就可以更快评估新模型、新智能体流程和新工具接入后的暴露面。

同时,PIMiner 也说明提示注入防御仍然困难:即便是能力较强的前沿模型,在特定基准中仍会被自动化红队系统找到可利用路径。论文中的结果还呈现出模型之间的差异,这意味着安全评估不能只依赖单一模型或单一场景。

从产业角度看,这类系统未来可能成为智能体上线前安全测试的一部分,用于批量生成失败案例、补充防御训练数据,并帮助开发者识别提示层、工具调用层和任务规划层之间的薄弱环节。不过,论文素材主要展示了方法和基准结果,实际部署中的误报、覆盖范围、与防御机制结合方式,仍需要进一步验证。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
当智能体学会“像你一样说话”:Persona Skills 的隐私与冒充风险
AI 安全
cctest.ai
AI 安全

当智能体学会“像你一样说话”:Persona Skills 的隐私与冒充风险

这篇论文提出 AntiSkillBench,用于评估个人化技能在蒸馏、复用和部署过程中可能带来的隐私泄露与行为冒充风险。研究显示,风险不只来自显性个人信息,还会延伸到沟通风格、性格特征等更难界定的身份信号。

阅读全文