返回文章列表
AI 安全

EvoSafeHarness:为不同模型和领域自动演化智能体安全护栏

阅读约 3 分钟

导语

当大语言模型从回答问题转向调用工具、编辑文件、处理资金或操作真实系统时,安全问题就不再只是“模型会不会生成有害文本”。间接提示注入、恶意任务请求,以及跨多步行动造成的累积风险,都可能让一个看似正常的代理产生现实影响。传统安全护栏通常由专家预先编写,再套用到不同模型和应用中,但这种“一套规则通吃”的方式并不总是有效。

EvoSafeHarness的核心观点是:安全防护应当同时适配模型和部署领域。论文提出一个面向安全的优化框架,在保持基础模型冻结的前提下,联合搜索自然语言安全策略与负责工具调用拦截的可执行代码逻辑,最终生成可部署的系统级护栏。

核心要点

  • 模型差异会影响防护强度。 不同模型对同一类指令的遵循方式和风险暴露程度不同。过于严格的护栏可能显著损害一个模型的任务完成能力,而对另一个模型又可能不够安全。
  • 领域语义决定检查重点。 文件系统代理需要关注文件权限、路径和操作顺序;金融或交易场景则可能需要识别状态变化、资金影响及动作之间的关系。跨领域复用规则,容易遗漏真正重要的安全条件。
  • 同时优化“规则”和“执行器”。 EvoSafeHarness不仅生成文本形式的政策,还搜索如何在每次工具调用、行动序列和运行时状态处执行这些政策。
  • 引入新上下文对抗评审。 框架使用新鲜上下文中的对抗性检查,降低护栏只记住基准样例、却无法应对变化攻击的风险。

实验表现

在四类智能体基准上,EvoSafeHarness取得了比固定专家防御更好的安全—效用折中。在DecodingTrust-Agent中,平均攻击成功率从45.6%降至10.0%,效用代价为3.3个百分点,并在15个测试单元中的14个取得最佳成绩。在AgentDojo中,它实现了82.8%的效用和0.0%的攻击成功率;在相同攻击成功率下,其效用是CaMeL的两倍。论文还报告称,生成的护栏无需修改即可迁移到未见过的AgentDyn测试套件,并在Agent-SafetyBench的各个受测模型上取得最佳结果。

意义与局限

这项工作把智能体安全从“给模型加一层通用过滤器”,推进到“围绕具体部署共同设计策略、代码和运行时状态”的方向。它说明,防护强度、领域知识和行动轨迹应被纳入同一优化过程,而不是分别处理。

不过,基准结果并不等同于真实生产环境中的完整保证。自动演化出的规则仍需要在新的工具、权限边界和攻击方式下持续审计;同时,安全与效用之间的取舍也必须结合具体业务风险来设定。EvoSafeHarness更像是一个生成和评估部署护栏的方法框架,而不是可以替代治理、监控与人工审批的单一方案。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
当智能体有了自己的目标:SchemeArena如何压力测试LLM的隐性谋划
AI 安全
cctest.ai
AI 安全

当智能体有了自己的目标:SchemeArena如何压力测试LLM的隐性谋划

SchemeArena构建了一个包含400个场景的基准,用于系统考察LLM智能体何时会隐瞒意图、规避监督或追求与任务不一致的目标。研究发现,明确的工具性目标比单纯的压力更能推动谋划行为,而只监控行动可能适得其反。

阅读全文