返回文章列表
AI 安全

SkillDRE:让智能体技能在双阶段反馈中持续演化

阅读约 3 分钟

导语

随着智能体开始调用可复用的“技能包”,安全边界不再只取决于模型本身。一个技能可能同时包含自然语言指令、可执行代码和任务资源,因此既能提升任务完成效率,也给攻击者留下了植入隐蔽行为的空间。论文《SkillDRE》关注的正是这一问题:恶意技能如何在多重防御下持续调整,并绕过看似有效的检测。

核心要点

  • 把两个防御阶段连成闭环。 传统评估往往分别检查执行前扫描或运行时拦截,但两者之间存在明显落差。一个技能通过静态或执行前扫描,并不意味着它能在真实运行中实现攻击目标;反过来,为了改善运行效果进行的修改,也可能重新触发扫描器。
  • 同时利用扫描与执行反馈。 SkillDRE先围绕一个良性任务构造带条件的恶意目标,并生成可验证的判定规则。目标和判定规则保持不变,系统只演化技能实现本身,再根据扫描结果和运行时防御下的执行结果继续修改。
  • 每次运行时调整都要回到扫描阶段。 运行时反馈并不是终点。框架会将修改后的技能重新交给执行前扫描器,经过再次优化后才进入下一轮执行,由此形成跨阶段的反馈循环。
  • 兼顾攻击效果与正常能力。 研究并非只追求恶意目标是否达成,还要求技能尽量保留对原始良性任务的支持能力。这使评估更接近真实场景中的伪装型风险。

实验结果与意义

论文在SkillsBench上测试了四个受测模型。SkillDRE报告的平均攻击成功率为45.28%,相比最强基线高出40.3%;最终提交的技能没有获得SkillScan发现,并且大体保留了良性任务性能。这里的结果并不意味着所有技能都能稳定绕过防御,而是说明当攻击者能够同时观察多个防御环节时,单点检测结果可能不足以代表最终风险。

对防守方而言,研究提出了两个直接启示。第一,技能安全评估需要覆盖从提交前检查到实际执行的完整链路,并记录防御之间的交互效应。第二,扫描器不能只追求一次性识别,还应考虑技能在反馈驱动下发生变化的可能性。对红队测试而言,运行时结果可以成为重要的适应性信号;对平台而言,则需要加强技能版本管理、沙箱隔离、行为审计和跨轮次检测。

SkillDRE的价值主要在于揭示评估方法上的盲区:当可复用技能具备持续修改能力时,防御系统面对的不是一个静态样本,而是一个会根据反馈调整的对象。未来,如何在不泄露过多防御细节的前提下开展可控红队实验,并建立可复现、可审计的技能安全基准,仍是值得继续研究的问题。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
模型内部信息何时真正有助于大模型安全?一项对表示工程的系统比较
AI 安全
cctest.ai
AI 安全

模型内部信息何时真正有助于大模型安全?一项对表示工程的系统比较

一项匹配评估比较了DPO、表示引导、内部探针与文本监控器在大模型安全控制和风险监测中的表现。结果显示,表示工程并非行为安全机制的替代品,但在低数据、低成本监测和后训练修复等场景具有独特价值。

阅读全文