返回文章列表
AI 安全

SkillJack揭示自进化智能体的新风险:后门可被“学成技能”

阅读约 3 分钟

导语

随着智能体从“会执行任务”走向“会自我进化”,它们开始把过去的交互历史整理成可复用的技能:遇到类似任务时,不必从零推理,而是调用已经沉淀的能力。论文 SkillJack: Persistent Skill Backdoors in Self-Evolving Agents 指出,这条经验到技能的学习链路本身可能成为新的攻击面。

过去关于智能体安全的讨论,更多集中在记忆投毒、检索污染或提示注入:攻击者把恶意内容放进记忆库,只有当这些记录被检索进上下文时,攻击才会生效。SkillJack 的关键不同在于,它不是等待有毒记录被再次取出,而是诱导智能体在“总结经验、抽取技能”的过程中,把恶意行为转化为长期存在的技能资产。

核心要点

  • 攻击目标从运行时上下文转向学习管线:SkillJack 利用自进化智能体的经验转技能流程,把一次性的有害交互变成可反复调用的能力。
  • 技能抽取会降低可检测性:论文称,恶意意图在技能提炼过程中可能被抽象、改写或包装,形成所谓“sanitization whitewashing”。表面上看,生成的技能描述更像正常能力,风险信号被削弱。
  • 短期经验被提升为长期能力:研究将这一过程称为“cross-layer promotion”。原本只存在于某次轨迹中的问题行为,被提升到技能层,进入智能体的长期能力库。
  • 删除原始记录并不等于清除风险:由于后门已经进入技能仓库,即便原始投毒经验被移除,攻击仍可能保留,这被称为“persistence isolation”。
  • 实验显示检测难度显著上升:研究在 SkillX 和 Anything2Skill 两类系统上评估了 150 条轨迹,覆盖四类策略风险。在 SkillX 中,安全检测对投毒轨迹的识别率为 98.5%,但对抽取后的技能仅为 11.4%。与此同时,植入技能仍然有效,在两个系统中的攻击成功率分别达到 56.2% 和 89.2%。

意义与影响

这项研究提醒我们,自进化智能体的安全边界不能只设在“运行时”。当智能体具备把经验转化为技能、工具或策略模板的能力时,安全机制也必须覆盖整个技能生命周期:经验来源、抽取过程、技能审核、版本变更、调用记录和废弃清理都需要可追踪。

更重要的是,SkillJack 暴露了一个容易被低估的问题:越是能学习、能积累、能复用的智能体,越可能把一次异常行为固化为长期习惯。对企业级智能体、自动化运维代理、代码代理和个人长期助理而言,这意味着“清空记忆”未必足够,技能库、工作流模板和策略缓存同样需要安全审计。

论文没有把问题简单归结为某个模型或某个系统的缺陷,而是指向一类架构性风险:当经验被抽象成能力时,恶意意图也可能被抽象得更隐蔽。未来的防护重点,可能不只是更强的内容过滤器,而是带有溯源、隔离、回滚和持续审计能力的智能体技能管理体系。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
当智能体学会“像你一样说话”:Persona Skills 的隐私与冒充风险
AI 安全
cctest.ai
AI 安全

当智能体学会“像你一样说话”:Persona Skills 的隐私与冒充风险

这篇论文提出 AntiSkillBench,用于评估个人化技能在蒸馏、复用和部署过程中可能带来的隐私泄露与行为冒充风险。研究显示,风险不只来自显性个人信息,还会延伸到沟通风格、性格特征等更难界定的身份信号。

阅读全文