SkillJack揭示自进化智能体的新风险:后门可被“学成技能”
导语
随着智能体从“会执行任务”走向“会自我进化”,它们开始把过去的交互历史整理成可复用的技能:遇到类似任务时,不必从零推理,而是调用已经沉淀的能力。论文 SkillJack: Persistent Skill Backdoors in Self-Evolving Agents 指出,这条经验到技能的学习链路本身可能成为新的攻击面。
过去关于智能体安全的讨论,更多集中在记忆投毒、检索污染或提示注入:攻击者把恶意内容放进记忆库,只有当这些记录被检索进上下文时,攻击才会生效。SkillJack 的关键不同在于,它不是等待有毒记录被再次取出,而是诱导智能体在“总结经验、抽取技能”的过程中,把恶意行为转化为长期存在的技能资产。
核心要点
- 攻击目标从运行时上下文转向学习管线:SkillJack 利用自进化智能体的经验转技能流程,把一次性的有害交互变成可反复调用的能力。
- 技能抽取会降低可检测性:论文称,恶意意图在技能提炼过程中可能被抽象、改写或包装,形成所谓“sanitization whitewashing”。表面上看,生成的技能描述更像正常能力,风险信号被削弱。
- 短期经验被提升为长期能力:研究将这一过程称为“cross-layer promotion”。原本只存在于某次轨迹中的问题行为,被提升到技能层,进入智能体的长期能力库。
- 删除原始记录并不等于清除风险:由于后门已经进入技能仓库,即便原始投毒经验被移除,攻击仍可能保留,这被称为“persistence isolation”。
- 实验显示检测难度显著上升:研究在 SkillX 和 Anything2Skill 两类系统上评估了 150 条轨迹,覆盖四类策略风险。在 SkillX 中,安全检测对投毒轨迹的识别率为 98.5%,但对抽取后的技能仅为 11.4%。与此同时,植入技能仍然有效,在两个系统中的攻击成功率分别达到 56.2% 和 89.2%。
意义与影响
这项研究提醒我们,自进化智能体的安全边界不能只设在“运行时”。当智能体具备把经验转化为技能、工具或策略模板的能力时,安全机制也必须覆盖整个技能生命周期:经验来源、抽取过程、技能审核、版本变更、调用记录和废弃清理都需要可追踪。
更重要的是,SkillJack 暴露了一个容易被低估的问题:越是能学习、能积累、能复用的智能体,越可能把一次异常行为固化为长期习惯。对企业级智能体、自动化运维代理、代码代理和个人长期助理而言,这意味着“清空记忆”未必足够,技能库、工作流模板和策略缓存同样需要安全审计。
论文没有把问题简单归结为某个模型或某个系统的缺陷,而是指向一类架构性风险:当经验被抽象成能力时,恶意意图也可能被抽象得更隐蔽。未来的防护重点,可能不只是更强的内容过滤器,而是带有溯源、隔离、回滚和持续审计能力的智能体技能管理体系。
评论
正在确认登录状态……
正在加载评论……