SecOPD:用逐令牌蒸馏应对自适应提示注入
导语
当 AI 代理读取网页、文件或邮件时,外部内容并不只是“资料”,也可能携带试图改变代理行为的指令。攻击者可以把恶意文本伪装成普通内容,诱导模型忽略系统要求,转而执行攻击者指定的任务。这类间接提示注入被认为是代理系统面临的核心安全风险之一,尤其难以通过固定关键词或简单输入过滤完全解决。
传统训练为何容易失效
现有的安全微调方法通常使用 DPO、GRPO 等偏好优化方案,以整段回答为单位提供反馈:一条回答被判定为安全或不安全,模型便据此调整整个序列的概率。这种信号粒度较粗。即使回答的大部分内容没有问题,只要其中混入了少量危险行为,整段输出也可能被统一处理;反过来,模型也难以知道究竟哪些令牌导致了安全失败。
论文认为,这种序列级反馈是防御模型难以应对自适应提示注入的重要原因。攻击者可以不断调整注入方式,寻找安全训练没有精确覆盖的表达和行为路径。
SecOPD 的核心思路
SecOPD,即 Secure On-Policy Distillation,尝试把反馈细化到令牌层面:
- 模型先接收包含注入内容的样本,并生成一次实际 rollout;
- 随后,初始化模型在对应的干净输入上对 rollout 中的令牌进行评分;
- 这些逐令牌信号被用于指导防御性微调,让模型更具体地学习哪些输出倾向与注入行为相关;
- 由于训练使用模型自身生成的 rollout,方法重点关注模型在实际受攻击状态下可能走出的路径,而不只是静态示例。
换言之,SecOPD 并非简单告诉模型“整段回答错了”,而是尝试标出回答中需要被抑制或重新校准的局部决策。
论文报告的结果
在作者给出的实验中,经过 SecOPD 防御训练的 Qwen3.6-27B,在 PISmith 自适应提示注入测试上的攻击成功率为 9.0%;作为对比,论文列出的上一项最佳方法 Meta-SecAlign 为 94.0%。在训练中未涉及的代理工具调用领域,SecOPD 的攻击成功率为 4.7%,Meta-SecAlign 为 5.5%。这些结果表明,逐令牌训练信号可能有助于提升对自适应攻击的泛化能力,而不仅仅是在训练样本上记忆拒答模式。
意义与边界
这项工作的价值在于,它把提示注入防御中的“信用分配”问题明确化:模型需要知道一次失败究竟发生在输出的哪个局部环节。若这一方向能够在更多模型、工具环境和攻击策略上得到复现,防御训练或许可以从粗粒度的回答偏好,转向更精确的行为控制。
不过,论文摘要提供的结果主要是特定基准和模型上的报告,不能直接等同于所有代理部署环境都安全。攻击成功率还会受到攻击者能力、工具权限、上下文结构和评测定义影响。实际系统仍需结合权限隔离、工具调用确认、外部内容标记和运行时监控等措施,不能仅依赖模型微调。论文代码和模型已公开,后续复现与跨场景评估将有助于判断 SecOPD 的实际稳健性。
评论
正在确认登录状态……
正在加载评论……