返回文章列表
AI 安全

用“诱饵方向”防住大模型安全护栏的消融攻击

阅读约 3 分钟

导语

开放权重大模型的安全能力,往往不仅取决于训练阶段的对齐,也取决于攻击者能否直接修改模型内部参数。Refusal Feature Ablation(RFA)就是一类典型方法:攻击者通过对比不同输入下的模型激活,估计出与拒答行为相关的线性方向,再从残差流中将其投影移除。由于这种操作可能保留相当一部分通用能力,安全机制便可能在不明显损害模型性能的情况下被削弱。

来自卡内基梅隆大学的研究团队提出 Decoy Direction Optimization(DDO),试图以一次性的后处理权重编辑应对这类风险。论文的核心思路不是重新训练每个模型检查点,也不是简单地把真实拒答回路藏起来,而是主动制造一个会干扰攻击者估计过程的“诱饵方向”。

核心方法:让攻击者找到错误目标

DDO 针对 RFA 的关键假设展开。RFA 通常依赖对比估计器,从模型内部信号中区分“应当拒答”和“正常回答”的差异,并据此寻找拒答方向。DDO 则向多层感知器(MLP)神经元中注入高幅度、非线性的诱饵信号。

当攻击者再次运行方向搜索时,诱饵会污染其估计结果,使其更可能把一个与安全机制正交、相对无害的特征误认为拒答方向。攻击者即使完成后续投影消融,也未必真正触及模型中负责安全拒答的回路。论文还给出了一个谱界,用于形式化描述诱饵信号如何影响方向估计,但该理论并不意味着所有类型的编辑攻击都能被完全阻断。

实验结果

  • DDO 在六个模型家族上进行了评估,在标准 RFA 设置下,攻击成功率低于 10%。
  • 在 Llama-3-8B-Instruct 上,面对自适应多阶段攻击,DDO 的最差攻击成功率为 65%,论文所比较的训练型防御为 58%。这说明后处理方案具备一定竞争力,但在攻击者主动调整策略时,安全边界会明显收窄。
  • 对 Heretic 权重级攻击,DDO 将攻击成功率从 88.7% 降至 18%。
  • 按论文摘要给出的配置计算,DDO 每种配置的优化成本比训练型基线低约 30 至 450 倍,且不需要对基础模型重新进行安全微调。

意义与局限

这项工作的价值在于改变了防御思路:面对利用可解释方向进行模型编辑的攻击,防御者不一定要把安全表征做得更隐蔽,也可以干扰攻击者的测量工具。对于需要快速保护多个开源检查点的团队,后处理权重编辑可能比逐一开展安全微调更具工程吸引力。

不过,DDO 并不是“免疫”方案。自适应多阶段攻击下,实验结果与训练型防御之间仍有差距;同时,诱饵本身可能带来能力、安全行为或可解释性方面的额外评估需求。未来更重要的问题,是攻击者能否识别诱饵结构、利用更丰富的内部信号,或通过不同于 RFA 的编辑路径绕过这层干扰。因此,DDO 更适合作为开放模型安全防线中的一层,而非单独承担全部防护任务。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章