NEEDLE:用权重正交化定向清除大语言模型后门
导语
大语言模型的后门攻击通常不会改变模型在大多数正常输入下的表现,而是在特定触发词、模式或输入条件出现时,引导模型执行攻击者预先植入的行为。这类风险尤其难以通过常规能力测试发现:模型可能看起来安全可靠,却在触发器出现后生成恶意内容、执行不符合预期的操作,甚至受到代码注入攻击影响。
现有后门清除方法面临一个两难问题:修复力度不足,后门仍然存在;修复力度过强,又可能改变模型对正常提示的输出分布,损害通用能力或安全拒答行为。来自 Locai Labs 的研究提出 NEEDLE,尝试把“去除后门”和“少改模型”结合起来。
核心方法
NEEDLE 是一种不需要重新训练的定向防御流程,但前提是防御者已经识别出后门触发器。它主要包含几个步骤:
- 估计后门方向:研究者利用带触发器与不带触发器的激活向量,寻找触发器在模型内部造成的主要表示变化,将其概括为后门方向。
- 识别拒答子空间:方法同时分析与拒答行为相关的激活表示,形成一个需要保护的拒答子空间。
- 逐层正交化权重:在注意力模块和 MLP 模块的输出权重上逐层操作,使相关表示不再沿着后门方向传播。
- 保持安全表示:由于前面的层被修改后,后续层接收到的激活也会变化,NEEDLE 使用闭式修正,尽量保持这些激活在拒答子空间上的投影不变。
这一设计的关键,不是简单地删除某一组参数,而是在后门方向与安全拒答表示之间进行区分。这样可以降低对正常行为的连带影响,也不需要干净模型作为逐参数参照,更不需要访问最初的投毒训练数据。
结果与意义
论文在多个模型家族和攻击类型上进行评估。根据作者报告,NEEDLE 在对比防御中取得了最低的平均攻击成功率,在具有挑战性的代码注入攻击上报告为 0%;同时,它带来的 KL 散度较低,对模型能力和安全性的改动也较小。这里的结果仍应结合具体触发器、模型规模和评测设置理解,不能简单推导为对所有未知后门都有效。
NEEDLE 的价值在于提供了一条偏“外科手术式”的模型修复思路:当触发器已经被定位时,防御者可以直接针对内部表示与权重进行干预,而不是依赖完整再训练流程。它也提示,后门防御的评价不应只看攻击成功率,还应同时衡量正常任务性能、输出分布变化以及拒答安全是否被破坏。未来,这类方法仍需要在未知触发器、多后门共存和更大规模部署环境中接受进一步检验。
评论
正在确认登录状态……
正在加载评论……