文本到图像模型的“概念遗忘”,需要从经验测试走向可认证安全
导语
让文本到图像(T2I)扩散模型“忘记”某个概念,已经成为模型安全与版权治理中的重要研究方向。无论是限制 NSFW 内容、移除特定艺术风格,还是降低模型对某位名人的生成能力,研究者通常会通过自动化搜索对抗提示词,观察模型是否仍能生成目标概念。这类测试直观、易于比较,但它回答的往往只是一个有限问题:在被测试的提示词集合中,攻击成功了多少次。
arXiv 论文《Certifying Concept Unlearning in Text-to-Image Diffusion Models》认为,有限样本上的攻击成功率不能等同于整个提示空间中的安全程度。没有被搜索到的提示变体、隐晦表达或语义组合,仍可能触发被称为“遗忘”的概念,从而造成残余泄漏风险。
核心要点
- 从经验指标转向可认证界限。 研究提出一种面向 T2I 概念遗忘的认证框架,不只报告观测到的攻击成功率,还在用户指定的置信度下,为残余概念泄漏概率计算带误差约束的上界。
- 结合统计与最坏情况分析。 框架将统计认证与概念相关嵌入方向上的最坏情况分析结合起来,试图覆盖有限测试样本之外、仍与目标概念相关的提示变化。
- 覆盖三类关键概念。 评估对象包括 NSFW 内容、艺术风格和名人身份,并比较了六种当前具有代表性的概念遗忘方法。
- 发现经验测试存在系统性偏差。 研究结果显示,认证得到的泄漏界限始终高于标准攻击成功率,差距为 16.2%。这意味着只看自动化攻击结果,可能对遗忘效果过于乐观。
意义与影响
这项工作的重要性不在于提出一个新的遗忘训练算法,而在于重新定义“如何证明模型确实忘记了”。攻击成功率适合用作快速筛查或方法间的初步比较,却难以单独承担安全审计职责。认证框架则提供了更接近风险上界的分析视角:即使当前测试没有找到有效攻击,也不能据此断言模型在更广泛提示空间中不存在泄漏。
对于模型开发者而言,这意味着概念遗忘流程需要同时报告经验攻击结果与认证界限,并明确置信度、误差和适用范围。对于模型使用者、平台和监管方而言,认证指标有助于区分“测试集中未被攻破”和“在给定假设下获得了可量化的安全保证”。
当然,认证结果仍取决于所采用的统计设定、概念表示以及分析范围,不能被理解为对所有可能输入的绝对证明。论文的核心贡献,是把残余泄漏从一个难以量化的开放风险,推进为可以通过明确界限进行审计的问题。随着概念遗忘被用于更敏感的生成场景,这类认证方法可能成为经验评估之外的必要补充。
来源:arXiv
评论
正在确认登录状态……
正在加载评论……