返回文章列表
模型评测

当深伪检测失效:用“可重建性”认证真实图像

阅读约 3 分钟

导语

生成式模型正在让“看起来真实”变得越来越容易,也让“凭图判断真伪”变得越来越不可靠。来自穆罕默德·本·扎耶德人工智能大学的一项研究,对20种深伪检测器和近四年发布的10种生成器进行了比较,指出传统检测范式正面临两个同时发生的问题:模型更新速度超过检测器适应速度,而针对检测器的微小对抗扰动又能进一步破坏判断结果。

检测器为什么越来越脆弱

研究结果显示,检测器整体准确率从接近99.5%下降到76%。在加入对抗扰动后,所有基线系统的准确率都降至2%以下,甚至可能近似反转原本给出的标签。这意味着,检测器捕捉到的往往是某一代生成模型留下的统计痕迹,而不是“合成内容”这一稳定、跨模型存在的本质特征。

更棘手的是,真实与生成之间并不存在绝对清晰的内容边界。生成器可能记忆并重新输出训练数据中的真实图像,因此一张由模型生成的图像,在像素层面完全可能与真实图像一致。仅凭内容本身,无法可靠回答它究竟来自相机、人工编辑流程,还是某个生成器。

从识别来源到验证可否认性

研究提出了“校准式重合成”思路。系统不再试图给每张图片贴上绝对的真实或虚假标签,而是让已知生成器尝试重建输入图像:

  • 如果某个已知生成器能够忠实重建,图像的合成来源就具有合理可能性,系统应当放弃认证;
  • 如果没有已知生成器能够完成忠实重建,系统才可以在限定范围内认证其真实性;
  • 认证阈值通过校准设定,以约束已知生成内容被错误认证的概率,而不是追求表面上的最高准确率。

在研究设定下,该方法可以将生成图像被错误认证的比例控制在最多1%。研究还针对评估范围内的有界自适应攻击进行攻击感知校准,维持这一风险界限。不过,这一保证并不覆盖任意形式的图像变换,也不意味着系统能够识别所有未来生成器。

影响与局限

这项工作的价值,在于将深伪检测从“猜标签”转向“量化可认证程度”。它更适合高风险场景中的谨慎决策:认证结果代表在已知生成器和校准条件下,图像缺乏可忠实重建的证据,而不是证明图像拥有不可伪造的来源。

研究同时揭示了一个反直觉趋势:生成器越强,后验验证窗口可能越小。在对3000张 Reddit 图像的测试中,2022年生成器无法重建的图像有1116张;换用2024年生成器后,无法重建的数量降至55至79张。换言之,先进生成器不仅更擅长制造合成内容,也可能更擅长覆盖真实内容的外观空间。

因此,未来的内容认证不能只依赖单一检测器。生成器覆盖范围、校准数据、攻击模型和来源记录都需要持续更新。对于新闻、司法和平台治理而言,可靠答案可能不再是“这张图一定是真的”,而是“在当前已知模型和风险边界内,它是否仍值得被认证”。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章