返回文章列表
AI 安全

分割式大模型训练的隐私盲区:返回梯度让诱饵失效

阅读约 3 分钟

导语

分割式大模型训练试图把敏感数据留在本地,只将中间激活发送给云端计算。这样的架构通常把网络连接视为隐私边界,并重点检查前向传输是否会泄露原始文本。但一项发布在 Hugging Face Daily Papers 的系统安全案例研究指出,真正被忽略的通道可能在反向传播阶段:返回给云端的输出梯度,反而让本地精心加入的“诱饵”样本暴露无遗。

漏洞如何形成

研究对象包含两个节点:持有私有损失函数的可信本地节点(TLN),以及负责云端模型计算的不可信云节点(UCN)。TLN 将受保护的激活发送给 UCN,后者完成前向计算并返回输出;随后,TLN 根据只有自己可见的损失计算梯度,再将梯度发回云端。

为扩大匿名集合,TLN 会把真实数据行与合成诱饵行混合后发送。但损失函数并不使用诱饵行,因此这些行对应的梯度严格为零。对云端而言,零梯度不是普通噪声,而是一个清晰的结构信号:哪些行有非零梯度,哪些行就是实际参与训练的数据。

研究发现

  • 研究者预先固定了检测协议,并加入已知强度的注入泄漏,以验证仪器确实能够发现泄漏。
  • 在九个随机种子下,攻击都正确识别了每个训练帧中的真实行,累计结果为每次运行 4096 个样本、全部识别。
  • 进一步针对帧内容的攻击,相比恒定猜测基线多恢复约每百个 token 中的一个,提升幅度为 0.65 至 1.50 个百分点。
  • 打乱标签的对照实验没有报告泄漏,说明检测结果并非单纯由评估流程制造。
  • 在一个模型质量仍处于预算范围的配置上,漏洞依旧存在,因此问题不只出现在不可部署的实验设置中。

更关键的是,系统在只检查前向通道时,同时通过了隐私和质量检查;把返回梯度纳入同一检查后,却失败了。这说明隐私评估若只看激活传输,可能会遗漏由训练协议和张量结构共同产生的侧信道。

缓解与影响

研究显示,对梯度的每一行进行裁剪并加入噪声,可以关闭这条零值信号,留出的代价约为 0.01 nat 的留出交叉熵。不过,这并不意味着系统已经安全。梯度本身仍可能携带有关输入和标签的信息,诱饵在多个训练步骤中的统计差异也可能形成时间维度上的识别线索。

这项工作带来的核心提醒是:分割式训练的隐私边界必须覆盖完整的双向通信和训练状态,而不能只审核“原始数据有没有离开本地”。真实部署前,评估应同时检查前向激活、反向梯度、样本混合逻辑、跨轮次关联,以及对照实验能否排除误报。看似用于增强匿名性的诱饵机制,如果没有同步处理其梯度支持模式,可能只是把隐私问题从内容泄漏转化成了行索引泄漏。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章