返回文章列表
模型评测

训练不会毫无痕迹:从残差结构验证语言模型血缘

阅读约 3 分钟

导语

开源语言模型的发布链条越来越复杂:基础模型可能经历微调、LoRA 合并、剪枝、量化,甚至再次合并到其他模型中。随着版本不断派生,模型卡片或权重仓库未必会完整记录来源。于是,一个实际问题浮现出来:如果没有训练数据、日志和推理样本,只查看两个兼容检查点的权重,能否判断它们是否拥有共同祖先?

论文《Training Leaves Traces》研究的正是这一问题。作者将任务定义为数据无关的白盒血缘验证,并尝试从残差网络中的权重结构提取更可靠的谱系信号。

核心方法:先排除“共同身份”

残差训练会在分支乘积中留下与模型身份对齐的共享成分。直观地看,这类成分可能在许多模型之间都存在,因此仅凭它判断两个检查点是否有血缘关系,容易把架构共性误认为训练继承。

研究的关键处理分为两步:

  • 从残差相关结构中移除共享的身份对齐部分;
  • 在多个残差块中比较不同检查点各自保留下来的结构,并据此计算对称的血缘分数;
  • 使用独立检查点进行校准,降低模型规模、架构或共同初始化带来的影响。

这种思路关注的不是模型“回答得像不像”,而是权重在训练过程中留下的结构性痕迹。因此,行为相似但来源不同的模型,理论上不应自动获得高血缘分数。

实验观察

在残差 MLP 与 GPT-2 基准上,该分数能够区分微调、LoRA 合并、剪枝和量化产生的后代模型,也能将它们与独立训练及蒸馏模型分开。论文报告的相关实验达到 AUROC 1.0,但这一结果应理解为所用基准和设置下的表现,而非对所有模型家族的普遍保证。

作者还设计了函数保持型的检查点“洗白”实验:在尽量不改变模型功能的情况下处理权重,测试传统权重空间基线是否仍能识别来源。结果显示,一些基线的区分余量下降,甚至失效;所提出的分数保持不变。在 GPT-2 上,它的运行速度比最近的稳健基线快 76 倍。投影配对信号还出现在六个语言模型家族及其他模型中,并在一个 LLaMA-2 公共检查点案例里正确识别出 3 个相关和 7 个无关检查点。

意义与边界

这项工作为开源模型治理提供了一种被动式工具:不依赖训练数据,也不要求模型作者预先嵌入水印,就能对兼容权重进行来源核验。它可用于模型仓库审计、衍生模型声明检查,以及研究不同发布版本之间的继承关系。

不过,血缘验证并不等同于完整的来源重建。分数依赖模型兼容性、残差结构和校准设置;实验结果也不能直接证明它能覆盖所有架构、重写方式或恶意篡改。因此,更稳妥的定位是:该方法补充模型卡片、训练日志和签名机制,为开源模型谱系提供一种权重层面的证据。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章