从模型行为追溯数据来源:合成预训练让表格模型归因变得可验证
导语
训练数据归因试图回答一个关键问题:模型的某项能力,究竟由哪些训练样本塑造?在真实大模型中,这一问题往往难以验证,因为研究者通常无法重新训练一个只缺少特定数据的模型,也很难观察单个样本的真实因果影响。来自 arXiv 的一项研究提出,受控的合成预训练环境,或许能把这一问题从相关性分析推进到可实验检验。
核心方法
研究围绕 O'PRIOR 展开。这是一个面向表格基础模型的合成任务生成器,能够为每个预训练任务保留明确的来源信息,包括数据生成结构、缺失机制、混杂关系、潜在捷径以及分布偏移。由于这些属性在生成阶段已知,研究者可以把模型行为归因结果,与任务的真实来源进行对照。
作者采用了三类互补实验:
- 行为条件归因:根据模型在目标任务上的表现,识别可能产生影响的预训练任务。
- 反事实重训:移除归因排名靠前或靠后的任务,再重新训练模型,观察性能变化。
- 来源感知干预:针对具有特定捷径来源的任务进行定向删除,检验机制层面的影响是否与归因结果一致。
主要结果
在保留的真实任务上,移除归因排名最高的 5% 合成任务后,平均 ROC-AUC 下降 0.013;随机移除相同比例任务时,变化约为 0.002±0.004。相反,移除排名靠后的任务,性能反而提升 0.003。这一对照表明,归因方法捕捉到的并非完全随机的噪声,而是与模型表现存在可干预联系的数据。
在带有捷径来源的任务子集中,定向移除带来的影响为 0.043,而匹配的随机移除为 0.016,说明归因结果在特定机制上也具有一定解释力。不过,来源识别的排名 AUROC 只有 0.55—0.62。也就是说,某些任务可能在来源特征上相似,却未必是造成目标行为变化的关键因素。
意义与局限
这项工作的价值不在于证明某一种归因算法已经解决了训练数据追踪,而在于提供了一个可控的验证框架。它提醒研究者,评价数据归因不能只看检索命中率或来源分类准确度,还应进行反事实删除和重新训练,检验归因对象是否真的具有贡献。
对于表格基础模型、合成数据训练和数据治理而言,这种方法可用于发现有害捷径、定位造成分布偏移的任务,并辅助决定哪些数据值得保留或清理。与此同时,实验依赖合成任务及其显式来源标签,结论能否直接迁移到规模更大、来源更复杂的真实预训练语料,仍需进一步验证。研究最重要的启示是:数据“像什么”与数据“造成了什么”是两个不同问题,可靠的训练数据归因必须同时回答这两者。
评论
正在确认登录状态……
正在加载评论……