当 AI 开始训练 AI 审稿人:科学判断如何走向坍缩
导语
大型语言模型正在进入科学评估流程:它们既可以直接生成论文评审,也可以作为人类审稿人的辅助工具。随着这些模型生成的评审公开发布,并被后续数据集或训练语料吸收,评审系统可能形成一个递归循环——新模型学习的不再只是论文和人类判断,也包括早期模型留下的判断痕迹。
一篇发表于 Hugging Face Daily Papers 的研究,专门考察了这一循环中的一个步骤。研究者将问题概括为“科学判断坍缩”:当合成评审不断进入训练过程,模型的评分与论证可能变得更集中、更相似,进而削弱科学评估应有的多样性。
研究如何展开
研究从 Llama 3.1 8B 开始,先使用 2018—2023 年的 ICLR 官方评审训练一个审稿模型。随后,研究团队基于 ICLR 2024 数据训练了四个后继模型,并系统改变官方评审与模型生成评审的混合方式。这样的设计旨在隔离一个关键变量:训练监督中加入合成内容后,模型的判断风格会发生什么变化。
论文重点观察了两类指标。第一类是评分分布,关注模型是否逐渐倾向于给出更集中的评价;第二类是语义多样性,分别考察同一篇论文收到的评审之间,以及整个评审语料库中的表达与判断差异。
核心发现
- 引入模型生成的评审后,评分分布出现压缩趋势,判断结果更容易集中在相近范围。
- 同一篇论文的评审之间,语义多样性下降,意味着不同评审可能变得更加相似。
- 在整个语料层面,评审内容的语义多样性同样减少,可能形成更单一的判断模式。
- 这种变化并不只是文本措辞趋同,也涉及科学评价中“如何看待问题”的空间收窄。研究者将其命名为科学判断坍缩。
需要注意的是,论文研究的是受控环境中的一个反馈环节。它揭示了递归训练的具体风险,但并不意味着所有模型生成评审都会必然导致相同结果,也不能据此断言自动审稿已经取代人工同行评议。
TrustReviewer 的应对思路
为降低这一风险,研究团队提出了开源系统 TrustReviewer。它采取两个互补阶段的干预方案。
在训练阶段,系统使用经过整理的语料进行单阶段训练,目标是减少低质量或语义退化的监督信号。重点不只是扩大数据规模,而是避免把已经趋同、缺乏信息量的评审继续当作可靠范例。
在测试阶段,系统使用成对激活引导,在不继续训练、也不增加专家标注的情况下,调整模型残留的判断倾向,使其不那么容易滑向压缩后的评价模式。两种方法分别对应数据源头和模型使用环节,构成从训练预防到推理修正的组合方案。
意义与影响
这项研究提醒人们,AI 评审系统的质量不能只看与某个参考评分的接近程度。科学评估还需要保留对不同问题的敏感度、对缺陷的多角度描述,以及在证据不足时表达不确定性的能力。如果后续模型持续学习前代模型的输出,系统或许会看起来更加稳定,却同时失去发现异常观点和提出独立质疑的能力。
因此,未来构建 AI 辅助科研评估系统时,需要追踪训练语料的来源,区分人类评审与模型生成内容,并持续监测评分分布和语义多样性。TrustReviewer 提供了一个可操作的研究方向,但其价值也在于提出更广泛的问题:当机器开始评价科学,再由机器学习这些评价时,谁来负责守住判断的多样性?
评论
正在确认登录状态……
正在加载评论……