LLM裁判也会偏心:能力越强的模型,越容易拿到宽松评分
导语
LLM正在被广泛用作模型训练和测试中的“自动裁判”。它们可以快速阅读答案、按照标准打分,因而被视为降低人工评测成本的重要工具。但裁判本身并不天然中立:如果评审模型的能力、被评模型的能力与评分标准之间存在系统性关系,自动评测就可能把模型差异误判为质量差异。
arXiv论文《Can We Trust LLM Judges》把注意力放在更贴近实际应用的绝对评分任务上,而不是此前研究较多的成对比较。作者在四个基准和六个模型上构造了36组“裁判—被评模型”组合,考察裁判准确性与能力相关的偏差。
核心发现
- 裁判能力与评审准确率高度相关。 在多数模型上,模型完成任务的准确率与其判断答案的准确率呈强正相关,皮尔逊相关系数达到0.90或更高。这说明更强的模型通常也更有能力识别答案质量。
- 能力也可能带来方向性偏差。 模型任务准确率与方向性偏差呈强负相关,相关系数不高于-0.83,意味着能力提升往往伴随某些偏差减弱,但并不等于偏差消失。
- 更强的被评模型更容易获得宽松评价。 所有裁判都表现出类似趋势:被评模型越强,越可能得到更宽容的判断,相关系数达到0.83或更高。由此可见,“使用更强的裁判”并不能自动保证公平。
- 多裁判集成有助于校准。 研究提出校准加权多数投票方法,根据在线估计的假阳性率和假阴性率,为不同裁判分配权重,而不是简单统计多数票。
- 不依赖人工标签。 研究者进一步提出基于裁判间分歧的误差率估计器,只利用不同裁判的同意与分歧模式,不需要真实标签或任务元数据。在任务分布发生变化的模拟实验中,该方法与掌握真实误差率的理想方案平均相差不超过0.5个百分点,并优于单一裁判和无权多数投票。
意义与局限
这项工作的重要性在于,它把“LLM能否当裁判”从单一准确率问题,推进到了能力依赖偏差和评测校准问题。对于模型训练、基准测试和自动反馈系统而言,单个裁判的高分并不能证明评分公平;更强的被评对象可能因其整体能力而获得额外宽容。
加权集成提供了一条可扩展思路:系统可以持续观察多个裁判的分歧,并据此更新权重,在缺少大规模人工标注时改善稳定性。不过,论文摘要所述结果主要来自四个基准和模拟分布变化实验,尚不足以证明该方法适用于所有任务、评分尺度或真实生产环境。实际部署仍需要关注裁判之间的相关错误、提示词变化以及不同领域中的评价标准漂移。
总体而言,研究传递出的结论并不是“不要使用LLM裁判”,而是不要把单一裁判的判断视为无偏真值。随着被评模型能力不断提高,评测系统也需要从单模型打分转向可监测、可校准的多裁判机制。
评论
正在确认登录状态……
正在加载评论……