返回文章列表
模型评测

LLM裁判也会偏心:能力越强的模型,越容易拿到宽松评分

阅读约 3 分钟

导语

LLM正在被广泛用作模型训练和测试中的“自动裁判”。它们可以快速阅读答案、按照标准打分,因而被视为降低人工评测成本的重要工具。但裁判本身并不天然中立:如果评审模型的能力、被评模型的能力与评分标准之间存在系统性关系,自动评测就可能把模型差异误判为质量差异。

arXiv论文《Can We Trust LLM Judges》把注意力放在更贴近实际应用的绝对评分任务上,而不是此前研究较多的成对比较。作者在四个基准和六个模型上构造了36组“裁判—被评模型”组合,考察裁判准确性与能力相关的偏差。

核心发现

  • 裁判能力与评审准确率高度相关。 在多数模型上,模型完成任务的准确率与其判断答案的准确率呈强正相关,皮尔逊相关系数达到0.90或更高。这说明更强的模型通常也更有能力识别答案质量。
  • 能力也可能带来方向性偏差。 模型任务准确率与方向性偏差呈强负相关,相关系数不高于-0.83,意味着能力提升往往伴随某些偏差减弱,但并不等于偏差消失。
  • 更强的被评模型更容易获得宽松评价。 所有裁判都表现出类似趋势:被评模型越强,越可能得到更宽容的判断,相关系数达到0.83或更高。由此可见,“使用更强的裁判”并不能自动保证公平。
  • 多裁判集成有助于校准。 研究提出校准加权多数投票方法,根据在线估计的假阳性率和假阴性率,为不同裁判分配权重,而不是简单统计多数票。
  • 不依赖人工标签。 研究者进一步提出基于裁判间分歧的误差率估计器,只利用不同裁判的同意与分歧模式,不需要真实标签或任务元数据。在任务分布发生变化的模拟实验中,该方法与掌握真实误差率的理想方案平均相差不超过0.5个百分点,并优于单一裁判和无权多数投票。

意义与局限

这项工作的重要性在于,它把“LLM能否当裁判”从单一准确率问题,推进到了能力依赖偏差和评测校准问题。对于模型训练、基准测试和自动反馈系统而言,单个裁判的高分并不能证明评分公平;更强的被评对象可能因其整体能力而获得额外宽容。

加权集成提供了一条可扩展思路:系统可以持续观察多个裁判的分歧,并据此更新权重,在缺少大规模人工标注时改善稳定性。不过,论文摘要所述结果主要来自四个基准和模拟分布变化实验,尚不足以证明该方法适用于所有任务、评分尺度或真实生产环境。实际部署仍需要关注裁判之间的相关错误、提示词变化以及不同领域中的评价标准漂移。

总体而言,研究传递出的结论并不是“不要使用LLM裁判”,而是不要把单一裁判的判断视为无偏真值。随着被评模型能力不断提高,评测系统也需要从单模型打分转向可监测、可校准的多裁判机制。

arXiv

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Benchmark Radar:把 AI 基准测试检索变成一项可追溯的基础设施
模型评测
cctest.ai
模型评测

Benchmark Radar:把 AI 基准测试检索变成一项可追溯的基础设施

Benchmark Radar 是一个持续更新的 AI 基准测试数据库与搜索引擎,聚合论文、代码仓库、数据集、模型卡和技术报告中的评测证据。它试图帮助研究者更快找到相关基准,并在比较分数时看到实验设置、来源和使用趋势。

阅读全文
CCTest · Blog
SAEScientist-Bench:AI智能体能独立完成机制可解释性研究吗?
模型评测
cctest.ai
模型评测

SAEScientist-Bench:AI智能体能独立完成机制可解释性研究吗?

SAEScientist-Bench将稀疏自编码器(SAE)研究转化为可测评任务,检验AI智能体能否自主发现模型内部具有语义意义的特征。结果显示,智能体已能筛选出有价值的候选特征,但在因果操控和实验结果解读上仍明显落后于专家。

阅读全文