返回文章列表
模型评测

BenchMIRT:LLM基准分数究竟在测什么

阅读约 3 分钟

导语

大语言模型评测常被简化成一个总分:分数越高,模型似乎就越强。但一个基准中的每道题,往往同时考查理解、推理、知识调用、拒答判断等能力。若把所有题目简单平均,最终分数可能难以说明模型究竟在哪方面表现更好。

Ai2推出的BenchMIRT,试图从题目层面审计LLM基准,回答一个更基础的问题:一个评测分数,真正测量的是什么?

核心方法:从单一分数拆出多种能力

BenchMIRT借鉴心理测量学中的项目反应理论(IRT)。传统IRT会估计受测者能力、题目难度,以及题目区分不同能力水平的效果。BenchMIRT进一步采用多维项目反应理论(MIRT),允许一道题同时关联多个潜在能力。

研究团队使用100个LLM在16个基准、超过3.4万道题目上的结果训练模型,而且没有提前告诉系统哪些测试属于安全、哪些属于通用推理。模型反复分析后稳定识别出两个主要维度:安全能力和通用推理能力。这里的“能力”是从模型答题模式中统计推断出来的,并不等同于对模型本质的完整定义。

BenchMIRT同时估计模型在各维度上的强弱,以及每道题的难度和区分度。这样,研究者可以观察某个基准分数主要由哪种能力驱动,也能找出最能区分模型的题目。

结果揭示:基准名称不等于测量内容

  • BBQ不只是在测偏见。 该测试中的部分问题还要求模型正确追踪人物关系、理解上下文并依据证据作答。因此,较低分数可能部分源于推理困难,而非单纯的安全或社会偏见行为。
  • WMDP更接近推理信号。 它考查生物、化学和网络安全等危险双用途知识,但理想表现通常是拒绝提供相关信息。分析发现,较强的通用推理能力与更低的WMDP分数相关,这说明“答得出来”与“按安全标准答对”并不是同一件事。
  • HarmBench内部也存在差异。 常规有害请求和带上下文的请求都更贴近安全维度,而其中的版权问题则更接近通用推理维度。一个总分因此可能掩盖题型之间的结构差异。

更少题目,也能保留更多信息

BenchMIRT还可根据题目难度和区分度筛选评测集。在实验中,只保留原题目的10%,通常仍能大致保留模型在相关安全或推理能力上的强弱关系;保留50%时,与完整测试的能力测量往往更接近。对于未观测过的题目,BenchMIRT预测模型答对与否的准确率为79%,高于只用模型总体基准表现进行推断的70%。

意义与边界

这项工作并不是宣称现有基准失效,而是提醒评测者:总分是一种压缩后的信号,不能自动等同于单一能力。未来的基准设计可以报告分维度结果、检查题目集是否混入额外能力,并优先保留信息量更高的题目。

不过,BenchMIRT的结论仍依赖参与建模的模型、题目和答题结果。它能帮助发现统计关联,却不能替代对题目内容、评分标准和安全目标的人工审查。对模型进行比较时,查看能力分解和题目构成,可能比只看一个排行榜分数更可靠。

来源:Hugging Face Blog

评论

正在确认登录状态……

正在加载评论……

相关文章