返回文章列表
模型评测

英国 AISI 借助 EvalEval 推动大模型评测结果可复现

阅读约 3 分钟

导语

大模型评测的分数正在影响研究判断、产品宣传和政策讨论,但不同机构往往使用不同的提示词、推理预算、反馈机制和统计方法。即使评测名称相同,最终得分也未必可以直接比较。英国 AI 安全研究所(AISI)与 EvalEval Coalition 的新一阶段合作,试图从记录规范和开放基础设施入手,改善这一问题。

AISI 正在通过 EvalEval 的 Evaluation Cards,公开部分评测的结果、方法说明和配置背景。相关数据配合 AISI 的论文《How Inference Compute Shapes Frontier LLM Evaluation》,重点考察推理阶段计算量以及评测协议如何影响前沿大模型的表现。

核心要点

  • 覆盖多项主流基准测试。 此次发布包含 HealthBench、FrontierMath、Humanity’s Last Exam、SWE-Bench Pro 和 Terminal-Bench 2.0 五项基准的主要实验结果。
  • 涉及六个前沿模型。 数据覆盖 Claude Opus 4、Claude Opus 4.5、Claude Opus 4.6、GPT-5、GPT-5.2 和 GPT-5.4。材料同时说明,网络安全方向的 Cyber CTFs 与 The Last Ones 使用了另一组、部分重叠的模型集合。
  • 从分数扩展到运行记录。 Evaluation Cards 不只保存结果,还尝试记录基准元数据、评测运行数据、模型信息以及必要的配置,使读者能够理解分数是在什么条件下产生的。
  • 强调逐条记录的分析价值。 对于需要多次尝试的任务,保留 transcript-level 信息有助于研究者检查错误、反馈和任务解决过程,而不只是查看最终平均分。
  • 采用 Every Eval Ever schema。 EvalEval 希望通过统一的数据结构,减少评测结果分散在论文、排行榜和平台页面后造成的信息缺失。

为什么协议比单一分数更重要

AISI 的材料以 Humanity’s Last Exam 为例,展示模型表现会随着评测协议和推理时计算量变化。在一种设置中,模型每次尝试后会获得来自“预言机”的正确性反馈;随着可使用的 token 增加,模型还可能继续解决新的任务。这说明,评测结果不仅取决于模型本身,也取决于允许模型如何思考、是否可以重试、能否获得反馈,以及研究者如何统计成功。

因此,公开一个分数并不足以支持复现。研究者还需要知道任务版本、运行配置、推理限制、反馈机制和结果汇总方式。若缺少这些信息,其他团队即使使用同一基准,也可能无法判断差异来自模型能力,还是来自实验设置。

意义与影响

这次合作的价值,在于把“评测透明度”从倡议转化为可查询的数据基础设施。经过核验的结果可以成为后续研究的参考点,也能帮助研究者将不同报告放在具体条件下比较,而不是把所有分数简单排列在同一张榜单上。

对模型开发者而言,Every Eval Ever 提供了一种更系统的结果发布方式;对基准开发者而言,它鼓励同步提交基准信息和运行数据;对治理与政策研究者而言,Evaluation Cards 则提供了按模型或基准检索评测生态的入口。

这并不意味着所有评测会立即实现完全可复现,也不意味着不同设置下的结果可以直接合并。更现实的意义是:当越来越多机构采用统一模式,评测差异的来源将更容易被发现,关于模型能力和安全性的讨论也能建立在更完整的证据之上。

来源:Hugging Face Blog

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
模型明明知道,却为什么不回答?PIR尝试读取语言模型的隐藏认知
模型评测
cctest.ai
模型评测

模型明明知道,却为什么不回答?PIR尝试读取语言模型的隐藏认知

一项新研究提出PIR方法,通过分析语言模型的内部状态,判断模型是不知道答案,还是知道却选择隐藏。实验显示,这种方法在欺骗、沙盒测试和密码锁定等场景下仍能识别模型认可的答案。

阅读全文