英国 AISI 借助 EvalEval 推动大模型评测结果可复现
导语
大模型评测的分数正在影响研究判断、产品宣传和政策讨论,但不同机构往往使用不同的提示词、推理预算、反馈机制和统计方法。即使评测名称相同,最终得分也未必可以直接比较。英国 AI 安全研究所(AISI)与 EvalEval Coalition 的新一阶段合作,试图从记录规范和开放基础设施入手,改善这一问题。
AISI 正在通过 EvalEval 的 Evaluation Cards,公开部分评测的结果、方法说明和配置背景。相关数据配合 AISI 的论文《How Inference Compute Shapes Frontier LLM Evaluation》,重点考察推理阶段计算量以及评测协议如何影响前沿大模型的表现。
核心要点
- 覆盖多项主流基准测试。 此次发布包含 HealthBench、FrontierMath、Humanity’s Last Exam、SWE-Bench Pro 和 Terminal-Bench 2.0 五项基准的主要实验结果。
- 涉及六个前沿模型。 数据覆盖 Claude Opus 4、Claude Opus 4.5、Claude Opus 4.6、GPT-5、GPT-5.2 和 GPT-5.4。材料同时说明,网络安全方向的 Cyber CTFs 与 The Last Ones 使用了另一组、部分重叠的模型集合。
- 从分数扩展到运行记录。 Evaluation Cards 不只保存结果,还尝试记录基准元数据、评测运行数据、模型信息以及必要的配置,使读者能够理解分数是在什么条件下产生的。
- 强调逐条记录的分析价值。 对于需要多次尝试的任务,保留 transcript-level 信息有助于研究者检查错误、反馈和任务解决过程,而不只是查看最终平均分。
- 采用 Every Eval Ever schema。 EvalEval 希望通过统一的数据结构,减少评测结果分散在论文、排行榜和平台页面后造成的信息缺失。
为什么协议比单一分数更重要
AISI 的材料以 Humanity’s Last Exam 为例,展示模型表现会随着评测协议和推理时计算量变化。在一种设置中,模型每次尝试后会获得来自“预言机”的正确性反馈;随着可使用的 token 增加,模型还可能继续解决新的任务。这说明,评测结果不仅取决于模型本身,也取决于允许模型如何思考、是否可以重试、能否获得反馈,以及研究者如何统计成功。
因此,公开一个分数并不足以支持复现。研究者还需要知道任务版本、运行配置、推理限制、反馈机制和结果汇总方式。若缺少这些信息,其他团队即使使用同一基准,也可能无法判断差异来自模型能力,还是来自实验设置。
意义与影响
这次合作的价值,在于把“评测透明度”从倡议转化为可查询的数据基础设施。经过核验的结果可以成为后续研究的参考点,也能帮助研究者将不同报告放在具体条件下比较,而不是把所有分数简单排列在同一张榜单上。
对模型开发者而言,Every Eval Ever 提供了一种更系统的结果发布方式;对基准开发者而言,它鼓励同步提交基准信息和运行数据;对治理与政策研究者而言,Evaluation Cards 则提供了按模型或基准检索评测生态的入口。
这并不意味着所有评测会立即实现完全可复现,也不意味着不同设置下的结果可以直接合并。更现实的意义是:当越来越多机构采用统一模式,评测差异的来源将更容易被发现,关于模型能力和安全性的讨论也能建立在更完整的证据之上。
评论
正在确认登录状态……
正在加载评论……