返回文章列表
模型评测

FlavourBench:用可执行烹饪真值重新评估大语言模型

阅读约 3 分钟

导语

大语言模型评测常常依赖人工偏好、另一个模型打分,或严格的标准答案。前两种方式可能受到评审主观性与裁判模型偏差影响,后一种方式又难以覆盖开放式任务。FlavourBench 提出了一条不同路径:把“选出更好的食材组合”变成可执行、可复核的评测问题,用一个版本固定的烹饪系统 Epicure 提供密集评分。

核心方法

每道题给模型八种食材,要求从中选择三种,形成一个组合。八选三一共有 56 种可能,Epicure 会在模型作答前为全部组合计算分数,因此评测不需要临时判断某个回答是否“听起来合理”。模型输出再与预先冻结的评分表对应,得到任务级分数。

本次核心测试包含 534 道任务,覆盖三类能力:食材替代、风味搭配和带约束的组合构成。研究团队评估了 27 个前沿模型端点,并为排行榜中的每个模型统一保留每个面板、每个类别的 89 个有效回答,共形成 14,418 个模型—任务单元。这样的设计减少了因不同模型回答缺失数量不同而产生的排名偏差。

研究还使用两个独立编制的任务面板进行交叉检查。两者得分的 Pearson 相关系数为 0.89,排名相关系数为 0.80,说明面板之间具有较强一致性。统计上,团队进行了 50,000 次锚点聚类自助法抽样,以计算同时置信区间;针对 351 组模型两两比较,则使用 100,000 次符号翻转抽样,并通过 Holm 方法控制多重比较错误。

结果与意义

Grok 4.6 的 FlavourBench 点估计最高,为 65.1;同时 95% 置信区间为 61.0—69.2。在全部 351 组模型比较中,只有 101 组被统计方法判定为已经分出差异。这一结果提醒我们:排行榜上的先后顺序,并不等于每一对模型之间都存在可靠差距。

FlavourBench 的价值不只在于增加一个“烹饪题”排行榜。它展示了一种更普适的评测思路:如果能把领域知识编码成版本化、可执行的评分系统,开放式任务就可以拥有比单一参考答案更细致的真值,同时保留自动化和复现能力。对于模型研究者而言,固定有效样本、公开评分映射和明确统计程序,也有助于把注意力从宣传式榜单转向可审计的比较。

当然,结果首先反映的是模型在该烹饪系统及其任务设计下的表现,不能直接等同于通用推理能力或真实厨艺。基准是否适合其他领域,仍取决于能否构建可信的执行器、候选空间与版本管理机制。项目目前公开提示词、评分表、原始回答、精确路由、内容哈希和离线验证器,外部研究者可以据此重建结果并进一步检验方法。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章