返回文章列表
模型评测

GAMUT:把“事实完整性”纳入长文本生成评测

阅读约 3 分钟

导语

长文本生成评测长期把重点放在“模型有没有胡说”上:把回答拆成若干声明,再检索证据、验证真伪。这类流程能较好发现错误事实,但对另一个问题不够敏感:回答是否把该说的内容都说到了?Meta AI 相关研究提出的 GAMUT,正是把“事实完整性”作为评测对象,试图补齐事实性评估中被忽视的一半。

核心要点

  • 从精确性转向完整性:传统事实性评测更像查错,关注模型说出的声明是否正确;GAMUT 更关注遗漏,衡量一个完整回答应覆盖哪些事实、结构和关系。
  • 两层元评分表设计:研究先用结构化 meta-rubric 描述答案应包含的内容组织、重要性、顺序和相互关系,再将其机械编译为扁平的二元检查项,便于 LLM 裁判稳定打分。
  • 适配开放式问题:很多开放式任务并不适合简单列出若干独立事实。例如答案可能需要覆盖一个开放集合、描述一个有先后顺序的流程,或解释事实之间的依赖关系。两层表示能更好保留这些结构。
  • 基准构建:GAMUT 包含 1,813 个问题,基于真实可穿戴图像,覆盖 10 个不同领域。每个问题都配有由证据支撑、并经专家人工标注者验证的评分表。
  • 模态无关扩展:虽然该基准实例化为多模态事实完整性评测,研究也发布了文本-only 变体,说明其框架并不绑定某一种输入模态。
  • 模型测试结果:研究评估了 14 个前沿和开源权重模型,发现该基准确实具有难度、区分度,并且对裁判模型选择相对稳健;素材显示最佳分数为 Gemini 3.1 Pro 的 58.7%。

意义与影响

GAMUT 的价值不只在于又增加了一个排行榜,而在于改变了对“好答案”的定义。一个模型即使没有明显错误,也可能因为遗漏关键步骤、缺少重要类别、忽视关系而无法满足用户需求。尤其在医疗、教育、现场操作、图像理解等长回答场景中,“没错但不全”同样会造成决策风险。

两层评分表也提供了一种折中路径:人类专家负责设计高层结构,机器再把它转成可规模化评测的检查清单。这比完全依赖人工评分更可扩展,也比简单布尔列表更能表达开放式任务的复杂性。

当然,完整性评测本身仍依赖高质量评分表。如何控制标注成本、避免评分表偏见,以及在更广泛领域验证这种方法,仍是后续需要观察的问题。但 GAMUT 提醒行业:事实性不只是“不要编造”,还包括“不要漏掉重要事实”。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章