返回文章列表
模型评测

AutoSciBench:让科学智能体参与设计更难的测试

阅读约 3 分钟

导语

当科学智能体能够快速解决一批公开测试题时,分数上涨未必意味着推理能力真正提升,也可能说明基准已经饱和。尤其在计算生物学、材料科学和临床成像等领域,评测任务不仅要写出问题,还要准备数据、运行环境和可靠答案,更新过程需要大量专业知识与人工时间。Genentech团队提出的AutoSciBench,试图把“出题—测试—修订”变成一个可循环的自动化过程。

核心机制

AutoSciBench并不是简单地让模型随机生成题目,而是将每项任务拆成两层:

  • 高层概念:规定科学领域、数据模态,以及任务需要的推理方式;
  • 低层配方:描述问题如何生成、环境如何搭建、标准答案如何构造与验证。

生成任务后,科学智能体负责求解,并留下完整的求解轨迹;评审智能体则提供反馈。系统据此判断任务是否存在可利用的表面线索或捷径,再修改配方甚至调整任务概念。例如,任务可能从依赖现成中间结论,转向要求智能体重新检查原始数据、解释中间结果,并整合多条证据。

这套流程的关键不只是“把题变难”,而是把失败经验沉淀下来。已经完成的任务修订轨迹会被抽象成经验,用于指导后续的新概念生成。因此,早期任务中发现的漏洞,有机会在之后的任务设计中提前规避,形成类似基准自身学习的机制。

实验结果与边界

研究从已有基准出发,在计算生物学、材料科学和临床成像三个方向测试AutoSciBench。初始生成任务往往较容易,被生成系统自身就能解决;经过多轮修订和经验积累后,任务难度提高,而且挑战也能延伸到其他求解模型。与人工整理的基准相比,生成基准在计算生物学和材料科学上的平均求解准确率分别降低22.4和25.5个百分点,说明它们更能拉开模型能力差异。三大领域的生成任务还获得了更高的平均质量评价。

不过,这些结果并不意味着自动生成已经替代专家。科学答案的正确性、环境的可复现性和评价标准本身,仍然需要可靠验证。准确率下降也只能说明任务更具挑战,不能单独证明每道题都更有科学价值。

意义与影响

AutoSciBench的价值在于重新定义基准的生命周期:基准不再是发布后长期不变的题库,而可以根据智能体的行为持续修订。对科学AI开发者而言,这有助于发现模型是否真正读取原始证据、理解实验过程并进行跨信息源推理,而不是依靠记忆或提示中的线索。对评测社区而言,概念与配方的分离也提供了更清晰的可扩展接口。

未来,自动化基准仍需面对数据泄漏、评审偏差、任务难度失控和科学结论可验证性等问题。AutoSciBench展示的更重要方向是:当智能体越来越擅长答题时,评测系统也必须具备持续学习和主动设防的能力。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章