返回文章列表
模型评测

WhatWorkedBench:用有限实验检验 AI 研究代理是否真正理解“什么有效”

阅读约 3 分钟

导语

AI 研究代理不只是要会写代码、运行实验,还必须回答一个更关键的问题:究竟是哪一个组件改变了结果,以及下一步实验应该测什么。WhatWorkedBench 将这一能力单独提炼出来,称为“实验理解”,并尝试用可复现的基准衡量代理能否在有限实验预算下恢复组件变化与任务得分之间的关系。

核心要点

  • 任务从执行实验转向预测实验结果。 代理首先检查工作流代码,选择有限数量的测量配置,然后提交一张响应面,预测所有组件设置组合的得分。评估重点不是某一次运行是否成功,而是代理能否准确描述组件变化的影响。
  • 基准提供了较完整的参考空间。 研究者对配置进行穷举式 CPU 执行,在固定其他组件的条件下,计算每个组件变化带来的参考效应。数据覆盖 36 个任务、30 个数据源和 8 类工作流,共包含 1248 条配置记录;核心评估还结合了 4206 条数值控制记录和 108 次代理实验轨迹。
  • 有限测量也可以支持有效决策。 在新增 8 次测量的设置中,成对效应岭回归在 22 个数据源中的 15 个上选出了最优配置,并在部分数据源上将所有效应误差控制在得分范围的 10% 以内。这说明实验设计本身会显著影响代理能否找到有效方案。
  • 后处理建模能提升代理观察的价值。 对同一批代理观测拟合高斯过程后,原始 Flash 队列的效应恢复指标从 0.632 提升到 0.698,另一队列则从 0.621 提升到 0.720。在已完成的节拍检测和图任务提交中,按工作流族汇总的恢复指标也从 0.303 提升到 0.455。
  • 程序结构是重要的先验信息。 对包含 6 个二元选项的工作流,在 20 次新增测量中识别出代码行为等价、即不同配置实际执行结果相同的情况后,高斯过程的恢复指标从 0.248 提升到 0.462。

意义与影响

WhatWorkedBench 的价值在于,它把“代理是否理解实验”从笼统的研究能力拆解为可测量的预测问题。一个代理可能能够生成看似合理的实验代码,却未必知道哪些改动真正造成了性能变化;如果它无法区分相关性、偶然波动和可复用的组件效应,就很难在预算有限时持续改进。

这套基准也提示,实验代理的进步不应只依赖更强的语言模型。主动选择测量点、利用响应面和高斯过程进行数值推断,以及从代码中识别等价配置,都是提升研究效率的关键环节。未来,WhatWorkedBench 可用于比较不同实验策略、研究自适应实验设计,并检验代理能否把程序结构转化为有效先验。

不过,基准主要衡量代理对组件效应的预测准确度,并不等同于完整的科学发现能力。它为实验理解提供了一个清晰的切入口,也为后续评估更复杂的研究流程奠定了基础。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
ExplorationBench:让AI在“外星世界”中接受探索能力考验
模型评测
cctest.ai
模型评测

ExplorationBench:让AI在“外星世界”中接受探索能力考验

ExplorationBench试图解决一个长期难题:如何判断AI是真的通过实验发现新规律,而不是从训练数据中回忆答案。研究者构建了两个规则可执行、又有意违背常识的虚拟环境,用可验证任务评估模型的探索过程与结果。

阅读全文