AI研究智能体的高分,如何证明真的发现了新东西?
导语
当AI研究智能体在基准测试中取得更高分,真正的问题并不只是“它做得好不好”,还包括:它是否找到了训练材料或公开资料中已有的答案?如果换一个起点、屏蔽目标研究的历史信息,它还能否独立走到同一结论?来自卡内基梅隆大学团队的 Discovery Certification Protocol(DCP),试图把这些容易被忽略的问题变成可执行的审计程序。
核心要点
- 先验证成果是否有用。 Gate 1在封闭评测环境中检查智能体是否达到预先定义的改进目标。分数只是起点,而不是“发现”本身的证明。
- 再挑战结果能否被恢复。 Gate 2向匹配的审计智能体提供登记过的初始信息和可观察到的网络内容,但隐藏目标研究的历史过程。如果某种有效方法仍能达到同一数值目标,就必须提交恢复证据;一旦出现有效恢复,DCP Core会否决“发现”认证。
- 用统计边界约束未复现结论。 Core不仅要求足够的对照,还要求在一个全新的、预先登记的实验回合中,给出恢复概率的有限样本上界。因此,“这次没有人复现”不能直接被包装成“绝不可能复现”。
- 单独测量反馈的价值。 可选的 Gate 3从同一检查点出发,对比真实反馈与指定中性策略的平均效果。DCP Evidence还要求先完成独立的零假设校准,并预注册效果门槛。
审计结果与方法价值
论文用SQLite优化和虚拟催化剂控制两个任务测试完整流程,且使用了不同模型。两项审计在96个回合中都没有观察到恢复,上界为0.0468;配对研究中,真实反馈组出现30次恢复,中性反馈组没有恢复,相关的60对零假设研究也通过校准。论文同时展示了Core通过、被恢复以及审计不完整等不同判定情形,说明协议并非只为输出“通过”而设计。
另一个值得注意的部分是验证方式:冻结后的证据可以交给确定性的、无需调用大语言模型的验证器,重新得到协议判定。这降低了审计结果对提示词、模型随机性和事后解释的依赖。
意义与局限
DCP的核心贡献不是宣称某个智能体已经实现了科学发现,而是提供一种共同的证据语言:成果是否有效、是否存在可行的替代路线,以及反馈究竟贡献了多少。它把“发现”从单一分数提升为包含对照、信息边界、恢复测试和统计不确定性的完整主张。
不过,这套协议能否覆盖更开放、更长期的研究任务,仍取决于初始信息、可见网络内容、目标指标和中性策略的设计。未来,研究社区还需要检验不同任务中的登记规范与恢复方法,避免审计本身成为新的形式化门槛。无论如何,DCP提醒我们:对AI研究智能体而言,令人印象深刻的结果应当同时经受住性能验证和“你是否只是找到了答案”的挑战。
评论
正在确认登录状态……
正在加载评论……