返回文章列表
AI 科研

AI智能体开始接近开放式科学发现,但距离真正的科研判断仍很远

阅读约 3 分钟

导语

AI在科学发现中的表现,往往建立在目标已经被定义好的前提上:评价指标清晰、实验路径相对明确,系统只需寻找更优解。但真正的科研通常不是这样。研究者需要决定先问什么问题、哪些异常值得追踪、何时继续投入,以及哪些结果虽然成立却并不重要。

论文《Can AI Agents Make Open-Ended Scientific Discovery? Evidence from Station》把问题推进了一步:如果不给智能体现成的结论,也不允许它们通过网络搜索补足背景知识,它们能否在一个开放环境中持续推进研究?

核心要点

  • 测试环境更接近开放式科研。 研究团队在Station中构建了三个任务,分别源自三篇ICLR口头报告。智能体只获得原论文研究的问题和实验设置,却看不到原始结果,也无法访问互联网。它们需要自行选择研究方向、运行实验,并将经过审阅的结果写入共享知识库。
  • Station的发现覆盖率更高。 研究者将原论文中的发现拆分为若干标准,再比较不同系统找回了多少内容。Station平均复现62.7%的预设子发现;Codex Multiagent-v2为15.4%,AI Scientist-v2不同配置的结果为14.4%至20.6%。原文同时指出,比较匹配了累计实验时间,但各系统的模型团队和令牌预算并不相同,因此数字应被视为特定实验设置下的结果,而不是普遍性能排名。
  • 两个机制帮助系统坚持探索。 Supervisor负责提供方向性指导,周期性的Meta Reflection则促使智能体回顾进展、重新评估研究路线。消融与行为分析表明,二者结合后,研究覆盖范围和连续性都有改善,能够减少智能体过早转向更容易的问题。
  • 开放探索中出现了新的对应发现。 在另外两个没有“标准答案论文”作为参照的探索任务中,智能体产生的一些结果与知识截止日期之后由人类研究者报告的发现相吻合。素材特别提到,在“潜意识学习”任务中,智能体发现将LoRA训练限制在较早的层,可能恢复原本失败的特征迁移。

意义与局限

Station的价值不只在于更高的复现比例,更在于它展示了一种组织AI科研的思路:将多个智能体、实验工具、审阅流程和持久化知识结合起来,让研究过程不再是一次性问答,而是可以积累、回溯和继续推进的长期活动。研究团队还计划开放代码和完整研究记录,这有助于外部观察智能体到底发现了什么、又在哪些地方失败。

但这项工作并没有证明AI已经能够独立完成科学研究。首先,任务仍由人类预先设计,实验空间、问题表述和评价标准也受到设定影响。其次,“找到一个可复现结果”与“判断它是否重要”是两回事。研究明确指出,智能体仍会在真人研究者认为缺乏价值的问题上消耗大量资源。

因此,Station更像是一个重要的能力边界测试:AI智能体已经能够在开放程度更高的环境中维持探索,并取得可核验的进展;下一阶段的关键,则是让系统学会提出值得研究的问题、识别异常信号,并形成更可靠的科学取舍。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章