返回文章列表
模型评测

AI Agent 能独立做开放式 AI 研究吗?两项影子评测给出谨慎答案

阅读约 2 分钟

导语

“AI 会不会很快自动化 AI 研究?”这是许多关于智能爆发和研发加速预测的关键前提。但问题在于,现有证据并不充分:不少评测聚焦于有明确答案、可自动判分的任务,而真正的科研往往是开放式的,涉及选题判断、实验设计、失败后的调整以及对“可发表性”的把握。

这篇论文尝试提供一种新的评估路径。研究者提出“影子评测”(shadow evaluations):不让 Agent 做玩具任务,也不简单把 AI 写出的论文丢给拥挤且不稳定的同行评审系统,而是让它接手一篇高质量未发表论文的核心开放问题,并由原论文作者评价其产出。

核心要点

  • 评测对象更接近真实科研:实验选取两篇未发表的 NeurIPS 2026 投稿作为参照,让前沿 Agent 面对论文中最关键的研究问题。
  • 资源并不寒酸:Agent 获得六天时间和数千美元级别的计算资源,用于完成实验、工程和论文产出。
  • 工程能力表现尚可:研究指出,Agent 在无人类帮助的情况下完成了所需工程工作,说明当前系统已经能承担不少研究流程中的执行性任务。
  • 研究推进明显不足:尽管代码和实验能跑起来,Agent 并没有对核心研究问题取得实质性进展,最终两篇产出都被原作者明确拒绝。
  • 失败并非偶然:研究者进一步用第二个模型和脚手架做鲁棒性检查,类似问题仍然出现。

论文总结了五类反复出现的失败模式:其一,对可发表研究的门槛判断不足;其二,当研究设计暴露缺陷时,回应缺乏创造性;其三,走入死胡同时不能有效回溯;其四,对时间、算力等资源缺乏良好意识;其五,执行过程中出现指令漂移。

意义与影响

这项研究的价值不在于断言“AI 不能做科研”,而在于把讨论从泛泛的能力展示推进到更严苛的评估框架。它显示,当前 Agent 已经能处理 AI 研究中的大量工程环节,但开放式科研真正困难的部分,恰恰在于判断、取舍、创造性修正和长期策略控制。

对产业和研究社区来说,这意味着“自动化 AI 研发”的进展不能只看代码生成、基准榜单或封闭任务成绩。更可靠的评估需要贴近真实研究生命周期,并由具备上下文的专家审查。影子评测或许成本较高、样本有限,但它提供了一个重要方向:衡量 Agent 是否能从执行工具走向研究合作者。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
SecRespond:把 AI 安全智能体放进“失陷之后”的真实考场
模型评测
cctest.ai
模型评测

SecRespond:把 AI 安全智能体放进“失陷之后”的真实考场

SecRespond 是一个面向事后入侵响应的 AI Agent 评测基准,关注模型在主机已被攻陷后的取证、风险识别与修复规划能力。论文显示,当前前沿模型能较好处理告警暴露的问题,但对静默入侵和完整修复方案仍明显不足。

阅读全文