AutoResearch 评测揭示:科研智能体为何会失败
导语
当大语言模型开始承担从提出假设到撰写论文的整段科研流程,评估一个科研智能体是否“会做研究”,就不能只看最后生成的报告。论文《How Do Agents Fail on AutoResearch》推出了 AutoResearchEval,试图把问题从“答案对不对”推进到“智能体是怎样一步步走偏的”。
评测覆盖完整科研链路
AutoResearchEval包含100项源自已发表前沿研究的真实任务,覆盖7个科学领域以及科研生命周期的多个环节:构思、信息检索、实验执行、结果分析、论文写作和同行评审。研究者测试了8种“模型—智能体框架”组合,共收集800条完整轨迹,并对过程和中间产物进行标注。
这套设计的关键,在于不把报告视为唯一证据。评测同时检查智能体的操作日志、代码、运行目录、数据与最终文本。例如,报告中的数字是否真的出现在实验结果里,方法描述是否对应实际执行过的代码,结论是否能追溯到具体运行过程。对于缺少标准答案的开放式任务,评估重点转向过程严谨性与不同产物之间的内部一致性。
45种失败模式指向同一个缺口
研究团队将观察到的现象整理为 AutoResearch Failure Taxonomy(ARFT),包含45种基于实证的失败模式。素材中提到的典型问题包括:
- 路径锚定:某种工具调用或研究方案失效后,智能体仍反复尝试,而不是切换策略。
- 局部优化与过早停止:系统完成了看似合理的局部步骤,却没有确认整体目标是否已经达成。
- “理由错误但结果碰巧正确”:最终答案可能看起来可信,但推理依据、实验记录或引用无法支撑它。
- 结果幻觉与不可追溯主张:报告中的数字、结论或方法与实际运行产物不一致,甚至描述了从未执行的代码。
- 错误级联与目标漂移:早期判断没有被及时复核,随后逐步影响检索、实验、分析和写作。
这些模式表面上分布在不同阶段,底层却呈现出相似结构:智能体很少主动把“我刚刚产出的东西”与“我真正找到或运行的东西”进行对照,也缺少发现矛盾后重做的机制。研究因此将核心瓶颈概括为元认知闭环不足,即检查、怀疑、修正和重新规划能力不够。
评测方法也有边界
研究并非声称已经完全捕捉所有生产环境风险。作者回应指出,逐步堆积的无关上下文是一个尚未被单独拆出的机制。当前方法可以观察到错误级联和目标漂移,但无法完整看到每一步由框架组装出的上下文,以及模型究竟如何使用这些内容。因此,部分上下文退化问题可能被低估。
这项工作对 AutoResearch 的意义,不只是增加一套排行榜。它提醒开发者,科研智能体需要的不仅是更强的检索、编码或写作能力,还需要内置的交叉核验节点:运行后核对数据,写作前回看证据,得出结论后检查是否与代码和结果一致。未来的系统评估,也应从单一最终分数转向可审计轨迹、关键中间产物和失败归因。
如果智能体不能对自己的过程产生合理怀疑,那么它越能完成长流程任务,错误就越可能以完整、流畅且貌似专业的形式被放大。AutoResearch 的下一步,或许不是让系统更快地生成论文,而是让它在提交之前真正知道哪些地方仍然站不住脚。
评论
正在确认登录状态……
正在加载评论……