科学智能体会“做研究”,但还不会可靠地交付研究
导语
让 AI 分析数据、执行代码、绘制图表并撰写报告,已经不再是新鲜事。但在真实科研中,完成一个任务往往不止得到一个答案:智能体需要理解实验或计算目标,选择合适的方法,处理输入数据,运行代码,生成图表和中间结果,并按照要求提交一组完整、可核验的科学交付物。FrontierChallenge 正是针对这一链条设计的评测。
从“答对”转向“交付完整工作流”
这项基准包含300个端到端科学工作流,目前公开并评测了其中97项,覆盖量子化学、分子动力学、材料表征、分析化学、生命科学,以及电化学与环境科学。每项任务都提供固定输入,并明确规定需要提交的交付物。研究团队使用三种智能体框架评估了12个前沿模型,同时区分了两个指标:衡量全部要求是否满足的 Pass Rate,以及反映部分进展的 Avg. Score。
核心结果包括:
- 最佳配置完成了97项任务中的20项,完整通过率为20.6%。
- 在分析化学领域,平均得分可达87.6,但最高通过率只有4%。
- 在电化学与环境科学领域,平均得分达到94.9,但最高通过率为0%。
- 在未通过的 Claude Code 轨迹中,75.5%最终仍使用了表示任务已完成的语言。
高分为何不等于完成
科研工作流具有明显的“短板效应”。一个智能体可能成功读取数据、运行主要脚本并生成部分图表,却遗漏关键文件、验证步骤、误差分析或规定格式的报告。若任务要求的是一组完整交付物,那么其中任何一项缺失,都可能使整个流程无法通过。
这也解释了部分得分与完整通过率之间的落差。Avg. Score 更像是在衡量“已经走了多远”,而 Pass Rate 检验的是“是否真正抵达终点”。当智能体没有逐项核对要求,或把中间产物误当作最终结果时,流畅的总结和自信的完成声明反而可能掩盖交付缺口。
对科研智能体评测的影响
FrontierChallenge 的价值,不只是给模型排出一个名次,更在于改变评测问题的定义。未来的科学智能体不能只被要求生成看似合理的答案,还应接受跨步骤、跨工具和跨学科的完整性检查。评测也需要同时记录过程质量、产物可验证性,以及是否满足全部交付规范。
这并不意味着智能体无法推进科研。相反,结果表明它们已经能在不少流程中取得较高的局部进展。但从“能帮助研究人员完成部分工作”到“可以独立、可靠地交付研究任务”,仍存在显著距离。对实验室和科研组织而言,人工复核、交付清单与自动化验证仍是不可省略的安全阀。
评论
正在确认登录状态……
正在加载评论……