ASI-Bench:从会答题到能独立做科研,AI还有多远?
导语
今天的AI已经能够检索资料、总结论文、生成代码,也能在明确规则和步骤的任务中取得不错成绩。但“完成一个已知问题”和“从未知中发现可验证的新知识”并不是同一件事。后者要求系统提出有价值的方向、选择合适的方法、处理研究过程中的不确定性,并对最终结果负责。
ASI-Bench正是围绕这道鸿沟设计的评测。论文将其定位为面向人工超级智能的重要基准,重点考察AI在一般科研场景中的创新探索与自主执行能力。
核心要点
- 项目级,而非单轮问答。 基准包含60项研究任务,覆盖11个科学领域,评测对象不只是一个答案,而是一项从思路到结果的完整研究项目。
- 逐步撤除人类方法指导。 在较容易的设置中,系统获得较完整的方法论指引;随后指导逐渐减少,直到只给出研究目标、由智能体自行决定采用什么方法。
- 结果必须可验证。 任务经过专家审阅、AI辅助审计、沙盒执行和评分器验证,目标是减少“文字看起来合理、实际无法复现”的情况。
- 自主性带来明显性能损失。 在18种前沿智能体—模型配置中,完整方法指导下的平均分为50.91;当只指定方法时降至29.10;要求系统自行确定方法时进一步降至26.62。
这组结果说明了什么?
最直接的信号是,当前模型的能力很大程度上仍依赖人类提供的研究框架。它们或许擅长执行已经规划好的步骤,却不一定能在缺少路线图时判断问题该如何拆解、哪些假设值得检验,以及失败后应怎样调整策略。
这也解释了为什么传统基准容易高估AI的“科研能力”。如果题目已经给出数据、工具、方法乃至评价标准,模型主要展示的是知识调用和流程执行;而真正的科研工作往往充满开放性,研究者需要在信息不完整、结果不确定的情况下不断做选择。
ASI-Bench的价值不在于宣称某个系统已经接近超级智能,而在于提供了一个更接近真实研究过程的压力测试。它把“自主科学发现”拆成可观察的能力链条:探索未知、选择方法、执行实验或分析、验证结论。对模型开发者而言,这有助于定位瓶颈;对使用AI做科研的团队而言,也提醒他们不要把流畅的报告直接等同于可靠的研究成果。
当然,基准分数仍不能完全代表现实世界的科学创造力。不同领域的任务难度、评分方式和工具条件都可能影响结果,论文摘要也没有展示各任务的完整细节。更稳妥的结论是:在方法指导被撤除后,现有系统的自主研究能力明显不足,而如何让智能体形成稳定的假设生成、方法选择和自我校验闭环,仍是通往更强AI科学家的关键课题。
评论
正在确认登录状态……
正在加载评论……