DeepMind校友创办的Inherent,凭小模型挑战前沿AI科研能力
导语
AI科研赛道又出现了一位低调但值得关注的参与者。由Google DeepMind校友创办的伦敦初创公司Inherent表示,其科研智能体Faraday在独立复现已发表论文结论的任务上,击败了Anthropic Claude Opus 4.8和OpenAI GPT-5.5等更大规模模型。需要注意的是,现有材料没有披露完整测试集、样本数量或第三方复核结果,因此这一成绩应被理解为公司的阶段性声明,而非对前沿模型能力的最终定论。
核心要点
- Faraday的任务不是回答论文内容,而是在不知道答案的情况下,自行设计实验、运行代码并尝试重现研究结果。
- Inherent称,Faraday运行在约270亿参数的Qwen 3.6上,规模明显小于被比较的前沿模型。
- 公司把评价标准从结果正确扩展到“科研品味”:智能体是否能判断哪些实验值得做,以及如何更有效地设计实验。
- 训练重点放在强化学习,通过实验结果和任务成效提供反馈,而不是只模仿科学论文或人类研究流程。
- Faraday使用OpenAI的GPT-5.5 Codex进行编码,体现了Inherent不打算重复制造所有基础工具的取舍。
从复现论文到AI科学家
论文复现是科研训练中的基础环节,许多博士生也会从复核已有工作开始。对AI而言,这项任务同时考验文献理解、代码执行、实验设计和结果分析,因而比单纯生成一段解释更接近真实研究流程。
Inherent认为,复现只是通往更大目标的训练场。公司希望智能体能像一名主动的研究伙伴:发现值得追问的问题,自主开展实验,再带着结果回来讨论,而不是迎合用户、只给出听起来合理的答案。这里的关键概念是“科研品味”,也就是在有限时间和资源下选择高价值问题的能力。
强化学习可能帮助模型从结果中学习这种选择,但它并不能自动解决科学评价的难题。实验是否有效、结论是否稳健、复现失败究竟源于方法还是环境,都需要严格的基准和人工审查。若缺少公开细节,外界很难判断Faraday的优势来自模型能力、工具编排,还是特定任务的优化。
意义与影响
Faraday案例首先说明,小模型配合合适的智能体流程和训练方式,可能在窄领域任务中挑战更大的通用模型。其次,科研智能体的竞争焦点正在从“会不会写答案”转向“能不能提出并验证有价值的问题”。这也解释了Inherent为何选择调用现成编码工具:真正稀缺的或许不是再造一个代码模型,而是建立可靠的实验闭环。
不过,复现已知论文与发现新知识之间仍有很长距离。Inherent目前团队规模约十余人,并计划继续招聘;其伦敦基地和DeepMind人才背景也反映出欧洲正在争夺科研型AI创业资源。接下来最值得观察的,是公司能否公开可重复的评测结果,并证明Faraday在不同学科、不同工具和陌生问题上仍能保持判断力。
评论
正在确认登录状态……
正在加载评论……