返回文章列表
AI 科研

HypoEvolve:让多智能体像遗传算法一样迭代科学假设

阅读约 3 分钟

科学发现往往不是由一个想法直接产生,而是在多个解释之间竞争、组合、修正和淘汰的过程中逐步形成。HypoEvolve 试图把这一过程转化为可设计、可比较的多智能体工作流:让不同角色的大语言模型共同维护一个不断演化的科学假设群体。

为什么需要显式设计协作

近年来,科学智能体已经能够汇总文献、提出解释、批评候选方案并生成修订版本。一些系统也开始将这些能力与演化搜索结合起来。不过,现有方法往往难以回答一个关键问题:最终假设变好,究竟是因为智能体本身更擅长科学推理,还是因为它们采用了更有效的协作方式?

HypoEvolve 的出发点是将两者拆开。框架尽量保留每个智能体的科学角色,同时明确规定假设如何生成、组合、修改、评价和保留。这样,协作不再只是让多个模型“讨论一遍”,而成为可以单独调整和测试的系统变量。

遗传算法如何组织智能体

该方法采用代际遗传算法协调专门化 LLM 智能体。系统首先维护一组候选假设,随后由不同智能体参与多个环节:

  • 结合机制性论证,解释干预措施可能如何产生作用;
  • 重新审视假设中的前提,寻找未经支持的推断;
  • 综合外部证据,评估候选解释的可信度;
  • 判断假设是否具有清晰的实验可检验性;
  • 根据既定规则生成下一代,并决定哪些假设继续保留。

这种设计借鉴了遗传算法的“群体—代际—筛选”结构,但候选对象不是数值参数,而是关于科学机制的自然语言假设。每一代的更新都对应一组明确的科学判断,因此研究者可以进一步比较不同协作规则如何改变假设群体的质量与多样性。

用药物再利用检验科学性

研究没有把“语言上听起来合理”作为唯一标准,而是聚焦于具有机制解释的假设:某种干预为何可能发挥作用。具体场景是癌症药物再利用,即将已有药物与新的生物学靶点或疾病机制联系起来。

为减少模型自我评价带来的偏差,研究使用外部生物学证据进行评估。其中,DepMap 与 Open Targets 被设计为互补的衡量来源,分别覆盖实验、遗传和临床相关信息。这样的评价思路并不能替代真实实验,但能把模型生成的解释与独立证据连接起来,检验其是否具有更可靠的目标层面生物学依据。

意义与局限

HypoEvolve 的重要价值在于,它把“多智能体协作”从一个模糊概念变成了可操作的实验对象。未来研究可以在保持智能体能力和角色相对稳定的情况下,比较不同的筛选、交叉、修订和保留策略,从而更清楚地理解集体推理何时有效。

但需要注意,外部数据库支持只能说明假设与已有证据之间存在联系,不能直接证明因果机制或治疗效果。该工作展示的是一种组织科学推理和评估的方法,而不是让 LLM 独立完成实验验证。它真正打开的问题是:当 AI 研究团队拥有明确的角色分工与演化规则后,能否持续产生更值得检验、也更容易被证据支持的科学解释。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章