EvoDuet:让搜索与解题共同进化的科学发现框架
导语
让大语言模型参与科学发现,常见做法是让模型不断提出候选方案,再由评测器给出分数。这类进化式搜索能够逐步改进结果,但也有一个明显瓶颈:当下一步突破依赖模型训练数据之外的知识时,模型可能反复在熟悉的思路附近打转。直接接入网页搜索似乎可以补足信息,却容易在候选解变化后仍返回相同页面,检索工具因此没有真正参与“进化”。
EvoDuet 的思路是把解题和搜索看成一对需要共同优化的过程。它不改变模型参数,而是在搜索过程中同时维护候选解、检索查询和文档记录,让搜索行为也能从历史结果中学习。
核心机制
- 检索门控:每轮开始时,模型先判断当前是否存在知识缺口,再选择获取新文档、复用已有文档,或不使用检索直接生成候选。这避免了每一步都机械调用搜索工具。
- 内层搜索优化:系统持续改写查询,并按照文档预计能够带来的解题分数对结果排序。换言之,文档是否有价值,不只看文本相关性,也看它能否支持更好的候选方案。
- 外层解题进化:模型基于筛选后的文档并行生成候选解,经过任务评测后,把真实结果写回历史记录,为后续查询和文档选择提供反馈。
- 兼容不同框架:论文不仅在 OpenEvolve 上测试,也观察到 EvoDuet 与 Top-K、EvoX 等其他进化搜索脚手架结合时,在 Sums/Diffs 和 Denoising 等任务上仍能带来改进。
实验结果与边界
在包含 21 项优化任务、每轮只生成一个候选解的设置中,EvoDuet 将 OpenEvolve 的归一化发现增益从 74.1% 提高到 78.0%(GPT-5.6-Luna),在 Gemini-3.8-Flash 上则从 61.3% 提高到 82.3%。论文报告称,最佳运行结果在 8 项任务上超过此前已报道的最佳分数,并在另外 3 项任务上持平;其中包括 Q20 和 Rosetta 上的 Swap Reduction。另一方面,Qwen3.5-9B 没有从该方法中获益,说明检索—求解协同并非对所有模型都同样有效。
意义与影响
EvoDuet 的价值不只是“给模型加一个搜索按钮”,而是重新定义了搜索反馈在进化式求解中的位置:历史文档和候选解的评测结果共同影响下一轮查询。对于需要跨领域知识、但又必须通过明确评分验证方案的科学优化任务,这种闭环可能比静态检索增强更合适。
不过,现有结果也提示了实际落地的限制。方法效果取决于模型能否判断知识缺口、改写有效查询并理解检索内容;不同模型之间的收益差异说明,搜索策略本身无法完全弥补基础推理能力不足。未来评估还需要关注检索成本、错误文档传播以及更大规模任务中的稳定性。
评论
正在确认登录状态……
正在加载评论……