MILO:让多智能体共同进化,自动寻找更强的 Agent Harness
导语
当 AI Agent 处理一次性问答之外的复杂任务时,真正决定表现的往往不只是模型本身,还包括一套负责规划、调用工具、管理执行过程和与环境交互的 Harness。模型升级后,原有 Harness 未必仍然合适,因此开发者通常需要重新进行大量人工调参。MILO 试图把这项工作交给一个能够自我调整的多智能体搜索系统。
核心要点
- 搜索对象从组件扩展到完整 Harness:现有自动化方法常聚焦于提示词、技能或某个局部模块,容易忽略各组件之间的协同。MILO 让变异器直接重写完整 Harness,以寻找更具整体性的方案。
- 用岛屿式谱系保存探索经验:系统在多个相对独立的搜索岛屿中并行演化,并通过层级谱系记录不同版本的来源、反馈和结果。被淘汰的变异也会被保留为负面证据,帮助后续搜索减少重复试错。
- 搜索策略本身也会进化:MILO 不把搜索流程固定下来,而是由编排器动态进行谱系嫁接、物种划分、变异器重新分配和课程调整,从而在开发与探索之间取得平衡。
- 面向不同模型进行验证:论文在 Terminal-Bench 2.1、PaperBench 和 DeepSWE 上测试了 MILO,并分别使用前沿模型 Opus 4.8 与开放权重模型 gpt-oss-120b。结果显示,MILO 发现的 Harness 超过了八种先进 Harness 以及六种搜索方法。
结果意味着什么
在 Opus 4.8 上,相比初始 Harness,MILO 在三个基准上的任务解决率分别提升 12.0%、28.3% 和 10.3%。论文还报告称,在 Terminal-Bench 2.1 上,系统达到 86.1±2.0%,高于官方排行榜当时 83.8±2.3% 的最高成绩。
这项工作的关键价值不只是得到一个更高分的 Harness,而是提出了一种“搜索搜索器”的思路:当 Harness 的设计空间不断扩大时,固定的启发式策略可能很快失效,搜索系统也需要具备适应性。谱系记忆让系统能够利用成功经验与失败案例,岛屿结构则有助于保留多样化路线,降低所有候选方案过早收敛到同一模式的风险。
不过,自动进化并不意味着 Harness 设计问题已经被完全解决。不同任务、模型和工具环境之间仍可能存在迁移差异,搜索成本、评测可靠性以及复杂 Harness 的可解释性也值得进一步关注。总体来看,MILO 展示了 Agent 工程可能从“人工编排固定流程”逐渐走向“由多智能体持续发现和优化流程”的方向。
评论
正在确认登录状态……
正在加载评论……