Inherit-MAS:让多智能体工作流在执行中继承与进化
导语
多智能体系统的难点,往往不只是让多个模型协同工作,还在于如何持续改进协同方式。预先设计的流程可能无法覆盖复杂任务,而简单地在测试时大幅重写工作流,又可能误伤已经有效的角色、工具权限或通信路径。与此同时,如果每轮改进都从头执行,系统还会反复计算相同请求。
arXiv论文提出的 Inherit-MAS,试图把“保留有效部分”和“选择更优变体”明确写入多智能体系统的演化过程。其核心不是每次重新发明一套工作流,而是在已有结果上进行受控修改,并尽量复用不需要改变的执行结果。
核心机制
- 先生成、再评估。 一个元模型负责合成由多个工作者组成的工作流,并声明每个代理的角色、可接收的通信输入以及工具使用权限。候选工作流执行后,由单独提示的评审模型进行打分,同时诊断失败或不足的原因。
- 工作流继承。 普通改进轮次从最近一次已经完成的候选方案出发,而不是从零开始。系统可以依据评审结果删除被认为无益且可移除的节点,再应用经过验证的编辑,以针对性修复已诊断的问题。
- 执行继承。 新工作流运行时,系统检查历史结果是否满足严格条件:完整解析后的请求和执行上下文都必须匹配。只有符合条件的结果才会被继承,从而避免重复的模型调用和工具调用。
- 局部演化而非全面重构。 这一设计将结构层面的修改与结果层面的复用分开处理,使系统既能改变流程,又不必为每次小幅调整重新计算所有环节。
实验结果
在使用 GPT-4o-mini 作为工作者模型时,Inherit-MAS 在 WorkBench 上达到 55.4% 的完成率,在 HotpotQA FullWiki 上取得 49.7% 的 joint F1。根据论文报告,这两项结果均超过 EvoAgent、EvoMAS 和 TacoMAS 等演化式多智能体基线。使用 Qwen3-32B 工作者时,作者也报告了相对于这些基线的优势。
效率方面,与关闭执行继承、但运行相同控制器的设置相比,执行继承使 WorkBench 的工作者令牌用量减少 29.1%,HotpotQA 的工作者令牌用量减少 34.6%;总令牌用量分别减少 5.3% 和 18.1%。这些数字表明,复用策略对下游工作者调用的节省更明显,而总开销还受到元模型、评审模型等环节影响。
意义与局限
Inherit-MAS的价值在于把多智能体优化从“重新生成完整方案”推进到“继承、诊断、局部编辑和选择”。对于需要多轮试错的代理系统,工作流继承有助于降低结构漂移风险,执行继承则为昂贵的模型和工具调用提供缓存式优化。严格匹配请求与上下文,也避免了把不适用的旧结果错误迁移到新任务中。
不过,论文摘要未提供更详细的消融设置、编辑验证流程和错误案例,因此尚不能仅凭这些结果判断两类继承机制在不同任务中的独立贡献。后续评估还需要关注缓存命中条件、评审模型偏差以及工作流规模扩大后的管理成本。总体而言,这项工作为测试时进化的多智能体系统提供了一个清晰的工程抽象:改变应尽量局部,复用必须有条件,改进则依赖可验证的执行反馈。
来源:arXiv
评论
正在确认登录状态……
正在加载评论……