HarnessDev:让大模型自己设计并进化智能体运行框架
导语
一个智能体的表现,并不只由底层模型参数决定。提示词组织方式、工具调用流程、记忆机制、错误恢复策略以及任务分解方法,都会影响它最终能否完成任务。这些位于模型之外、负责调度和执行的组件,通常被称为 agent harness,即智能体运行框架。
过去的智能体研究大多固定一套 harness,再比较不同模型的任务成绩。HarnessDev 提出了一个更进一步的问题:如果不修改模型权重,大模型能否自己搭建一套可运行的框架,并在实际执行反馈中不断改进它?
评测对象从结果转向基础设施
HarnessDev 将评测单位从单纯的任务输出改为可运行的智能体基础设施,主要包含两个阶段:
- Creation(创建):模型从最小化的初始框架和少量案例出发,构建一套完整的执行系统。
- Evolution(演化):模型以自己创建的框架为起点,根据下游任务执行结果持续修改和优化。
研究者随后将这些框架放到保留的下游测试任务中,分别考察两类指标:一是任务成功能力,二是执行过程产生的 Token 成本。素材显示,实验覆盖六个创建模型、四个领域和五个下游基准,共涉及 2,207 个独特的下游实例,开发阶段并未公开隐藏评测任务。
结果呈现明显的领域差异
生成式 harness 尚未全面追上成熟的人工作品。在代码、搜索和研究任务中,模型生成的系统仍存在较大差距,说明复杂工具编排、长期规划、信息核验和失败恢复等工程能力,尚不能仅靠一次性生成稳定获得。
但结果并非一面倒。在写作和机器学习实验场景中,生成的框架可以达到或超过研究中选定的人类参考系统。这表明,harness 的优劣与具体任务结构高度相关:当流程更容易通过自然语言规划或实验反馈进行调整时,模型可能更容易找到有效策略。
另一个值得关注的现象是执行成本差异很大。一个框架即使能够提高任务成功率,也可能依赖更长的思考链、更多工具调用或重复尝试。因此,评价智能体基础设施不能只看准确率,还需要同时考虑运行成本。
演化并不等于稳定进步
HarnessDev 的初步结论还指出,框架演化带来的收益往往不稳定,并且依赖运行时模型。换言之,负责修改 harness 的模型,与实际执行任务的模型之间可能存在相互影响;某次改动在一个运行环境中有效,换到另一种模型或任务分布后未必成立。
这为“自我改进智能体”设定了更高门槛。真正有价值的自动演化,不只是让模型生成更多代码或更复杂的提示词,而是要能够识别性能瓶颈、设计可靠实验、区分偶然提升与普遍提升,并在能力和成本之间做出可重复的权衡。
意义与影响
HarnessDev 的价值在于把长期被隐藏的工程层纳入标准化评测。未来,智能体系统的竞争可能不再只是模型规模之争,也包括谁能设计出更稳健、更节省资源、适应性更强的运行框架。与此同时,这项工作也提醒研究者谨慎解读“智能体自我进化”:当前模型已经能够在部分领域构建有用的基础设施,但距离普遍超越成熟人工系统仍有明显距离。
评论
正在确认登录状态……
正在加载评论……