RHI:让智能体“脚手架”也能自我改进
导语
在智能体系统里,模型常常不是单独工作的。围绕它的工具调用、角色分工、上下文传递和迭代流程,构成了所谓的 harness,也就是运行时“脚手架”。来自 Sakana AI 等机构的论文《Recursive Harness Self-Improvement》提出一个值得关注的思路:既然这些脚手架会影响智能体产出的执行轨迹,而轨迹又可能成为未来模型训练的数据,那么 harness 本身也应该进入优化闭环。
核心要点
- 优化对象从模型扩展到 harness:论文将 harness 表示为一种提示级规范,用来描述智能体循环如何运行、不同步骤如何交互、信息如何保留与传递。
- RHI 采用递归式自我改进:系统并不依赖频繁重建供应商级底层框架,而是在用户构建的任务特定 harness 上进行少量迭代。每一轮会参考自身历史版本,通过成对反馈来生成新的改写版本。
- 实验任务聚焦合成 ML 研究场景:研究在 30 个合成机器学习研究任务上测试,领域横跨量化金融、机器人和药学。这些任务强调规划、分析、实验与结果整合,对 agent 流程设计较为敏感。
- 低推理强度也能达到更高上限:论文称,经过少量 RHI 迭代后,低 reasoning effort 的智能体性能上限显著提高,甚至超过对应的最大 reasoning effort 设置,同时推理成本最高可降低 60%。
- 关键不是“想得更久”:作者指出,收益主要来自更好的任务特定上下文管理,尤其是多智能体之间更有效的信息流,而不是生成更长的推理轨迹。
意义与影响
这项工作把智能体优化的重点从“换更强模型”转向“改造模型所处的工作流”。对开发者而言,这意味着在许多垂直任务中,轻量级地调整 agent loop、上下文摘要和信息交接方式,可能比单纯提高推理预算更划算。
更深一层看,RHI 讨论的是模型与 harness 的共同演化:今天的脚手架不仅影响即时任务表现,也可能通过执行轨迹影响未来训练数据的质量。如果这一方向成立,智能体系统的竞争力将越来越取决于模型、工具、记忆与流程之间的整体设计,而不是单一模型参数规模。
当然,论文实验仍基于合成任务,距离真实生产环境中的复杂工具链、不可控数据和长期记忆管理还有差距。但它提供了一个清晰信号:未来的 agent 优化,可能不仅是模型自我改进,也包括“使用模型的方式”自我改进。
评论
正在确认登录状态……
正在加载评论……