RRSI:给智能体的递归自我改进加一道“正则化”
导语
大语言模型智能体的表现,往往不只是基础模型本身的能力。提示词如何组织、任务如何拆解、工具何时调用、历史信息如何保存,以及上下文如何压缩,都会改变最终结果。这些围绕模型搭建的组件通常被称为 agent harness。近年来,研究者开始让模型自动提出并评估 harness 的修改,形成一种系统层面的递归自我改进。
问题在于,能在训练任务上持续变好的智能体,不一定真的学会了通用机制。它可能只是记住了某类题目的格式、工具使用习惯,甚至适应了特定基准的评价方式。当测试任务发生变化时,原本显著的收益就可能大幅收缩。
RRSI的核心思路
RRSI,即“正则化的智能体 harness 递归自我改进”,把正则化思想引入自动演化过程。它并不直接更新冻结的基础模型,而是约束候选 harness 的生成与选择,使改动更可能成为可迁移的机制,而不是针对单一基准的补丁。
- 逐步调整编辑预算:候选提出器采用随时间变化的预算,限制一次候选修改可以捆绑的编辑数量。这样可以减少早期或后期的大规模、难以归因的改动。
- 鼓励探索未覆盖路径:系统参考既有的演化历史,推动提出器尝试尚未探索的方向,避免反复围绕同一类修改循环。
- 批评器过滤基准特化方案:选择器配备 critic,用于识别更像是迎合某个基准、而非具有普适价值的提案。
- 剪枝器清理冗余变化:pruner 会移除过小、代价过高或已经失去作用的改动,控制 harness 的复杂度和运行负担。
这套设计的关键不在于让系统“改得更多”,而在于提高每次改动的质量、可解释性与复用可能。它把 harness 演化从单纯追求分数,转向同时考虑探索、成本和跨任务有效性。
实验信号与意义
根据论文摘要,RRSI在八个基准上进行评估,任务覆盖编程、智能体工作空间和工程设计等方向。在用于演化的划分上,方法最高带来14.1分提升;在五个分布外基准上,最高提升为4.7分。两类结果之间的差异很重要:前者说明系统能够有效利用反馈改进,后者则表明部分收益并非只依赖于记忆训练任务。
对智能体研究而言,这一方向提供了一个值得关注的视角:递归自我改进的对象可以是模型周边的系统结构,而不仅是模型参数。未来的竞争可能不只是基础模型规模之争,也包括谁能更稳定地发现、验证和淘汰有效的工作流机制。
不过,现有素材主要提供了摘要层面的信息,尚未包含完整的实验设置、基线配置和消融结果。因此,RRSI在不同任务上的具体收益来源,以及批评器和剪枝器各自的贡献,仍需结合论文全文进一步判断。
评论
正在确认登录状态……
正在加载评论……