返回文章列表
AI 智能体

EvoUndo:让会自我进化的智能体学会安全回滚

阅读约 3 分钟

导语

让大语言模型智能体自行修改提示词、工具、中间件、资源乃至执行框架,是提升能力的一条重要路径。但“改得更强”并不等于“改错后能安全撤回”。如果修改产生了持久影响,且恢复操作只在原始环境中有效,那么一旦系统状态发生变化,智能体就可能无法回到可靠状态。

EvoUndo 聚焦的正是这个常被忽略的问题:如何表示、生成、诊断,并由独立验证器确认一次自我修改是否具备跨反事实状态的可恢复性。

核心发现

  • 研究在 600 个未见过的一次性自我进化任务中,找到了 197 个能够提升能力、却未通过可恢复性验证的修改。
  • 在原始恢复表示和常规修复策略下,这 197 个自然失败案例没有一个被恢复成功,结果为 0/197。
  • 使用确定性“预言机”分析后,原有恢复语言 L0 可以处理 48/197 个案例;引入扩展恢复演算后,经验上的预言机恢复数提升至 191/197。
  • 研究通过锁定协议的 2×2 实验,区分了两个瓶颈:状态地址是否精确,以及恢复语言是否足够有表达力。
  • 当原有语言已经足够时,加入精确状态地址诊断后,成功恢复率从 0/48 提升到 38/48,即 79.2%。在预言机定义的 S1 分层中,扩展恢复语言可处理 142/143 个失败案例,即 99.3%。
  • 在主要的 gpt-oss-120b 骨干模型上,将精确地址诊断加入更丰富的语言后,恢复结果反而为 133/143,即 93.0%;Qwen3.8-27B 的复现实验保留了状态定位和语言表达力的主要影响,但没有复现这一负交互,说明该现象具有模型依赖性。

这意味着什么

EvoUndo 的重要性在于,它把智能体自我进化从“能不能生成一个更好的改动”,推进到“这个改动是否带有可验证的退路”。恢复并非简单地再次提示模型尝试修复,而需要明确知道改动作用于哪个状态、什么证据能证明恢复有效,以及恢复语言能否描述足够复杂的撤销过程。

对智能体框架开发者而言,未来的自我修改机制不能只配置变更接口,还应同时设计状态寻址、见证语义、独立验证和恢复操作的表达体系。对评测工作而言,仅测量能力增益可能掩盖长期风险;一次修改即使短期有效,也应在不同后续状态和反事实条件下检查是否仍能安全回退。

论文并未说明所有智能体都能达到这些结果,Qwen 复现实验与主实验的差异也提醒我们,诊断工具和恢复语言之间可能存在模型相关的交互。总体来看,EvoUndo 提供了一种更严格的视角:可持续的智能体自我进化,必须把能力提升与可恢复性作为同一个工程问题来设计。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章