返回文章列表
AI 智能体

不改模型也能提分:StateM 用运行时治理把终端智能体推到95.3%

阅读约 3 分钟

导语

长程智能体的瓶颈,往往不只是“会不会做某一步”。当任务持续时间变长,智能体可能忘记环境已经发生的变化,无法调用此前执行中积累的经验,跳过已经验证过的流程,或者在任务尚未完成时提前停止。StateM 论文提出的答案,是把扩展重点从模型权重转向模型周围的执行系统,也就是所谓的 harness scaling。

核心要点

  • 用持久状态组织执行。 StateM 将任务运行建立在 durable states 之上,并把上下文按阶段隔离,减少长对话中状态混淆和信息衰减。
  • 让状态变化可检查、可恢复。 运行过程包含经过检查的状态转移与可恢复 runbook。智能体不只是连续地产生动作,还要在关键节点确认前置条件是否满足。
  • 把经验变成可执行规则。 研究将复盘结果整理为版本化的 procedural practices 和 golden rules,供智能体与用户共同查看,而不是把经验留在一次性上下文里。
  • 跨模型迁移。 在 Terminal-Bench 2.1 上,StateM 将 GPT-5.5 xhigh 的成绩从参考配置的 83.1% 提升到 92.1%;同一 runbook 不变地迁移到 GPT-5.6。GPT-5.6 Sol xhigh 在 445 次试验中达到 95.3% 原始准确率,并在 89 个任务上都至少成功一次。
  • 并非只对单一模型有效。 冻结的配置将 GPT-5.6 Luna 从 76.7% 提升到 85.4%。在相同运行时、runbook 结构和规则下,DeepSeek-V4 Flash 从 82.7% 提升至标准超时下的 88.1%,在 88 个共同任务上达到 89.1%。
  • 成本也被纳入考量。 论文报告的最终得分 API 使用成本约为 15 美元,而 GPT 参考运行约为 574.68 美元;DeepSeek 的总支出为 52.22 美元。材料中的成本数字应理解为该实验设置下的报告值,而非所有部署场景的固定价格。

意义与影响

StateM 的价值在于重新定义了“提升智能体能力”的对象。传统路线通常依靠更强模型、更多推理时长或额外训练;StateM 则把可靠性拆成状态管理、流程控制、恢复机制和经验复用等工程问题。这样做的一个直接好处,是同一套控制逻辑能够服务多个模型,而不必为每个模型重新训练一套参数。

BusinessBench 的结果也提供了另一层观察:基于开发集构建的、面向任务家族的 runbook,在留出测试上带来 0.55 个宏平均点和 1.34 个微平均点的提升;其中两个机制匹配的任务家族提升了 10.04 个点。这说明具体规则能否泛化,取决于任务是否共享执行结构,而不是简单地把规则复制到所有任务。

不过,95.3% 是特定基准、模型、运行时和试验设置下的结果,不能直接等同于通用智能体能力。StateM 更像是一种可审计的执行基础设施:它将“记住经验”转化为显式、可检查、可版本化的控制。随着智能体从短指令走向长流程,这种外围系统可能与模型本身同样重要。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章