LongHorizon-Harness:把长程智能体的“状态管理”从上下文里拆出来
导语
随着大语言模型智能体开始处理更接近真实世界的任务,问题不再只是“能不能回答”,而是能否在几十步甚至更长的过程中持续记住目标、正确使用工具、发现错误并修正路径。LongHorizon-Harness 关注的正是这个痛点:长程智能体常常把任务执行记录、当前状态和完成判断都塞进同一个不断增长的上下文里,一旦某一步出现错误自评,后续决策就可能沿着错误状态继续推进。
这项工作提出的核心思路,是把长程执行从“上下文堆叠问题”改写成“任务状态管理问题”。换句话说,智能体不应仅靠聊天历史理解自己做到哪一步,而应有一个外部、显式、可审计的任务状态,并且只有经过环境验证的事实才能写入其中。
核心要点
- 状态外置:LongHorizon-Harness 将任务状态从执行上下文中分离出来,避免上下文越来越长后状态难以追踪。
- MEA 循环:框架采用 Manage-Execute-Audit 流程。Manager 维护任务状态并决定下一个子任务;Executor 在新鲜上下文中执行;Auditor 以只读方式检查环境状态,再决定是否更新任务状态。
- 降低错误传播:执行者的自我判断不会直接成为后续步骤的依据,必须通过环境验证后才能进入状态记录。
- 适配不同后端:轻量级 AgentAdapter 允许在不改动原生智能体循环的情况下,接入不同模型与 harness 后端。
- 基准提升明显:在素材披露的结果中,LongHorizon-Harness 将 Qwen 3.7-Plus 在 WeaveBench 上从 51.8% 提升到 80.7%,在 Terminal-Bench 2.1 上从 69.7% 提升到 77.2%,在 OSWorld 2.0 上从 2.8% 提升到 8.3%;同时也让 Claude Opus 4.7 在 OSWorld 2.0 子集上从 20.0% 提升到 34.3%。
意义与影响
这项工作的价值不只在于某个基准分数提升,而在于它指出了长程智能体可靠性的一个关键工程方向:把“记忆”和“判断”从模型的连续对话上下文中解耦出来。对真实任务来说,尤其是涉及终端操作、网页交互或桌面环境的任务,错误状态往往比单次错误回答更危险,因为它会让系统在后续步骤中持续做错。
LongHorizon-Harness 的设计更像是在智能体外部增加一层任务账本和审计机制。执行模块可以专注完成当前子任务,管理模块负责保持全局进度,审计模块则承担事实核验。这样的分工有助于提升可解释性,也让不同模型、不同执行环境之间的比较更清晰。
当然,素材中的结果仍主要来自基准测试,真实业务场景还会面临成本、延迟、环境可观测性和审计可靠性等问题。但从方向上看,长程智能体要走向可用,单纯扩大上下文窗口并不够,如何维护可信状态、如何阻断错误传播,可能会成为下一阶段智能体框架竞争的重点。
评论
正在确认登录状态……
正在加载评论……