Prime Agent:让长程智能体更像一个可持续运行的系统
导语
长程智能体的瓶颈往往不只是模型本身。面对需要数十次乃至更长时间交互的任务,模型还必须处理上下文膨胀、程序执行、失败恢复、历史经验保存和资源管理。如果这些环节由脆弱的外部脚本负责,最终得到的可能是“harness 失败”,而不是模型能力不足。Prime Agent 试图把这层基础设施重新设计成一个更稳定、可检查、可持续改进的运行框架。
核心设计
- 持久化 IPython REPL:Prime Agent 采用递归语言模型(RLM)抽象,让模型通过程序化方式处理上下文,并在测试时调用额外计算。REPL 持续存在,使中间变量、工具调用结果和处理过程不必随着单轮对话结束而丢失。
- 跨轨迹持续保存:Continual Harness 会保留历史记录、记忆、技能、提示词以及子代理规格。代理不再每次从零开始,而是能够将此前轨迹中的可复用信息带入后续任务。
- 递归子代理协作:系统支持子代理之间直接通信。复杂任务可以被拆分给不同角色并行处理,再将结果汇总或交叉验证,这为编码、模拟器构建和游戏环境中的持续推进提供了更灵活的组织方式。
- 可观察与可恢复:Agents View 让人类查看和管理由后台守护进程维护的会话。框架同时统一执行、恢复、验证和资源核算,把常见的工程性故障从模型表现中隔离出来。
评测结果与边界
论文称,Prime Agent 在 ARC-AGI-3 RHAE 上将 Best@1 从 30% 提升至 95.5%,并在长上下文编码、GPU 内核生成、模拟器构建和自主 nanoGPT 速度挑战等任务上达到或超过原生方案及流行 harness。在 Factorio 实验中,持续 refinement 被观察到有助于技术路线不断推进,而专用子代理则支持并行工作。
这些结果说明,评测中的“模型分数”很大程度上取决于模型被放置在什么样的运行环境里。一个能保存经验、调用计算、恢复失败并验证结果的 harness,可能比单纯增加对话轮数更有效。不过,论文摘要没有提供各项对比实验的完整成本、配置和消融细节,因此这些提升仍应结合原始论文与代码复现来理解,不能简单等同于基础模型能力本身发生了同幅度增长。
意义与影响
Prime Agent 的价值不在于替模型制定唯一策略,而在于提供一层低摩擦、表达能力较强的“膜”,让模型能够自行构造工作流程。对研究者而言,这有助于把评测重点从脚本稳定性转向模型的实际上限;对开发者而言,持久会话、记忆、验证和资源核算也为构建长期运行的编码代理提供了可复用组件。
更长远看,智能体竞争可能不再只是模型参数规模的竞争,也包括运行时、记忆机制、协作协议和恢复能力的竞争。Prime Agent 的开源实现为这类系统化探索提供了一个明确起点,但其真实泛化能力、运行成本和在不同模型上的收益,仍需要更多独立测试。
评论
正在确认登录状态……
正在加载评论……