SoL-Pi:让编码智能体在长程探索中少花一半令牌
导语
编码智能体正在从“给出一次补全”转向持续数小时甚至更久的自主探索。它们需要反复思考、调用工具、读取环境反馈、修改代码并验证结果。在这样的长轨迹任务中,模型能力固然重要,但围绕模型运行的 harness(智能体运行框架)同样决定了效率:上下文如何保留、工具动作如何执行、观察结果如何输入,都会直接影响令牌消耗和调用费用。
SoL-Pi 的切入点正是这一层。论文借鉴递归自我改进(RSI)的思路,让自动研究循环在越来越多、差异更大的环境中测试和筛选 harness 改进,再将能够跨环境迁移的方案组合起来。换句话说,研究对象不是训练一个全新的基础模型,而是让智能体更会“组织自己的工作过程”。
核心要点
- 优化对象位于 harness 层。 SoL-Pi 针对的是编码智能体的执行流程,包括工具调用、上下文管理和信息读取,而非单纯改变模型参数。
- 四类机制通过筛选。 最终方案覆盖动作执行、上下文压缩、观测处理和委托阅读,分别对应“怎么做”“保留什么”“如何理解反馈”以及“哪些内容交给专门流程阅读”。
- 强调跨环境迁移。 自动研究循环并非只在单一开发环境中调参,而是在更多样的环境与 rollout 中寻找可复用改进,目标是从局部技巧走向生产级 harness 能力。
- 效率改善明显。 在 51 项 EdgeBench 任务上,SoL-Pi 据称取得与 Pi 相当的表现,并将记录的 token traffic 减少 44.7%—49.0%,API 成本降低约三分之一。论文还估算,相比原生 Codex 和 Claude Code harness,每小时可节省 8.75—13.50 美元;相比 Pi,则节省 4.36—5.71 美元。
意义与限制
SoL-Pi 展示了编码智能体竞争的一个重要转向:提升效率不一定要等待更大的模型,也可以从“如何使用模型”入手。对于长时间运行的代理,减少重复上下文、无效观察和不必要的阅读,可能同时改善吞吐、成本与可扩展性。更重要的是,若 harness 改进能够跨环境复用,开发团队便有机会把一次自动化搜索转化为持续积累的基础设施能力。
不过,现有素材主要提供摘要层面的结果,没有披露四项机制的具体算法、基线配置、统计波动及 EdgeBench 的任务构成。因此,“表现相当”和成本下降应理解为论文摘要中的总体报告,不能据此推断所有任务都获得同等收益。实际部署时,还需要关注压缩是否丢失关键上下文、委托阅读是否引入延迟,以及不同模型和工具链上的迁移效果。
总体来看,SoL-Pi 的价值不只是节省 token,而是把智能体 harness 视为可以被持续研究、自动筛选和迭代的系统组件。这为构建更经济的长程编码代理提供了一个值得关注的方向。
评论
正在确认登录状态……
正在加载评论……