Harness 还是模型?同模型对照实验重新审视编程代理优势
导语
在 AI 编程代理中,模型并不是全部。工具调用方式、系统提示词、任务分解、控制流以及停止条件,共同组成了所谓的 harness,也就是把聊天模型变成“自主软件工程师”的运行框架。厂商通常会为自家模型提供原生 harness,用户也往往默认这种组合最可靠。但一项新的 arXiv 研究指出,这个假设目前缺乏稳定的实验支持。
核心要点
- 研究采用包含 256 个仓库任务和截止日期之后竞赛任务的私有测试集,以降低公开数据污染风险。
- 在 Claude Opus 4.8 上,研究者比较了 claude-agent-sdk 与 deepagents;在 GPT-5.5 上,则比较了 OpenAI Codex SDK 与 deepagents。每组有 80 个相同任务参与主要对照,另设 Gemini 3.5 Flash 和 DeepSeek V3.2 侧面测试。
- 计划中的 800 次运行有 792 次完成评分。Opus 4.8 的两种 harness 成功率为 48.8% 和 50.0%,差异为负 1.25 个百分点;GPT-5.5 的结果为 55.6% 和 54.4%,差异为正 1.25 个百分点。两项差异的置信区间都跨过零,不能据此认定任何一方占优。
- Opus 的总体平均掩盖了任务分层差异:在 61 个仓库任务上,原生 harness 落后 9.0 个百分点;在 19 个竞赛任务上却领先 23.7 个百分点。不过,这一分层是在观察数据后选定的,作者明确表示需要预先设计的复现实验。
- 完成状态与正确性并不等价。81 次达到时间上限的运行中,有 22 次已经产生了可通过测试的补丁,说明单纯把超时视为失败可能低估代理能力。
成本与研究边界
按冻结的公开价格和原始逐轮用量重算,deepagents 在 Opus 上每个解决任务的观测成本约为原生方案的 1.3 至 1.6 倍,在 GPT-5.5 上约为 1.2 倍。但 Anthropic 账户有 58 次运行缺少用量记录;将这部分支出分配给不同实验组后,Opus 的成本比可能落在 0.7 至 2.3 之间。因此,成本排序并未得到确定结论。论文还说明,这一版修订纠正了此前因遥测语义缺陷导致的成本计算问题。
意义与影响
这项工作并不是证明所有 harness 都一样,而是提醒开发者:所谓“原生优化”必须在相同模型、相同任务和透明评估条件下验证。对实际部署而言,任务类型、时间预算、停止策略和费用记录都应纳入评测,而不能只报告一个总体成功率。研究发布了编排器、评分 oracle、重分析代码及派生汇总数据,但任务本身保持私有。后续若要得出更稳健的结论,还需要预先注册任务分层,并扩大跨模型、跨 harness 的独立复现。
来源:arXiv
评论
正在确认登录状态……
正在加载评论……