WideSWE:代码智能体能否跨仓库协同完成开发任务?
导语
代码智能体的评测正在从“能否修复一个Issue”扩展到“能否完成一项长期开发任务”。不过,许多基准仍把任务限制在单一代码库中,这与真实软件生态存在明显差距。一个功能可能同时涉及核心库、客户端、插件、文档或测试仓库;如果智能体只修改其中一处,代码看似完成,整个生态却未必能够正常工作。
WideSWE正是针对这一问题提出的跨仓库代码智能体评测基准。研究团队从103个软件生态中挖掘并审查真实变更,最终整理出120项任务,其中60项为缺陷修复,60项为功能开发。任务提示主要依据相关Issue和Pull Request构造,并对隐藏测试进行系统复核和调整,使测试既能接受不同的正确实现,也能保留关键行为与回归检查。
核心要点
- 评测对象从单仓库扩展到软件生态。 任务要求智能体识别所有受影响的仓库,并在不同项目之间完成相互匹配的改动。
- 任务覆盖功能与修复两类场景。 120项任务均来自真实软件开发过程,而不是仅为基准设计的孤立题目。
- 整体成功率仍然有限。 七种智能体配置的完整任务成功率介于10.83%和42.50%之间,Codex CLI与GPT-5.6-sol的组合取得最高结果。
- 失败不只是“不会写代码”。 轨迹分析显示,智能体可能没有发现需要修改的仓库,也可能识别到目标却没有完成全部工作,或改动了相关仓库但最终行为仍不符合请求。
- 执行方式会影响结果。 研究比较了逐仓库独立执行和联合执行。独立执行更容易补回此前遗漏的工作,但对已经尝试却失败的实现,纠正能力相对有限;联合执行则能利用相关仓库的信息辅助实现和验证。
意义与影响
WideSWE揭示了代码智能体从“局部编程助手”走向“软件生态开发者”时面临的关键障碍:任务规划、跨项目依赖理解、状态同步,以及端到端验证。跨仓库任务的难点并非简单地把单仓库任务数量相加,而是要求智能体建立全局变更图,判断哪些项目必须同步修改,并确认各处接口和行为保持一致。
对未来评测而言,WideSWE提供了一个更贴近工程实践的方向:不仅检查某个仓库的测试是否通过,还要验证一组相互关联的改动是否共同满足原始需求。对智能体系统设计者而言,结果也说明,仓库级隔离执行虽然便于管理,却可能丢失上下文;能够共享信息、持续追踪任务状态并进行跨仓库回归验证的工作流,或许更适合复杂软件开发。
目前的成功率表明,跨仓库协作仍是代码智能体尚未稳定解决的问题。WideSWE的价值不只在于提供一个新分数,也在于把“遗漏工作”和“完成但不正确”等问题从抽象担忧转化为可观测、可比较的评测对象。
评论
正在确认登录状态……
正在加载评论……