Cognition 发布 SWE-2:以更低成本推进编程智能体性能前沿
导语
Cognition 发布了新一代编程智能体模型 SWE-2。与单纯追求基准最高分不同,这次更新把重点放在“完成任务需要付出多少成本”上。官方称,SWE-2 在 FrontierCode 1.1 Main 上取得 50.0% 的成绩,距离 Fable 5.1 仅约一个百分点,但成本低 64%。模型目前已在 Devin Desktop 和 CLI 中提供,并将继续推向 Devin Web 与 Fusion。
核心要点
- 基于大规模模型后训练。 SWE-2 以 2.8 万亿参数的 Kimi K3 为基础,继续使用 Cognition 为 SWE-1.7 建立的训练基础设施与方法。官方表示,强化学习仍能在 K3 的基础上带来约 5—6 个百分点的多项基准提升。
- 同时训练不同推理强度。 SWE-2 的关键变化是让一次强化学习运行覆盖多个 effort level。奖励函数不仅考虑任务是否完成,也会扣除与推理成本和运行时间相关的代价,并根据基础模型成本—性能曲线的局部斜率调整惩罚力度。
- 更少绕路。 在 FrontierCode 1.1 Main 的内部统计中,SWE-2 medium 平均每次运行 53 步,SWE-1.7 为 127 步;SWE-2 medium 首次真正编辑代码的中位数为 18 步,而 SWE-1.7 为 48 步。Cognition 将这种变化归因于更聚焦的代码库探索。
- 基准表现并不均衡。 SWE-2 在 FrontierCode 1.1 Main、DeepSWE 1.1 和 Terminal-Bench 2.1 上分别达到 50.0%、73.0% 和 92.8%。但在 Terminal-Bench 4 上为 27.3%,显著低于部分竞争模型,说明不同测试的任务分布和难度会明显影响结论。
方法与影响
SWE-2 的训练思路值得关注之处,在于它没有把“更聪明”与“更便宜”视为两个完全分离的目标。通过把成本直接纳入奖励,模型可以针对简单任务更快行动,也能在复杂任务上增加规划、探索和验证。官方还提到,训练中扩大了强化学习环境规模,加入指令遵循层,并利用此前检查点改进验证器;在推理服务侧,则使用量化和更高效的调度来降低显存与吞吐压力。
从使用体验看,Cognition 特别强调三类行为:更完整的端到端测试、更愿意在受限条件下寻找替代路径,以及在受到质疑时重新验证结论,而不是重复原判断。这些描述仍主要来自厂商内部观察,不能替代独立评测。尤其是 SWE-2 在不同基准上的成绩差异,提醒开发者不要只依据单一排行榜选择模型。
更广泛地看,SWE-2 反映了代码智能体竞争的一个转向:随着模型规模和调用价格上升,实际产品价值越来越取决于单位成本能完成多少工作。若这种训练方法能在更多任务分布中稳定复现,未来编程模型的比较标准可能不再只是最高成功率,而会同时考察成功率、步骤数、延迟和每项任务成本。
来源:Hacker News
评论
正在确认登录状态……
正在加载评论……