返回文章列表
模型评测

RealSWE:真实用户请求如何改变编程代理评测

阅读约 3 分钟

导语

编程代理的能力,究竟是在解决真实用户的问题,还是在应对经过整理的标准化工单?RealSWE研究指出,当前常用的SWE-bench系列与日常软件开发请求之间存在明显的输入鸿沟:基准问题往往篇幅较长、结构清晰、信息齐全,真实请求却经常只有一句不完整的描述。

评测看到了什么

研究者先建立了一个包含六类信息的分类体系,并从SWE-chat的真实用户提示,以及SWE-bench Verified和Pro的问题陈述中分析信息构成。同时,他们还从四个维度考察语言风格。结果显示:

  • 只包含问题描述,或仅附带少量上下文的请求,占真实提示的88%,在基准问题中却只有7%。
  • 真实请求中87%使用较为随意的表达,而基准问题中94%采用正式文风。
  • RealSWE由381个多变体任务族组成。每个任务族保留相同的底层任务和标准补丁,只改变输入包含的信息及表达风格,因此可以更有针对性地隔离这些因素。
  • 对七个当代大语言模型的测试显示,现实化输入使平均解决率下降6.4个百分点,并可能改变模型之间的排名。

哪些信息真正有用

RealSWE的控制实验提供了一个比“提示越详细越好”更细致的结论。明确说明期望行为,即软件最终应该如何工作,以及解释修改动机,能够显著影响模型表现。相反,环境信息和复现步骤虽然会增加提示长度,却没有显示出可测量的额外收益。语言风格的影响则较小,而且依赖具体模型。

这意味着,用户不一定需要撰写一份完整的工程工单,但应尽量说清楚“希望得到什么结果”以及“为什么需要这项修改”。对于代理开发者而言,仅在形式完整、上下文充分的基准上提升成绩,未必代表模型已经适应了真实工作流。

意义与局限

RealSWE的价值不只是新增一个排行榜,更在于把“输入长短”和“任务难度”拆开考察。同一任务、同一标准补丁对应多个输入变体,使评测能够观察模型究竟受哪些信息帮助,或因哪些信息缺失而失效。这为提示设计、代理交互流程和未来基准构建提供了可操作的参照。

不过,现有结论仍应放在该框架覆盖的任务范围内理解:任务来自SWE-bench Verified和Pro,研究重点是输入信息组成与语言风格,而不是重新定义所有软件工程场景。总体而言,RealSWE提醒业界,编程代理评测若想反映真实使用体验,就不能只测试“整理好的问题”,还要测试用户真正会怎样提问。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章