返回文章列表
模型评测

OSWorld-Pro:从“结果对不对”走向“过程哪里错”

阅读约 3 分钟

导语

计算机使用智能体(Computer-Use Agents,CUAs)能够通过键盘、鼠标和图形界面执行多步骤任务。过去,评测这类系统时,研究者往往更关注最终交付物:任务完成了吗,文件生成了吗,页面状态是否符合要求。这样的方式简单直观,却很难回答一个关键问题:智能体究竟是在什么环节出错的?

NVIDIA 团队提出的 OSWorld-Pro,试图把评测视线从最终状态推进到执行过程。它不是只判断“最后做没做对”,而是检查智能体在一连串相互依赖的子目标中,分别完成了哪些步骤、在哪一步偏离了预期。

核心要点

  • 以过程为中心组织任务。 OSWorld-Pro 包含300多个任务和超过2800个子目标。每个完整任务被拆成连续的操作节点,评测者可以观察模型在不同阶段的进展,而不是只得到一个最终成功或失败标签。
  • 评测数据有较大人工基础。 该基准建立在超过6.7万条人工标注之上,并使用与人类判断保持一致的 LLM 评判器,对子目标是否完成进行判断。这样既保留了过程级分析能力,也减少了完全依赖功能验证器带来的信息损失。
  • 揭示不同类型的操作错误。 研究关注的并非单一成功率,还包括与当前子目标无关的操作、基于点击的定位错误等过程性失误。键盘输入出错和图形界面点击不准,显然需要不同的改进方案;把它们统称为“任务失败”,会掩盖这种差异。
  • 难度可能比终态评测更高。 摘要显示,Claude Opus 5 在 OSWorld-Pro 上的成绩为75.7%,而在 OSWorld 上为83.4%。这并不意味着两个分数可以完全直接等价比较,但至少说明:当评测深入执行链条后,即使是领先模型,也会暴露更多不稳定行为。

为什么重要

对开发者而言,过程评测的价值在于提供更可操作的诊断信号。如果模型频繁输入错误字符,改进方向可能是键盘动作建模、状态确认或纠错机制;如果模型经常点偏界面元素,则需要提升视觉定位、坐标映射和点击后的反馈检查能力。若模型在任务中执行大量与当前目标无关的动作,问题又可能出在规划、上下文管理或停止策略上。

这类分析也有助于区分“会做”与“偶尔做对”。一个智能体可能凭借冗余操作最终得到正确结果,但其过程并不高效,也未必能在界面变化、任务变长或错误需要回滚时保持稳定。OSWorld-Pro 通过连续子目标记录这种差异,为训练数据构建、代理策略优化和错误归因提供了更细的观察尺度。

当然,基于 LLM 的评判仍需要持续验证,其可靠性取决于评判器与人类标注之间的对齐程度。总体来看,OSWorld-Pro 的意义不只是增加一个基准,而是推动计算机使用智能体的评价标准发生变化:从检查最终产物,进一步转向理解智能体是如何完成任务的。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章