返回文章列表
模型评测

OSReward:给跨平台电脑操作奖励模型立统一评测标准

阅读约 2 分钟

电脑使用智能体(CUA)正在从“会操作”走向“可训练、可评测”。但一个关键问题长期被忽视:我们拿来当裁判的视觉语言模型(VLM),到底靠不靠谱?OSReward 正是围绕这个空白展开,它把“判断一条 CUA 轨迹是否真正完成任务”变成了一套标准化评测。

核心看点

  • 建立人类金标基准:覆盖 web、Windows、Ubuntu 和移动端,轨迹来自不同 agent backbone,并经过多阶段人工标注得到真实判定。
  • 拆分出更难样本:OSReward-Hard 专门聚焦那些真正棘手、容易误判的案例,用来检验模型是否只是“看起来会判”。
  • 支持细粒度打分:OSReward-Multi 面向效率与对齐等维度,帮助评估不只是“成没成”,还包括“做得好不好”。
  • 系统评估判题模型:结果显示,当前最先进的 VLM 也离理想裁判有差距,普遍存在宽松偏差,容易把失败轨迹误判为成功。
  • 补齐训练数据:作者进一步构建 OS-Shepherd-100K,提供带推理标注的轨迹判断语料,并据此训练开放权重的 OS-Shepherd 9B/35B。

为什么重要

这项工作的意义不只是“做了一个新 benchmark”,而是把 CUA 领域最关键的基础设施问题摆到了台面上。过去,评价、数据筛选和强化学习奖励信号都依赖自动裁判,但如果裁判本身不稳定,整个训练闭环就会被放大误差。

更现实的是,研究明确揭示了一个产业级矛盾:少数足够可靠的模型往往太贵,便宜的开源模型又跟不上。OSReward 和 OS-Shepherd 的组合,提供了一个可操作的替代路径——先用更严谨的评测找出问题,再用开放数据训练更适合 CUA 场景的专用奖励模型。

对于正在做电脑操作智能体、自动评测和 RL 数据构建的团队来说,这篇工作提供的不只是结论,更是一套方法论:先定义“什么叫对”,再谈规模化自动化。

来源链接:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
模型明明知道,却为什么不回答?PIR尝试读取语言模型的隐藏认知
模型评测
cctest.ai
模型评测

模型明明知道,却为什么不回答?PIR尝试读取语言模型的隐藏认知

一项新研究提出PIR方法,通过分析语言模型的内部状态,判断模型是不知道答案,还是知道却选择隐藏。实验显示,这种方法在欺骗、沙盒测试和密码锁定等场景下仍能识别模型认可的答案。

阅读全文