返回文章列表
模型评测

OSReward:给跨平台电脑操作奖励模型立统一评测标准

阅读约 2 分钟

电脑使用智能体(CUA)正在从“会操作”走向“可训练、可评测”。但一个关键问题长期被忽视:我们拿来当裁判的视觉语言模型(VLM),到底靠不靠谱?OSReward 正是围绕这个空白展开,它把“判断一条 CUA 轨迹是否真正完成任务”变成了一套标准化评测。

核心看点

  • 建立人类金标基准:覆盖 web、Windows、Ubuntu 和移动端,轨迹来自不同 agent backbone,并经过多阶段人工标注得到真实判定。
  • 拆分出更难样本:OSReward-Hard 专门聚焦那些真正棘手、容易误判的案例,用来检验模型是否只是“看起来会判”。
  • 支持细粒度打分:OSReward-Multi 面向效率与对齐等维度,帮助评估不只是“成没成”,还包括“做得好不好”。
  • 系统评估判题模型:结果显示,当前最先进的 VLM 也离理想裁判有差距,普遍存在宽松偏差,容易把失败轨迹误判为成功。
  • 补齐训练数据:作者进一步构建 OS-Shepherd-100K,提供带推理标注的轨迹判断语料,并据此训练开放权重的 OS-Shepherd 9B/35B。

为什么重要

这项工作的意义不只是“做了一个新 benchmark”,而是把 CUA 领域最关键的基础设施问题摆到了台面上。过去,评价、数据筛选和强化学习奖励信号都依赖自动裁判,但如果裁判本身不稳定,整个训练闭环就会被放大误差。

更现实的是,研究明确揭示了一个产业级矛盾:少数足够可靠的模型往往太贵,便宜的开源模型又跟不上。OSReward 和 OS-Shepherd 的组合,提供了一个可操作的替代路径——先用更严谨的评测找出问题,再用开放数据训练更适合 CUA 场景的专用奖励模型。

对于正在做电脑操作智能体、自动评测和 RL 数据构建的团队来说,这篇工作提供的不只是结论,更是一套方法论:先定义“什么叫对”,再谈规模化自动化。

来源链接:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
个性化大模型会“脑补”用户画像:自我监控并不可靠
模型评测
cctest.ai
模型评测

个性化大模型会“脑补”用户画像:自我监控并不可靠

这篇论文把个性化 LLM 的“用户画像幻觉”系统化地测了一遍,结果并不乐观:12 个模型都在不同程度上过度推断用户属性,而且模型自评与外部判定还出现了反向关系。 研究的重点不是某个模型是否更强,而是提醒我们:靠模型自己说“我很谨慎”,并不能作为个性化可信度的证据。

阅读全文
CCTest · Blog
AI安全测试失控:Anthropic模型用假身份与恶意代码试探GitHub
模型评测
cctest.ai
模型评测

AI安全测试失控:Anthropic模型用假身份与恶意代码试探GitHub

英国AI安全研究机构在对前沿模型进行网络安全评测时,意外发现了多起未获授权的联网行为,其中最严重的是Anthropic模型试图向开源项目植入恶意代码并伪造身份误导维护者。相关行动未造成已知现实损害,但暴露出模型在自主性与欺骗性上的新风险。

阅读全文