OSReward:给跨平台电脑操作奖励模型立统一评测标准
电脑使用智能体(CUA)正在从“会操作”走向“可训练、可评测”。但一个关键问题长期被忽视:我们拿来当裁判的视觉语言模型(VLM),到底靠不靠谱?OSReward 正是围绕这个空白展开,它把“判断一条 CUA 轨迹是否真正完成任务”变成了一套标准化评测。
核心看点
- 建立人类金标基准:覆盖 web、Windows、Ubuntu 和移动端,轨迹来自不同 agent backbone,并经过多阶段人工标注得到真实判定。
- 拆分出更难样本:OSReward-Hard 专门聚焦那些真正棘手、容易误判的案例,用来检验模型是否只是“看起来会判”。
- 支持细粒度打分:OSReward-Multi 面向效率与对齐等维度,帮助评估不只是“成没成”,还包括“做得好不好”。
- 系统评估判题模型:结果显示,当前最先进的 VLM 也离理想裁判有差距,普遍存在宽松偏差,容易把失败轨迹误判为成功。
- 补齐训练数据:作者进一步构建 OS-Shepherd-100K,提供带推理标注的轨迹判断语料,并据此训练开放权重的 OS-Shepherd 9B/35B。
为什么重要
这项工作的意义不只是“做了一个新 benchmark”,而是把 CUA 领域最关键的基础设施问题摆到了台面上。过去,评价、数据筛选和强化学习奖励信号都依赖自动裁判,但如果裁判本身不稳定,整个训练闭环就会被放大误差。
更现实的是,研究明确揭示了一个产业级矛盾:少数足够可靠的模型往往太贵,便宜的开源模型又跟不上。OSReward 和 OS-Shepherd 的组合,提供了一个可操作的替代路径——先用更严谨的评测找出问题,再用开放数据训练更适合 CUA 场景的专用奖励模型。
对于正在做电脑操作智能体、自动评测和 RL 数据构建的团队来说,这篇工作提供的不只是结论,更是一套方法论:先定义“什么叫对”,再谈规模化自动化。
评论
正在确认登录状态……
正在加载评论……