OSWorld-Science:让计算机使用代理真正走进科研软件
科研场景中的计算机使用,难点并不只是“看懂屏幕并点击按钮”。代理需要理解专业软件的界面与术语,操纵分子、图像或模拟参数等科学对象,还要最终交付能够被验证的结构、图表或数值结果。围绕这一问题,OSWorld-Science 提出了一套面向科研软件的基准与评测环境。
从通用操作转向科学工作流
该基准目前包含 146 个任务,覆盖 12 个视觉语言模型,并涉及多种科学领域和软件配置。任务包括分子绘制与逆合成、病理图像分析、统计计算以及物理模拟等。与只判断代理是否完成某个界面动作的测试不同,OSWorld-Science 更关注一项科研任务是否产生了有意义、可核验的结果。
任务由领域专家提出,并经过人与 AI 的迭代式共同设计,再根据科学价值和难度进行筛选。这种设计试图减少“看起来像科研、实际上只是软件操作”的偏差,把评测目标从点击路径提升到科学工作流本身。
评测重点:检查产物,而不是只看轨迹
OSWorld-Science 为不同任务配置了基于执行结果的评测器。它们会检查应用状态及代理生成的具体产物,例如:
- 分子结构是否符合任务要求;
- 病理图像分割掩码是否被正确生成;
- 统计分析是否形成相应图表;
- 物理模拟或计算任务是否得到目标数值结果。
对于只完成部分步骤的代理,系统还可以给予部分分数。这使评测不再是简单的成功或失败二元判断,也有助于分析代理究竟卡在理解、操作还是结果生成环节。
代理框架同样是变量
论文还提供了一个用于比较的代理运行框架,整合模型适配器、交互循环控制和轨迹记录功能。这样,研究者不仅可以比较不同视觉语言模型,也能观察交互策略和运行框架对结果的影响。换言之,模型能力并非唯一决定因素,代理如何规划操作、何时继续交互、如何利用上下文,同样会影响科研任务的完成质量。
研究结果显示,即使是当前较先进的视觉语言模型,在较强运行框架支持下,面对科研领域中的关键问题仍有明显挑战。论文还从多语言输入、推理投入、上下文长度等因素分析结果,为后续改进提供方向。
意义与局限
OSWorld-Science 的价值在于建立了一条从专家定义的科学目标,到软件执行,再到可验证产物的评测链路。它提醒业界:科研代理的能力不能只用屏幕操作成功率衡量,还必须考察结果是否符合科学任务要求。
当然,现有素材未披露各模型的详细分数、任务分布和逐项失败案例,因此暂时无法据此判断某一模型在具体科学领域的绝对优势。作为开放的评测框架,它更重要的作用是提供统一测试场景,并推动研究者持续补充真实、有价值的科研软件任务。
评论
正在确认登录状态……
正在加载评论……