返回文章列表
AI 智能体

RecreationWorld:让计算机使用代理在真实软件复刻中学会探索、编程与验证

阅读约 3 分钟

导语

计算机使用代理的发展长期分成两条路线:一条让模型像人一样点击、输入和浏览图形界面,另一条则让模型通过代码、终端和开发工具完成软件任务。但真实的数字工作往往需要两者交替进行。代理可能先观察一个应用的行为,再编写实现,启动程序后继续用视觉检查界面和交互是否正确。

RecreationWorld正是围绕这一闭环设计的训练与评测框架。它给代理一个正在运行的参考应用,却不规定具体操作流程。代理需要自行发现软件的功能和行为,再构建一个尽可能忠实的实现,并通过运行和视觉验证寻找问题。研究团队将这种任务称为“复刻”,重点不只是生成代码,而是检验代理能否把观察、开发和验证连成一个持续过程。

核心要点

  • 覆盖五类平台。 环境支持Ubuntu、macOS、Windows、Android和Web,并提供统一的实验框架,同时开放原生GUI控制能力与编码工具。
  • 参考应用充当行为裁判。 参考软件可用于生成隐藏行为测试和执行结果反馈,使奖励不只依赖代码表面是否完成,还取决于实现能否产生相近的运行效果。
  • 训练数据来自真实开源应用。 团队利用高质量开源软件扩展轨迹生成规模,并观察训练后的模型能否迁移到复刻任务之外的编码和混合计算机使用基准。
  • 评测同时关注程序和视觉。 新推出的RecreationBench包含250项跨平台、跨领域任务,使用程序断言和视觉断言检查不同交互深度下的结果。这些断言先在参考应用上验证,并经人工审核后固定用于自动评分。

结果与局限

材料显示,GPT-6 Astra在该基准上的总体成绩为58.1%,但仅有2.8%的任务通过了全部程序测试。这一差距说明,代理完成一个“看起来像”的界面,并不等于复现了应用的真实行为。当前模型更容易复制静态结构,在交互逻辑和计算结果方面则更不稳定;生成的应用通常也比参考应用更小、更倾向于采用单体结构。

研究还观察到,使用相关轨迹训练后,模型在五个分布外的编码与混合计算机使用基准上有所提升,并更频繁地检查渲染结果。这为“验证行为”能够迁移到其他任务提供了积极迹象,但并不能消除复杂软件复现中的差距。

意义与影响

RecreationWorld的价值在于把计算机使用代理从单步操作评测,推进到“观察—实现—运行—验证”的完整工作流。它也提醒业界,衡量代理能力不能只看最终截图、代码是否生成,或单一动作是否成功,还应检查状态变化、连续交互和计算输出是否与参考行为一致。随着环境、基准和测试套件开放,这一框架有望帮助研究者更系统地比较不同模型在跨平台软件工作的可靠性。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章