返回文章列表
世界模型

AutoGUIWorld:用图像生成器模拟 GUI 世界,扩展智能体训练轨迹

阅读约 3 分钟

导语

计算机使用智能体要想完成“打开应用、修改内容、保存文件”等多步骤任务,不能只学会识别按钮和执行点击,还需要理解界面状态如何随着动作变化。问题在于,高质量 GUI 轨迹通常依赖真实软件环境:应用需要安装和配置,不同版本与操作系统还会带来额外的运行成本。因此,训练数据的覆盖范围往往被可访问的软件、界面状态和工作流限制。

AutoGUIWorld 提出了一条不同的路线:不把每条训练轨迹都放到真实软件中执行,而是把图像生成器当作一种视觉世界模型,用它模拟动作之后可能出现的屏幕变化。

核心方法

  • 从结构化规格生成初始界面。 框架首先描述操作系统环境、视觉外观和界面状态,再据此采样 GUI 场景。这样可以在数据生成阶段控制场景的初始条件,而不必启动对应软件。
  • 由规划器拆解任务。 规划器负责根据当前场景生成任务,并进一步指定原子动作及其预期视觉后果。例如,一次点击不仅对应坐标,还应导致某个窗口、菜单或控件状态发生变化。
  • 用图像生成器迭代更新截图。 每执行一个动作,图像生成器便对当前截图进行编辑,产生下一步观察结果,从而形成包含状态变化的多步轨迹。
  • 进行动作落地与质量过滤。 研究加入动作 grounding,并对转移结果进行筛选,最终得到覆盖 Ubuntu、Windows、macOS 和 Chrome 的 79,266 个带空间标注的步骤级训练样本。

实验结果与意义

研究者使用 AutoGUIWorld 轨迹微调 Qwen3.5-35B-A3B。在 OSWorld 上,平均任务得分从 33.0% 提升到 40.8%;在 ScienceBoard 上,任务成功率从 14.0% 提升到 32.2%。这些结果说明,合成数据不仅能增加界面外观的多样性,也可能帮助模型学习动作、视觉反馈与任务状态之间的联系。

更重要的是,AutoGUIWorld 将 GUI 数据生成从“必须运行软件”部分转向“描述场景并模拟转移”。这为难以安装、配置成本高或不易批量运行的应用提供了新的数据扩展思路,也让跨平台轨迹合成更容易统一处理。

仍需关注的限制

图像生成器能够模拟视觉变化,并不等于完整复现了真实软件的逻辑、可交互性和长期状态。合成轨迹是否包含真实环境中的异常提示、权限问题、加载延迟和不可预测反馈,仍然决定了它对实际智能体的迁移价值。因此,AutoGUIWorld 更适合作为真实交互数据的补充,而不是完全替代真实环境评测。未来,合成视觉转移与可执行软件环境之间的校准,将是这一方向能否继续扩展的关键。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章