返回文章列表
AI 智能体

DeskForge:用可控桌面环境为计算机使用智能体提供密集监督

阅读约 3 分钟

导语

让 AI 真正操作电脑,难点往往不在于理解一句指令,而在于屏幕上存在多个应用、重叠窗口和外观相似的按钮时,能否准确找到下一步应该点击或输入的位置。DeskForge 论文提出了一条数据构建路线:不只收集静态截图,而是搭建一个能够控制桌面状态、执行操作并记录结果的环境,为计算机使用智能体提供更密集、更系统的训练信号。

核心要点

  • 把真实应用纳入可控生成流程。 DeskForge 可以组合并探索真实桌面应用,同时改变应用状态、页面内容、窗口位置、视觉外观和屏幕分辨率。这样既保留了真实软件界面的复杂性,也能在不同条件下批量生成样本。
  • 融合多种信息源进行标注。 系统将截图、无障碍树和窗口几何信息结合起来,为桌面中的界面元素生成密集标注。相比只标记一个最终点击点,这种方式能够描述更多潜在操作目标及其空间位置。
  • 记录动作是否成功。 环境不仅保存观察结果,也记录每次执行动作的结果,为训练和评估提供了从“看见目标”到“采取动作”的关联信息。
  • 数据规模较大。 DeskForge-1M 包含 120 万条带标注的桌面观测,共覆盖 1.597 亿个元素实例。论文从中抽取 20 万条 grounding 样本,用于微调四个视觉语言模型。
  • 外部评测出现一致改善。 论文报告称,四个模型在保留的桌面条件以及五个外部 GUI grounding 基准上均有提升。以 Qwen3.5-4B 为例,其在 ScreenSpot-Pro 上提升 11.51 个百分点,在 OSWorld-G 上提升 10.11 个百分点。

这项工作的意义

DeskForge 的核心价值不只是扩大数据量,而是尝试解决桌面智能体训练中的“可控性”问题。现实电脑界面变化很多,单纯依赖人工录制或静态网页截图,很难同时覆盖窗口遮挡、布局变化、分辨率差异和相似控件竞争等情况。将应用状态与界面几何纳入生成流程,可以更有针对性地制造这些困难场景。

论文还测试了长程任务。使用固定规划器时,经过 DeskForge 数据微调的动作模型完成了更多 WebArena-Infinity 和 OpenApps 任务。Qwen3.5-4B 在前者中从 119 个任务完成 31 个提升到 50 个,在后者中从 100 个任务完成 3 个提升到 15 个。这个结果提示,更准确的局部界面定位可能会沿着任务链条累积,最终影响整体执行成功率。

不过,论文给出的结果主要说明该数据生成与微调方案有效,并不意味着桌面智能体已经解决了所有可靠性问题。真实应用的版本变化、异常状态和跨应用流程仍可能带来新的分布差异。DeskForge 的开放数据、代码和微调模型,则为后续研究复现和比较不同训练策略提供了基础。

arXiv

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
LLM智能体会偏爱某些来源:搜索结果中的“来源偏见”如何形成
AI 智能体
cctest.ai
AI 智能体

LLM智能体会偏爱某些来源:搜索结果中的“来源偏见”如何形成

一项覆盖12个智能体模型、购物、酒店和学术检索三类场景的研究发现,LLM可能因为来源标签而偏爱某些选项,即使这些选项并不是最符合用户要求的选择。隐藏来源、补充缺失信息或在提示词中纠正预设,可以减弱这种偏好。

阅读全文