StateAct:让电脑使用智能体先读程序状态,再看像素
导语
电脑使用智能体过去常被理解为“看屏幕、找按钮、点鼠标”的视觉问题。Salesforce AI Research 等作者提出的 StateAct 则给出相反路线:少看截图,多读程序状态。论文认为,屏幕像素只是文件、应用后端、DOM 等底层状态的一次有损渲染;不同真实状态可能显示出相同画面,而代码却能直接检查、验证甚至修改这些状态。
核心要点
- 状态优先,而不是像素优先:StateAct 的主智能体以代码方式访问程序状态,把文件路径、保存结果、网页 DOM、应用数据等作为主要行动依据。GUI 不被取消,但只交给专门子智能体处理确实需要视觉交互的子目标。
- 多智能体分工降低长任务负担:在上百步任务中,主智能体会把子目标交给新的子智能体执行,从而避免上下文被大量局部操作污染。素材显示,在 108 个任务中只有 28 个任务需要 GUI 子智能体,GUI 相关步骤仅占主智能体步骤的 1.1%。
- 验证也基于状态:框架包含独立的 finish gate,用于在结束前检查保存结果是否缺失、是否未保存、是否写到错误路径等结构性问题。这类错误单靠截图往往难以可靠发现。
- 性能与成本同时改善:在 OSWorld 2.0 上,StateAct 将 Claude Opus 4.8 的二元成功率从 20.6% 提升到 26.9%,部分成功率从 54.8% 提升到 61.6%;相较纯截图驱动,同模型每任务成本约降低 9 倍。没有 GUI 子智能体的 code-only 版本部分成功率为 45.9%,低于截图基线的 54.8%,说明“状态优先”并不等于完全放弃视觉界面。
意义与影响
StateAct 的价值不只是刷新若干基准分数,而是重新划分了电脑使用智能体的设计重点。很多桌面和移动任务的难点,并非模型看不清按钮,而是能否理解任务目标、追踪中间状态、确认结果真正落盘。把行动、验证和记忆都锚定在程序状态上,可以减少截图带来的歧义和 token 消耗,也让小模型获得更大杠杆。素材中,内部 31B SFR-CUA 在多个基准上也取得明显提升,说明该方法可能具有模型无关性。
当然,这一路线并不能取代 GUI。真实电脑环境仍有大量需要视觉判断、拖拽或交互反馈的场景。StateAct 更像是在提醒行业:电脑使用不是单纯的多模态感知竞赛,而是长程规划、状态读写、工具调用和结果验证的系统工程。
评论
正在确认登录状态……
正在加载评论……