返回文章列表
AI 智能体

StateAct:让电脑使用智能体先读程序状态,再看像素

阅读约 2 分钟

导语

电脑使用智能体过去常被理解为“看屏幕、找按钮、点鼠标”的视觉问题。Salesforce AI Research 等作者提出的 StateAct 则给出相反路线:少看截图,多读程序状态。论文认为,屏幕像素只是文件、应用后端、DOM 等底层状态的一次有损渲染;不同真实状态可能显示出相同画面,而代码却能直接检查、验证甚至修改这些状态。

核心要点

  • 状态优先,而不是像素优先:StateAct 的主智能体以代码方式访问程序状态,把文件路径、保存结果、网页 DOM、应用数据等作为主要行动依据。GUI 不被取消,但只交给专门子智能体处理确实需要视觉交互的子目标。
  • 多智能体分工降低长任务负担:在上百步任务中,主智能体会把子目标交给新的子智能体执行,从而避免上下文被大量局部操作污染。素材显示,在 108 个任务中只有 28 个任务需要 GUI 子智能体,GUI 相关步骤仅占主智能体步骤的 1.1%。
  • 验证也基于状态:框架包含独立的 finish gate,用于在结束前检查保存结果是否缺失、是否未保存、是否写到错误路径等结构性问题。这类错误单靠截图往往难以可靠发现。
  • 性能与成本同时改善:在 OSWorld 2.0 上,StateAct 将 Claude Opus 4.8 的二元成功率从 20.6% 提升到 26.9%,部分成功率从 54.8% 提升到 61.6%;相较纯截图驱动,同模型每任务成本约降低 9 倍。没有 GUI 子智能体的 code-only 版本部分成功率为 45.9%,低于截图基线的 54.8%,说明“状态优先”并不等于完全放弃视觉界面。

意义与影响

StateAct 的价值不只是刷新若干基准分数,而是重新划分了电脑使用智能体的设计重点。很多桌面和移动任务的难点,并非模型看不清按钮,而是能否理解任务目标、追踪中间状态、确认结果真正落盘。把行动、验证和记忆都锚定在程序状态上,可以减少截图带来的歧义和 token 消耗,也让小模型获得更大杠杆。素材中,内部 31B SFR-CUA 在多个基准上也取得明显提升,说明该方法可能具有模型无关性。

当然,这一路线并不能取代 GUI。真实电脑环境仍有大量需要视觉判断、拖拽或交互反馈的场景。StateAct 更像是在提醒行业:电脑使用不是单纯的多模态感知竞赛,而是长程规划、状态读写、工具调用和结果验证的系统工程。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Multi-Head Latent Control:让智能体从“内部状态”判断何时回答、求助或调用工具
AI 智能体
cctest.ai
AI 智能体

Multi-Head Latent Control:让智能体从“内部状态”判断何时回答、求助或调用工具

这篇论文提出 Multi-Head Latent Control,用冻结大模型生成过程中的隐藏状态来做部署时决策。它试图把“是否能答、是否该求助、是否要用工具”从外部编排问题,转化为轻量控制头的预测问题。

阅读全文
CCTest · Blog
纳德拉警告企业:把所有 AI 能力押给一家模型商,可能失去生存权
AI 智能体
cctest.ai
AI 智能体

纳德拉警告企业:把所有 AI 能力押给一家模型商,可能失去生存权

微软 CEO 萨提亚·纳德拉认为,企业若把数据、提示词、上下文和智能体工具完全交给单一 AI 模型提供商,长期看等于“外包自己的思考”。他的建议是保留模型使用过程中的元数据,并通过 AI 网关、多模型架构和自有模型能力保持主动权。

阅读全文