GMA:让移动智能体面对更接近真实生活的复杂任务
移动设备正在成为多模态智能体的重要工作场景。相比在固定网页或单一应用中完成操作,真实手机任务往往涉及多个页面、不同类型的应用,以及持续变化的任务状态。用户说出“帮我规划一次旅行”或“完成一项生活分享”时,助手不仅要看懂界面,还要记住已有信息、判断下一步动作,并在流程中避免遗漏关键条件。
近日公布的 GMA(General Mobile Assistants)基准,正是针对这一缺口设计。研究团队认为,AndroidWorld、MobileWorld 等已有基准为移动智能体研究提供了重要基础,但在应用类型和任务复杂度方面,仍不足以完整呈现现实使用场景。GMA 引入了七款基于开源项目的应用,覆盖生活分享、旅行规划等领域,并设计了 300 个任务,按照四个难度层级组织:从单个原子操作,到包含多个环节的复杂工作流。
核心要点
- 评测范围更贴近通用助手。 GMA 不把测试局限在简单点击、输入或页面跳转,而是考察智能体能否在不同应用环境中理解目标并持续执行。
- 复杂度是关键分水岭。 对八个前沿模型的评估显示,随着任务从单步动作升级为多步骤流程,模型表现显著下滑。这意味着“会操作界面”并不等于“能可靠完成用户要求”。
- 执行框架同样重要。 研究还在统一环境、模型设置和任务分类下,对不同 agent harness 进行消融比较,重点考察上下文保留、显式状态跟踪等机制。结果表明,合适的框架设计尤其可能帮助复杂工作流,但不存在对所有基础模型都稳定有效的单一方案。
这项工作带来的启示是,移动智能体的瓶颈不只在视觉理解或基础模型能力。一个任务能否完成,还取决于系统如何保存历史信息、表示当前状态、检查中间结果,以及在失败后调整策略。换言之,评测对象应当从“模型能否点击正确位置”扩展到“模型与执行框架能否共同完成一项开放式任务”。
对开发者而言,GMA 可用于发现长流程中的失效环节,并比较不同上下文管理和状态管理方案。对研究者而言,它提供了一个更强调应用多样性与任务组合的测试环境。该基准并不意味着单纯增加任务数量就能解决可靠性问题,但它清楚表明:如果移动助手要进入真实生活场景,复杂工作流的稳定执行仍是必须跨越的主要障碍。
来源:arXiv
评论
正在确认登录状态……
正在加载评论……