返回文章列表
模型评测

GMA:让移动智能体面对更接近真实生活的复杂任务

阅读约 2 分钟

移动设备正在成为多模态智能体的重要工作场景。相比在固定网页或单一应用中完成操作,真实手机任务往往涉及多个页面、不同类型的应用,以及持续变化的任务状态。用户说出“帮我规划一次旅行”或“完成一项生活分享”时,助手不仅要看懂界面,还要记住已有信息、判断下一步动作,并在流程中避免遗漏关键条件。

近日公布的 GMA(General Mobile Assistants)基准,正是针对这一缺口设计。研究团队认为,AndroidWorld、MobileWorld 等已有基准为移动智能体研究提供了重要基础,但在应用类型和任务复杂度方面,仍不足以完整呈现现实使用场景。GMA 引入了七款基于开源项目的应用,覆盖生活分享、旅行规划等领域,并设计了 300 个任务,按照四个难度层级组织:从单个原子操作,到包含多个环节的复杂工作流。

核心要点

  • 评测范围更贴近通用助手。 GMA 不把测试局限在简单点击、输入或页面跳转,而是考察智能体能否在不同应用环境中理解目标并持续执行。
  • 复杂度是关键分水岭。 对八个前沿模型的评估显示,随着任务从单步动作升级为多步骤流程,模型表现显著下滑。这意味着“会操作界面”并不等于“能可靠完成用户要求”。
  • 执行框架同样重要。 研究还在统一环境、模型设置和任务分类下,对不同 agent harness 进行消融比较,重点考察上下文保留、显式状态跟踪等机制。结果表明,合适的框架设计尤其可能帮助复杂工作流,但不存在对所有基础模型都稳定有效的单一方案。

这项工作带来的启示是,移动智能体的瓶颈不只在视觉理解或基础模型能力。一个任务能否完成,还取决于系统如何保存历史信息、表示当前状态、检查中间结果,以及在失败后调整策略。换言之,评测对象应当从“模型能否点击正确位置”扩展到“模型与执行框架能否共同完成一项开放式任务”。

对开发者而言,GMA 可用于发现长流程中的失效环节,并比较不同上下文管理和状态管理方案。对研究者而言,它提供了一个更强调应用多样性与任务组合的测试环境。该基准并不意味着单纯增加任务数量就能解决可靠性问题,但它清楚表明:如果移动助手要进入真实生活场景,复杂工作流的稳定执行仍是必须跨越的主要障碍。

来源:arXiv

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
UrbanGround:让多模态智能体在真实尺度城市中接受空间能力检验
模型评测
cctest.ai
模型评测

UrbanGround:让多模态智能体在真实尺度城市中接受空间能力检验

UrbanGround 将香港全域三维地理数据构建为可交互的城市沙盒,用于测试多模态大模型能否把局部视觉理解转化为持续、可靠的导航行动。研究显示,当前模型擅长短距离感知,却难以在长程探索中维持方向感并及时纠错。

阅读全文
CCTest · Blog
评测结果究竟能证明什么?一项对 Inspect Evals 的可复现性审计
模型评测
cctest.ai
模型评测

评测结果究竟能证明什么?一项对 Inspect Evals 的可复现性审计

一项基于固定代码提交版本的审计发现,评测脚本能够定义计算过程,却未必足以支撑与指标绑定的历史性结论。研究对 124 个 Inspect Evals 单元进行盘点,其中 110 个在进入确定性推断前就因证据或语义问题停止。

阅读全文