返回文章列表
AI 智能体

华尔街实测八款主流Agent:千问办公为何暂居首位

阅读约 3 分钟

导语

AI Agent的竞争,正在从“谁的模型更聪明”转向“谁能更稳定地把事情做完”。杰富瑞近日对八款全球主流Agent进行办公场景实测,结果显示,阿里千问办公综合排名第一,并在模型之外的工程组织能力上取得较高评价。不过,这是一份基于特定任务和测试方法的机构报告,适合用来观察趋势,不宜直接等同于所有企业场景下的普遍结论。

五类任务,考察的不只是生成能力

测试覆盖五项真实办公工作:根据多份文件撰写公司年报摘要;联网检索并比较企业经营数据;控制桌面浏览器完成信息查找和文档生成;依据数据制作英文PPT;以及参考图片生成营销海报。

据报告,千问办公在复杂办公任务、浏览器操作和多模态内容生成等环节表现突出,而且是唯一一个在全部测评维度中都获得90分以上的产品。这个结果反映出,办公Agent的评价标准已经超越了回答是否流畅,还包括能否理解多来源材料、调用工具、处理网页环境,并交付可直接使用的文件。

Harness成为隐藏的竞争层

杰富瑞将Agent能力拆成模型和Harness两部分。Harness并非单一模型,而是围绕模型搭建的执行系统,包括任务指令、上下文管理、工具调用、权限与边界控制、反馈纠错以及治理机制等。

报告测算显示,千问办公的“隐含Harness分”位居八款产品之首,高于Claude Cowork和Codex等产品。其意义在于:同一个模型如果缺少合适的任务拆解、工具编排和错误恢复机制,往往难以稳定完成长链路工作。反过来,优秀的Harness可以把模型能力转化为更可控的业务结果。

成本将决定Agent能否规模化

Agent通常需要多轮推理、反复调用工具,并在较长流程中持续保留上下文。因此,企业不能只看模型效果,也需要关注完成一项真实任务的总成本,即“Cost per Task”。素材显示,千问办公使用的Qwen 3.8 Max API价格低于部分海外头部模型,报告据此认为其性能与成本组合具备一定优势。

但成本优势仍需结合任务成功率、人工复核、权限管理和系统接入费用衡量。只有当Agent能够稳定完成工作,并减少而非增加后续校验成本,低API价格才会真正转化为企业价值。

企业级Agent比拼工作流和生态

随着Agent从个人办公走向企业环境,连接器、Skills、历史任务、协作工具和权限体系会逐渐沉淀在产品中,形成使用粘性与迁移成本。千问办公目前已初步打通钉钉IM,可支持群聊总结、文档表格创建以及消息和邮件收发等操作。未来,企业还需要把Agent接入数据库和真实业务流程,才能检验其长期效率收益。

因此,这次排名更值得关注的并非单一冠军,而是评价框架的变化:模型能力是起点,Harness决定执行稳定性,成本和生态则决定能否真正进入企业生产环境。

来源:量子位

评论

正在确认登录状态……

正在加载评论……

相关文章