杰富瑞实测8款主流AI Agent:千问办公综合第一,Harness能力领先

2026/08/20 09:06阅读量 2

华尔街投行杰富瑞对8款主流AI Agent进行真实办公任务实测,阿里千问办公综合得分排名第一,是唯一在所有测评维度均获90分以上的产品。报告将Agent能力拆分为模型与Harness,千问办公隐含Harness分居首;同时其底层Qwen 3.8 Max API价格明显低于部分海外头部模型,性能与成本组合具备优势。

事件概述

华尔街投行杰富瑞分析师近日对八款全球主流AI Agent进行了真实办公任务实测。结果显示,阿里千问办公综合得分排名第一,超过Claude Cowork、Codex等七款国内外Agent产品。

核心信息

  • 本次实测共设置5项真实办公任务:基于多份文件完成公司年报摘要、联网查找并比较公司经营数据、操作真实桌面浏览器完成信息检索和文档生成、根据数据制作英文PPT,以及基于参考图片生成营销海报。
  • 千问办公整体表现均衡,在复杂办公任务、网页浏览器控制以及多模态内容生成等场景中表现突出,是唯一在所有测评维度中均获得90分以上的Agent产品。
  • 报告将Agent能力拆分为模型与Harness两部分。Harness指围绕模型运行的一整套工程机制,包括指令、上下文、工具调用、边界控制、反馈纠错和治理等。千问办公的“隐含Harness分”排名第一,高于Claude Cowork和Codex等另一类产品,说明工程和产品能力正成为Agent竞争的重要维度。
  • 成本同样被纳入考量。千问办公底层Qwen 3.8 Max的API价格明显低于部分海外头部模型。由于Agent通常需要多轮推理、工具调用和长链路执行,企业未来衡量Agent价值时,可能更关注“Cost per Task”,即完成一项真实任务所需的执行成本。
  • Agent竞争正从个人办公转向企业级场景,工作流与生态协同成为核心壁垒。用户的历史任务、工作习惯、连接器、Skills和自动化流程会逐渐沉淀在产品中,形成更高的使用粘性和迁移成本。
  • 千问办公目前已初步打通钉钉IM工具,企业员工可通过其完成群聊总结、文档表格创建、消息邮件收发等操作,未来计划进一步接入企业真实数据库和工作流。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。