华尔街实测8款主流AI Agent:千问办公综合排名第一,超越Claude Cowork与Codex

2026/08/19 15:27阅读量 3

杰富瑞分析师对8款全球主流AI Agent进行5项真实办公任务测试,阿里千问办公综合得分排名第一,是唯一在所有测评维度均获90分以上的产品。报告将Agent能力拆分为模型与Harness两部分,千问办公的隐含Harness分居首;其底层Qwen 3.8 Max的API价格也低于部分海外头部模型,性能与成本兼具优势。

事件概述

华尔街投行杰富瑞分析师近日对8款全球主流AI Agent进行真实办公任务实测。结果显示,阿里千问办公综合得分排名第一,超过Claude Cowork、Codex等国内外Agent工具。

测试设置与结果

测试共设置5项真实办公任务:

  • 基于多份文件完成公司年报摘要
  • 联网查找并比较公司经营数据
  • 操作真实桌面浏览器完成信息检索和文档生成
  • 根据数据制作英文PPT
  • 基于参考图片生成营销海报

千问办公整体表现均衡,在复杂办公任务、网页浏览器控制、多模态内容生成等场景中表现突出,是唯一在所有测评维度中均获得90分以上的Agent产品。

报告关键分析

报告将Agent能力拆分为模型与Harness两部分。Harness指围绕模型运行的工程机制,包括指令、上下文、工具调用、边界控制、反馈纠错和治理等。按杰富瑞测算,千问办公的“隐含Harness分”位居测试产品首位,高于Claude Cowork、Codex等七款产品,说明工程和产品能力正成为Agent竞争的重要维度。

成本方面,千问办公底层Qwen 3.8 Max的API价格明显低于部分海外头部模型。由于Agent通常需要多轮推理、持续调用工具和执行长链路任务,企业衡量Agent价值时可能更关注“Cost per Task”(完成单次任务所需执行成本)。

企业级趋势

报告认为,Agent竞争正从个人办公转向企业级场景,工作流和生态协同成为核心竞争壁垒。用户历史任务、工作习惯、连接器、Skills和自动化流程会沉淀在产品中,形成使用粘性和迁移成本。目前千问办公已初步打通钉钉IM工具,支持群聊总结、文档表格创建、消息邮件收发等操作,未来可接入企业真实工作流和数据库。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。