华尔街实测8款AI Agent,千问办公综合排名第一

华尔街实测8款AI Agent,千问办公综合排名第一

8月19日,华尔街投行杰富瑞发布了一份针对全球主流AI Agent的实测报告。分析师选取了8款产品,在真实办公任务中进行了对比,结果显示,阿里千问办公综合得分排名第一,超过了美国的Claude Cowork和Codex等工具。

测试怎么做的?

这次测试设置了5项办公任务,覆盖了日常工作中常见的场景:基于多份文件生成公司年报摘要、联网查找并比较公司经营数据、操作真实桌面浏览器完成信息检索和文档生成、根据数据制作英文PPT,以及基于参考图片生成营销海报。

千问办公在各项任务中表现均衡,尤其在复杂办公任务、网页浏览器控制以及多模态内容生成等场景中突出,是唯一一个在所有测评维度中均获得90分以上的Agent产品。

为什么千问能拿第一?

报告将Agent能力拆分为模型与Harness两部分。Harness是围绕模型运行的一整套工程机制,包括指令、上下文、工具调用、边界控制、反馈纠错和治理等。按照杰富瑞的测算,千问办公的“隐含Harness分”位居此次测试产品首位。

这意味着,千问办公的优势不仅来自模型本身,更在于模型与工程机制的协同。这种协同让它在处理复杂任务时更稳定、更可靠,比如在浏览器控制这类需要精准操作的任务中,千问办公的表现明显优于其他产品。

对中国AI的启示

这次评测结果说明,中国AI产品在国际竞争中已经具备一定实力。千问办公的胜出,不只是模型能力的体现,也展示了中国团队在工程化落地上的积累。对于国内AI行业来说,这是一个积极的信号:在办公等垂直场景中,中国产品完全有能力与国际巨头一较高下。

当然,评测也提到成本是Agent商业化的重要因素。如何在保持性能的同时控制成本,将是所有Agent产品下一步需要面对的课题。

这次华尔街的实测,给中国AI打了一剂强心针。千问办公的排名,或许只是一个开始。

参考来源