华尔街实测8款AI Agent,千问办公综合排名第一
华尔街实测8款AI Agent,千问办公综合排名第一
8月19日,华尔街投行杰富瑞发布了一份针对全球主流AI Agent的实测报告。分析师选取了8款产品,在真实办公任务中进行了对比,结果显示,阿里千问办公综合得分排名第一,超过了美国的Claude Cowork和Codex等工具。
测试怎么做的?
这次测试设置了5项办公任务,覆盖了日常工作中常见的场景:基于多份文件生成公司年报摘要、联网查找并比较公司经营数据、操作真实桌面浏览器完成信息检索和文档生成、根据数据制作英文PPT,以及基于参考图片生成营销海报。
千问办公在各项任务中表现均衡,尤其在复杂办公任务、网页浏览器控制以及多模态内容生成等场景中突出,是唯一一个在所有测评维度中均获得90分以上的Agent产品。
为什么千问能拿第一?
报告将Agent能力拆分为模型与Harness两部分。Harness是围绕模型运行的一整套工程机制,包括指令、上下文、工具调用、边界控制、反馈纠错和治理等。按照杰富瑞的测算,千问办公的“隐含Harness分”位居此次测试产品首位。
这意味着,千问办公的优势不仅来自模型本身,更在于模型与工程机制的协同。这种协同让它在处理复杂任务时更稳定、更可靠,比如在浏览器控制这类需要精准操作的任务中,千问办公的表现明显优于其他产品。
对中国AI的启示
这次评测结果说明,中国AI产品在国际竞争中已经具备一定实力。千问办公的胜出,不只是模型能力的体现,也展示了中国团队在工程化落地上的积累。对于国内AI行业来说,这是一个积极的信号:在办公等垂直场景中,中国产品完全有能力与国际巨头一较高下。
当然,评测也提到成本是Agent商业化的重要因素。如何在保持性能的同时控制成本,将是所有Agent产品下一步需要面对的课题。
这次华尔街的实测,给中国AI打了一剂强心针。千问办公的排名,或许只是一个开始。
参考来源
- 原文作者:知识铺
- 原文链接:https://index.zshipu.com/ai/post/20260820/%E5%8D%8E%E5%B0%94%E8%A1%97%E5%AE%9E%E6%B5%8B8%E6%AC%BEAI-Agent%E5%8D%83%E9%97%AE%E5%8A%9E%E5%85%AC%E7%BB%BC%E5%90%88%E6%8E%92%E5%90%8D%E7%AC%AC%E4%B8%80/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。
- 免责声明:本页面内容均来源于站内编辑发布,部分信息来源互联网,并不意味着本站赞同其观点或者证实其内容的真实性,如涉及版权等问题,请立即联系客服进行更改或删除,保证您的合法权益。转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。也可以邮件至 sblig@126.com