GLM-5.3 来了,这次真打进第一梯队了
★ 设为星标 | 只讲人话,带你玩转AIGC。
这几天大模型圈是真的热闹。
前脚 Google 刚发布 Gemini 3.7 Flash,xAI 之前拿出了 Grok 4.6,国产模型这边更是Kimi、千问、DeepDeek 连番轰炸。现在另一个重磅玩家又来了。
智谱正式发布 GLM-5.3。
如果说前一阶段国产模型最大的突破,是证明“国产模型也能做出全球顶级能力”,那么这一阶段竞争的重点已经变成:
谁能真正成为下一代 AI Agent 的核心模型。
所以 GLM-5.3 这次重点也非常明确:
Coding 和 Agent。
而从官方公布的 Benchmark 来看,GLM-5.3 已经不只是和国产模型竞争,而是在直接挑战 GPT、Claude、Grok 这些全球第一梯队模型。
Coding:GLM-5.3 已经进入全球第一梯队
这次 GLM-5.3 最大的提升,首先体现在 Coding 能力上。
因为未来 AI 编程并不是简单让模型写几行代码,而是需要它真正理解项目结构、操作开发环境、调试问题,甚至完成整个软件工程任务。
比如 Terminal Bench 2.1,这个测试主要考察 AI 能否像程序员一样使用终端完成真实开发任务,包括写代码、运行程序、解决环境问题。
GLM-5.3 在这个测试中拿到了 88.2 分。
相比上一代 GLM-5.2,有明显提升。
更重要的是,这个成绩已经超过了 DeepSeek V4 Pro、Qwen3.8-Max 和 Claude Opus 4.8,与 GPT-5.6 Sol、Kimi K3 基本处于同一水平。
另一个更接近真实软件开发场景的 DeepSWE 测试中,GLM-5.3 的提升更加明显。
这个测试不是简单让 AI 生成代码,而是让它理解真实项目代码库,并解决实际工程问题。
GLM-5.3 相比上一代提升超过 20 分,已经超过 DeepSeek V4 Pro 和 Claude Opus 4.8,距离 Kimi K3 也非常接近。
当然,它还没有做到全面领先。
例如在一些复杂软件工程任务中,Fable 5 依然保持优势。
所以更准确的评价是:
GLM-5.3 已经进入 Coding 第一梯队,但距离全面超越 GPT、Claude 这样的旗舰模型,还有一定差距。
Agent:这次最大的惊喜
如果说 Coding 是 GLM-5.3 的基本盘,那么 Agent 才是这次最大的亮点。
因为未来 AI 的竞争重点,已经不是简单回答问题,而是:
能不能理解目标,调用工具,并自主完成一整套任务。
这也是为什么最近所有顶级模型都在疯狂强化 Agent 能力。
在 AutomationBench 测试中,GLM-5.3 表现非常亮眼。
这个测试主要衡量 AI Agent 执行复杂工作流的能力,比如规划任务、调用工具、连续完成多个步骤。
GLM-5.3 在这个项目中拿到了当前最高成绩,超过了 Kimi K3、Fable 5 和 GPT-5.6 Sol。
而在 GDPval-AA v2 这个更接近真实企业工作的测试中,GLM-5.3 同样排名第一。
这个测试模拟的是企业里的真实知识工作,比如分析资料、整理报告、处理复杂任务。
换句话说:GLM-5.3 不只是会写代码,它开始具备“帮人完成工作”的能力。
甚至在 Agents’ Last Exam 这个专门测试 Agent 推理和执行能力的项目里,GLM-5.3 与 GPT-5.6 Sol 几乎打平。
这说明至少在 Agent 方向,GLM-5.3 已经真正进入全球竞争范围。
和最近几个模型放在一起看
如果把最近发布的几个模型放在一起,会发现一个很有意思的变化。
DeepSeek V4 Pro 证明了国产模型已经可以进入全球竞争范围;
Gemini 3.7 Flash 证明 Google 正在快速提升 Flash 模型能力;
Grok 4.6 则直接冲到了 Agent 第一梯队。
而这一次 GLM-5.3 给出的信号是:国产模型不仅能追赶,在部分 Coding 和 Agent 场景中,已经开始领先。
当然,目前这些成绩主要来自官方 Benchmark,最终能力还需要等待第三方测试和真实使用反馈。
但至少可以确定:
GLM-5.3 已经不是“国产模型里的优秀选手”,而是真正坐到了全球第一梯队的牌桌上。
过去一年,大模型竞争的故事是:国外模型领先 → 国产模型追赶。
而现在,故事正在变成:所有模型一起加速,没有谁可以掉队。
- 原文作者:知识铺
- 原文链接:https://index.zshipu.com/gpt/post/20260815/GLM-5.3-%E6%9D%A5%E4%BA%86%E8%BF%99%E6%AC%A1%E7%9C%9F%E6%89%93%E8%BF%9B%E7%AC%AC%E4%B8%80%E6%A2%AF%E9%98%9F%E4%BA%86/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。
- 免责声明:本页面内容均来源于站内编辑发布,部分信息来源互联网,并不意味着本站赞同其观点或者证实其内容的真实性,如涉及版权等问题,请立即联系客服进行更改或删除,保证您的合法权益。转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。也可以邮件至 sblig@126.com