★ 设为星标 | 只讲人话,带你玩转AIGC。

这几天大模型圈是真的热闹。

前脚 Google 刚发布 Gemini 3.7 Flash,xAI 之前拿出了 Grok 4.6,国产模型这边更是Kimi、千问、DeepDeek 连番轰炸。现在另一个重磅玩家又来了。

智谱正式发布 GLM-5.3。

如果说前一阶段国产模型最大的突破,是证明“国产模型也能做出全球顶级能力”,那么这一阶段竞争的重点已经变成:

谁能真正成为下一代 AI Agent 的核心模型。

所以 GLM-5.3 这次重点也非常明确:

Coding 和 Agent。

而从官方公布的 Benchmark 来看,GLM-5.3 已经不只是和国产模型竞争,而是在直接挑战 GPT、Claude、Grok 这些全球第一梯队模型。

Image

Coding:GLM-5.3 已经进入全球第一梯队

这次 GLM-5.3 最大的提升,首先体现在 Coding 能力上。

因为未来 AI 编程并不是简单让模型写几行代码,而是需要它真正理解项目结构、操作开发环境、调试问题,甚至完成整个软件工程任务。

比如 Terminal Bench 2.1,这个测试主要考察 AI 能否像程序员一样使用终端完成真实开发任务,包括写代码、运行程序、解决环境问题。

Image

GLM-5.3 在这个测试中拿到了 88.2 分

相比上一代 GLM-5.2,有明显提升。

更重要的是,这个成绩已经超过了 DeepSeek V4 Pro、Qwen3.8-Max 和 Claude Opus 4.8,与 GPT-5.6 Sol、Kimi K3 基本处于同一水平。

另一个更接近真实软件开发场景的 DeepSWE 测试中,GLM-5.3 的提升更加明显。

这个测试不是简单让 AI 生成代码,而是让它理解真实项目代码库,并解决实际工程问题。

GLM-5.3 相比上一代提升超过 20 分,已经超过 DeepSeek V4 Pro 和 Claude Opus 4.8,距离 Kimi K3 也非常接近。

当然,它还没有做到全面领先。

例如在一些复杂软件工程任务中,Fable 5 依然保持优势。

所以更准确的评价是:

GLM-5.3 已经进入 Coding 第一梯队,但距离全面超越 GPT、Claude 这样的旗舰模型,还有一定差距。

Agent:这次最大的惊喜

如果说 Coding 是 GLM-5.3 的基本盘,那么 Agent 才是这次最大的亮点。

因为未来 AI 的竞争重点,已经不是简单回答问题,而是:

能不能理解目标,调用工具,并自主完成一整套任务。

这也是为什么最近所有顶级模型都在疯狂强化 Agent 能力。

在 AutomationBench 测试中,GLM-5.3 表现非常亮眼。

这个测试主要衡量 AI Agent 执行复杂工作流的能力,比如规划任务、调用工具、连续完成多个步骤。

GLM-5.3 在这个项目中拿到了当前最高成绩,超过了 Kimi K3、Fable 5 和 GPT-5.6 Sol。

而在 GDPval-AA v2 这个更接近真实企业工作的测试中,GLM-5.3 同样排名第一。

这个测试模拟的是企业里的真实知识工作,比如分析资料、整理报告、处理复杂任务。

换句话说:GLM-5.3 不只是会写代码,它开始具备“帮人完成工作”的能力。

甚至在 Agents’ Last Exam 这个专门测试 Agent 推理和执行能力的项目里,GLM-5.3 与 GPT-5.6 Sol 几乎打平。

这说明至少在 Agent 方向,GLM-5.3 已经真正进入全球竞争范围。

和最近几个模型放在一起看

如果把最近发布的几个模型放在一起,会发现一个很有意思的变化。

DeepSeek V4 Pro 证明了国产模型已经可以进入全球竞争范围;

Gemini 3.7 Flash 证明 Google 正在快速提升 Flash 模型能力;

Grok 4.6 则直接冲到了 Agent 第一梯队。

而这一次 GLM-5.3 给出的信号是:国产模型不仅能追赶,在部分 Coding 和 Agent 场景中,已经开始领先。

当然,目前这些成绩主要来自官方 Benchmark,最终能力还需要等待第三方测试和真实使用反馈。

但至少可以确定:

GLM-5.3 已经不是“国产模型里的优秀选手”,而是真正坐到了全球第一梯队的牌桌上。

过去一年,大模型竞争的故事是:国外模型领先 → 国产模型追赶。

而现在,故事正在变成:所有模型一起加速,没有谁可以掉队。

图片

国外大模型,突然开始反攻了

图片

DeepSeek 涨价 12 倍,比 GPT 还贵,斩杀线彻底让位了