★ 设为星标 | 只讲人话,带你玩转AIGC。

一众媒体宣布 DeepSeek V4 Pro 正式版之后,官方终于在昨晚姗姗来迟,正式宣布了。

为什么会有这么大延迟,在一天多的试用后大量网友给出了反馈。

V4 Pro 0813 上线之后,社区很快发现,DeepSeek 最初上传到 Hugging Face 的模型配置似乎有问题:模型架构竟然和之前的 V4 Flash 基本一致,而不是正常的 V4 Pro。

随后相关仓库一度调整,DeepSeek 又重新上传了模型,现在已经恢复成正常的 Pro 架构。

所以社区里不少人都在调侃:DeepSeek 这次不会真的把模型发错了吧?

真相到底如何,我们不知道,但从网友反馈以及第三方评测来看,Pro 似乎真的「翻车」了。

Flash 让人眼前一亮,把大部分模型拖入了 DeepSeek 的斩杀线。大家不得不对 Pro 很高期盼,觉得它能干翻最顶级的 Claude Fable 5。

但事实如何?

如果只看 DeepSeek 官方公布的数据,这次 V4 Pro 的 Agent 能力还是相当强的。

Image

图:DeepSeek 官方公布的 benchmark

从 DeepSeek 官方给出的 Agent Benchmark 来看,V4 Pro 确实已经进入了全球顶级模型这一档,尤其是在 Coding 和 Agent 场景里很能打。

但是看第三方测试,情况就有点微妙了。

Image

图:第三方评测 V4 Pro 非常拉跨

Artificial Analysis 最新的 Intelligence Index 里:

DeepSeek V4 Pro 0813 只比两个星期前发布的DeepSeek V4 Flash 高了一分。

这个能力比 Kimi K3 差太远,跟 GLM 5.2 以及 GPT Luna 一个水平。(天啦,这可是 GPT 的最小杯)

也就是说,如果看综合智能水平,目前大概是:

V4 Pro  ≈ V4 Flash  ≈ GPT-5.6 Luna

这和官方 Agent Benchmark 给人的感觉其实有点不一样。

至少从 Artificial Analysis 当前的数据来看,V4 Pro 并没有和 Flash 拉开我们想象中的明显差距。

当然,考虑到前面出现过疑似上传错误版本的问题,现在这个 53 分到底能不能完全代表最终的 V4 Pro,还需要继续观察。

但这次 V4 Pro 真正让我意外的,其实不是性能,而是价格。

DeepSeek 这次不但涨价,而且涨幅相当大(甚至离谱)。

![Image](data:image/svg+xml,%3C%3Fxml version=‘1.0’ encoding=‘UTF-8’%3F%3E%3Csvg width=‘1px’ height=‘1px’ viewBox=‘0 0 1 1’ version=‘1.1’ xmlns=‘http://www.w3.org/2000/svg' xmlns:xlink=‘http://www.w3.org/1999/xlink'%3E%3Ctitle%3E%3C/title%3E%3Cg stroke=‘none’ stroke-width=‘1’ fill=‘none’ fill-rule=‘evenodd’ fill-opacity=‘0’%3E%3Cg transform=‘translate(-249.000000, -126.000000)’ fill=’%23FFFFFF’%3E%3Crect x=‘249’ y=‘126’ width=‘1’ height=‘1’%3E%3C/rect%3E%3C/g%3E%3C/g%3E%3C/svg%3E)

图:DeepSeek 新旧价格对比

V4 Pro 非峰值时段,缓存输入、未缓存输入和输出分别涨到了原来的 6 倍、1.5 倍和 2.25 倍;到了峰值时段,更是达到原来的 12 倍、3 倍和 4.5 倍。

最高涨价 12 倍,这个数字确实有点吓人。

但判断它现在到底贵不贵,不能拿 GPT-5.6 Sol、Claude Opus 5 这些模型来比。

因为从 Artificial Analysis 的测试来看,V4 Pro 目前只有 53 分,和它真正处在同一能力档位的,是 GPT-5.6 Luna(52 分)、GLM-5.2(53 分)这些模型。

这么一比,DeepSeek 之前的价格优势就荡然无存了。

尤其是 GPT-5.6 Luna,OpenAI GPT 的最小杯。

OpenAI 之前把它的价格下调了 80%,现在输入只要 0.20 美元/百万 Tokens,输出 1.20 美元,折合人民币大约 1.4 元和 8.6 元。

而 V4 Pro 即便是在更便宜的非峰值时段,未缓存输入也要 4.5 元,输出 13.5 元;峰值时段更是达到 9 元和 27 元。

也就是说,在目前第三方测试中两者能力几乎相当的情况下,即使在非峰值时段,DeepSeek V4 Pro 的输入价格也是 GPT-5.6 Luna 的约 3.1 倍,输出约 1.6 倍;到了峰值时段,则分别达到约 6.25 倍和 3.1 倍。

这样看,甚至是离谱了。

过去 DeepSeek 最恐怖的地方,是能力做到同一档,价格却能低一个数量级,所以我之前一直把它叫作大模型行业的“价格屠夫”。

上周还在流传 DeepSeek 斩杀线,但现在却第一次出现了一个很有意思的局面:同一能力档位里,GPT 已经可以比 DeepSeek 更便宜。

![Image](data:image/svg+xml,%3C%3Fxml version=‘1.0’ encoding=‘UTF-8’%3F%3E%3Csvg width=‘1px’ height=‘1px’ viewBox=‘0 0 1 1’ version=‘1.1’ xmlns=‘http://www.w3.org/2000/svg' xmlns:xlink=‘http://www.w3.org/1999/xlink'%3E%3Ctitle%3E%3C/title%3E%3Cg stroke=‘none’ stroke-width=‘1’ fill=‘none’ fill-rule=‘evenodd’ fill-opacity=‘0’%3E%3Cg transform=‘translate(-249.000000, -126.000000)’ fill=’%23FFFFFF’%3E%3Crect x=‘249’ y=‘126’ width=‘1’ height=‘1’%3E%3C/rect%3E%3C/g%3E%3C/g%3E%3C/svg%3E)

图:DeepSeek 价格调整后的斩杀区

从这个图可以看到,现在真正的斩杀线是 GPT,而不是 DeepSeek 了。(而 DeepSeek 真是还不支持多模态)

这两天对 DeepSeek 的评价两极分化特别有意思,很多人在评论区从“梁圣”变成了“梁子”、“凉子”,甚至有“闻峰而逃”等戏谑说法。 图片 (不代表本号观点)

这可能比“最高涨价 12 倍”本身,更值得关注。

毕竟,斩杀线从来不属于谁。

谁能把同样的能力做到更便宜,谁才是下一把刀。

![图片](data:image/svg+xml,%3C%3Fxml version=‘1.0’ encoding=‘UTF-8’%3F%3E%3Csvg width=‘1px’ height=‘1px’ viewBox=‘0 0 1 1’ version=‘1.1’ xmlns=‘http://www.w3.org/2000/svg’ xmlns:xlink=‘http://www.w3.org/1999/xlink’%3E%3Ctitle%3E%3C/title%3E%3Cg stroke=‘none’ stroke-width=‘1’ fill=‘none’ fill-rule=‘evenodd’ fill-opacity=‘0’%3E%3Cg transform=‘translate(-249.000000, -126.000000)’ fill=’%23FFFFFF’%3E%3Crect x=‘249’ y=‘126’ width=‘1’ height=‘1’%3E%3C/rect%3E%3C/g%3E%3C/g%3E%3C/svg%3E)

DeepSeek Harness 来了:一个可以随便换模型的 Agent 工作台