大模型边际毛利率92%却掉到17%:腾讯混元与智谱的成本真相

梁文锋称模型边际毛利率82%,智谱却报28%,腾讯混元边际92%-96%而财报口径仅17%-26%。差异全在成本口径:前者只扣单次推理GPU折旧和电力,后者扣除全部固定成本。按常规参数算,每百万输出token边际成本主要来自3年折旧的单卡2.2万美元与700W功耗乘PUE1.35的电费,MFU30%下工程折损0.4后,边际成本远低于多数人预期。

大模型公司反复提到的毛利率其实是两套完全不同的数字。边际毛利率只看当次推理产生的可变成本,主要是GPU硬件折旧和电费。财报口径毛利率则把研发、人员、数据、营销等所有固定成本全部扣除后得出。两套口径导致同一业务出现极端差异。

梁文锋公开表示其模型边际毛利率达到82%。智谱给出的则是28%的财报毛利率。腾讯混元在HY3和HY4两个季度边际毛利率分别达到92%和96%,但把所有相关成本计入后,财报口径毛利率只有17%至26%。这些数字直接来自公开讨论和财报拆解。

理解这个差异对判断大模型生意可持续性至关重要。边际毛利率高容易给人“快要赚钱”的印象,但真实盈利能力取决于能否把巨额固定成本通过规模摊薄到接近边际成本的水平。目前多数玩家仍处于后者远高于前者的阶段。

边际毛利率只扣GPU折旧和电力,其余固定成本全被排除

边际毛利率计算时只考虑每次推理直接产生的成本。信号明确指出,这部分只包括GPU折旧和电力消耗。其他所有支出如模型训练费用、研发团队薪酬、数据获取、基础设施建设、营销推广等固定成本全部排除在外。

梁文锋所说的82%正是这种口径。他只扣除当次推理用到的GPU折旧和电费,没有计入任何前期投入。智谱的28%则是标准的财报毛利率,把能归属于大模型业务的所有成本都扣完了。

腾讯混元的情况更典型。因为背靠腾讯云,其边际毛利率在HY3达到92%,HY4进一步升至96%。这得益于云服务现有的基础设施分摊机制,让单次推理的可见成本极低。但一旦把所有固定成本加进去,混元毛利率立刻回落至17%~26%的区间,和智谱、MiniMax处于同一水平。

这种口径差异不是会计游戏,而是反映了商业模式的本质。大模型前期投入巨大,固定成本占比极高。边际成本低让公司有动力通过低价或免费吸引用户,但只有当用户量和调用量足够大时,固定成本才能被有效摊薄。否则高边际毛利率只是幻觉。

国内几家头部大模型公司目前都面临同样处境。它们必须持续烧钱维持模型迭代,同时努力把调用量拉上去。短期内财报毛利率低几乎是必然结果。投资者需要区分两种数字,避免被边际毛利率误导。

这个定义差异也解释了为什么市场对大模型盈利能力众说纷纭。同一件事用不同口径讲出来,结论可以完全相反。梁文锋强调边际成本优势,智谱则给出更保守的全成本视图。腾讯混元同时公布两套数据,恰好提供了完整对照。

每百万输出token边际成本按单卡2.2万美元、3年折旧、700W功耗计算

大模型边际毛利率92%却掉到17%:腾讯混元与智谱的成本真相:每百万输出token边际成本按单卡2.2万美元、3年折旧、700W功耗计算

信号提供了一套常规参数来估算每百万输出token的边际成本。这些参数包括单卡价格2.2万美元、3年折旧期、单卡功耗700W、PUE 1.35、电价0.049美元/kWh、MFU 30%以及工程折损系数0.4。

计算逻辑从硬件成本开始。单卡2.2万美元,按3年折旧,每年折旧费用约为7333美元。功耗部分则用700W乘以PUE 1.35得到实际电力需求,再乘以电价得出每小时电费。MFU 30%代表实际利用率,只有三成算力被有效用于推理。工程折损0.4进一步扣除了prefill等非输出阶段的消耗。

按照这套参数算出的结果显示,边际成本主要由GPU折旧和电费构成。信号指出结论对具体参数并不特别敏感,即使调整部分数值,整体量级仍远低于市场很多人的预期。

这个拆解直接指向一个关键事实:单次推理的可见成本其实很低。这解释了为什么边际毛利率能轻松达到82%甚至96%。只要调用量足够大,理论上每一次额外推理带来的收入几乎等于毛利。

但现实中MFU 30%和工程折损0.4这两个系数把理想利用率大幅拉低。实际部署中,GPU不可能一直满载运行prefill和decode的完美比例,各种工程开销进一步侵蚀效率。

国内公司普遍采用类似参数进行内部测算。腾讯混元能把边际毛利率做到92%以上,很大程度得益于其云基础设施对这些成本的分摊能力。独立创业公司则需要自己承担全部硬件和电力开销,边际数字会相对低一些。

这个计算模型虽然是估算,但提供了清晰的拆解路径。它让从业者可以自己代入实际参数,判断不同规模下的成本结构。信号强调参数是拍的,但结论稳健,这意味着即使单卡价格或电价有一定浮动,边际成本低的总体判断依然成立。

腾讯混元边际毛利率92%-96%源于背靠腾讯云,但财报口径掉到17%-26%

大模型边际毛利率92%却掉到17%:腾讯混元与智谱的成本真相:腾讯混元边际毛利率92%-96%源于背靠腾讯云,但财报口径掉到17%-26%

腾讯混元是目前公开两种口径数据最完整的案例。HY3季度其边际毛利率达到92%,HY4进一步提升到96%。这个数字远高于梁文锋的82%,也高于多数独立大模型公司。

原因在于混元背靠腾讯云。云服务已有的机房、电力合同、运维体系让新增推理的边际成本被大幅压低。GPU折旧和电费这两大块被分摊到整个云业务中,单看混元模型时显得特别便宜。

但把所有相关成本计入后,情况完全不同。信号明确给出混元财报口径毛利率只有17%~26%。这个区间和智谱、MiniMax基本一致,说明云服务绑定能显著提升边际数字,却无法掩盖整体固定成本压力。

腾讯云本身有大量企业客户和基础设施投入。这些固定成本最终需要由包括混元在内的各种业务共同承担。当把这些成本分配到大模型业务时,毛利率立刻被拉低到和纯大模型公司差不多的水平。

这个落差说明商业模式的重要性。单纯依赖云资源优势可以在边际层面制造高毛利假象,但长期盈利仍取决于能否把整个公司的固定成本通过规模经济消化掉。腾讯有庞大用户基数和生态,这为其提供了比纯创业公司更好的摊薄条件。

对比之下,独立大模型公司既没有现成云基础设施,也没有海量现有客户。它们必须自己投入巨资建设算力池,同时承担全部研发和运营成本。这导致它们的边际毛利率起点就低于混元,全成本毛利率也同样承压。

混元的案例给行业提供了一个重要观察窗口。它证明即使在基础设施最优的情况下,全成本毛利率依然只有20%左右。这意味着大模型生意短期内很难实现高盈利,除非调用量实现数量级增长。

智谱与MiniMax财报口径毛利率落在17%-26%区间,与混元接近

智谱公开的28%毛利率是典型的财报口径。它把所有能归集的成本都扣除后得出。这个数字和腾讯混元全成本后的17%~26%处于同一数量级,说明国内主流大模型公司的真实盈利能力相差不大。

MiniMax的情况与智谱类似。信号指出其毛利率也落在17%~26%这个区间。三家公司虽然商业模式略有差异,但全成本毛利率高度趋同,反映出行业共同面临的成本结构问题。

这些数字远低于外界对AI公司的高毛利想象。28%或20%左右的毛利率在传统软件公司中不算高,尤其考虑到大模型仍处于高速迭代期,需要持续大量投入。

智谱选择公布全成本毛利率,可能意在展示更真实的财务状况,避免市场被边际数字误导。腾讯同时公布两套数据,则提供了更完整的对比维度。

这个区间也意味着大模型公司目前普遍处于微利或亏损边缘。毛利率20%出头,在扣除销售、管理等费用后,净利率很可能为负。很多公司仍在靠融资维持运营。

但17%~26%的毛利率并非完全没有希望。如果调用量持续增长,固定成本占比会逐步下降,毛利率有望缓慢回升。关键在于能否在烧钱窗口期内把用户和开发者生态建立起来。

智谱、MiniMax与混元的趋同也说明,单纯的模型技术优势在成本结构上影响有限。基础设施规模和商业化落地能力才是决定全成本毛利率更关键的因素。

大模型生意命门在于能否把固定成本摊薄到边际成本以下

大模型生意的核心命门在于固定成本能否被足够大的调用规模摊薄到接近边际成本的水平。信号通过边际与全成本的强烈对比,把这个问题清晰地摆在了中文开发者与从业者面前。

目前边际成本很低,但固定成本极高。训练一次前沿模型需要数千万到数亿美元投入,研发团队、数据标注、持续迭代都是长期烧钱项目。这些成本必须通过海量推理调用来回收。

如果调用量上不去,固定成本就无法摊薄,财报毛利率会长期维持在低位。反之,一旦调用量实现爆发式增长,毛利率会快速改善,因为新增调用几乎只产生边际成本。

对中文开发者而言,这意味着选择大模型时的成本敏感度需要区分场景。边际成本低的模型适合高频调用场景,能显著降低使用成本。但如果只是偶尔使用,全成本视角下的实际定价可能更高。

行业潜在风险也很明显。很多公司为了抢占市场份额,把价格定在接近边际成本的水平,希望通过规模效应后来居上。但如果规模始终起不来,就会陷入持续亏损的恶性循环。

腾讯混元凭借云生态有更好条件把固定成本摊薄。智谱和MiniMax则需要依靠自身产品创新和垂直场景落地来拉动调用量。谁能更快实现正向循环,谁就能在下一阶段占据优势。

这个命门也解释了为什么大模型公司如此重视用户数和API调用量。这些指标直接决定固定成本摊薄速度。开发者社区活跃度、生态工具成熟度、企业客户转化率,都在暗中影响最终毛利率。

目前来看,多数玩家仍在努力爬坡。17%~26%的财报毛利率是行业当前真实水平的写照。未来能否突破,取决于规模效应能否如预期般兑现。

目前仍无定论的是训练成本与多模态推理如何进一步侵蚀毛利率

信号没有给出训练成本的具体摊销方式,也没有详细讨论多模态模型对推理成本的影响。这些因素目前缺乏足够公开数据,对判断业务长期可持续性仍存在不确定性。

训练成本是一次性巨额投入,需要在模型生命周期内逐步摊销。如果模型迭代速度太快,前期训练成本还没收回就要投入下一代,毛利率就会持续承压。目前行业迭代节奏仍快,训练成本回收周期难以准确预估。

多模态推理带来的成本增加也值得关注。处理图像、视频、音频的推理计算量远高于纯文本。信号虽然只讨论了文本输出token的边际成本,但实际商业产品越来越多地涉及多模态,这会显著推高每一次真实调用的成本。

工程实现中的其他隐性成本同样缺乏透明数据。比如更复杂的调度系统、更高的运维人力投入、数据安全合规开销等。这些都会在财报口径中体现,但目前难以精确量化。

国内外主流大模型公司都在面对类似问题。OpenAI等海外巨头同样需要平衡训练投入与推理收入,只是它们有更大规模的用户基数来摊薄成本。

中文开发者需要意识到,目前公开讨论的毛利率数字仍不完整。训练成本和多模态因素可能进一步把实际毛利率拉低。判断一家公司前景时,不能只看单一季度边际或财报数字。

行业整体仍处于早期阶段。成本结构会随着技术进步和规模扩大而变化。目前能确定的是边际成本低、全成本毛利率低这个基本格局。未来如何演变,仍需持续跟踪调用量增长和成本优化进展。

训练与多模态的不确定性也提醒从业者,技术路线选择会直接影响经济性。纯文本模型成本相对可控,多模态通用模型则面临更高算力需求。不同路线对应不同的规模门槛和盈利路径。

总体来看,大模型生意还在寻找清晰的盈利公式。边际毛利率高带来希望,全成本毛利率低给出现实。最终胜负手在于谁能更快把固定成本有效摊薄,同时控制住训练和多模态带来的新增侵蚀。

参考来源