三家实验室集体压低Token价格,两百万GPU订单同步落地
本周三家实验室发布模型全部打价格牌:Anthropic 把缓存读取费用下调 75%,Z.ai 以 0.15 美元/百万输入 token 推出原生多模态 320B 模型,阿里巴巴则展示每 token 计算六亿参数的新架构。与此同时 AWS 和 NVIDIA 却同时锁定两百万张 GPU 新订单。
三家模型输入价格集体跳水,token 成本进入新低区间
Anthropic 将缓存读取费用直接砍掉 75%,这意味着开发者在需要反复读取上下文时,实际支出大幅降低。Z.ai 直接把原生多模态 320B 模型的输入价格定在 0.15 美元每百万 token,这个数字把此前多数主流模型的定价区间拉到更低。阿里巴巴则没有直接报输入价格,而是推出每 token 计算六亿参数的新架构,相当于用更多计算量换取更好的单 token 效果。
这些动作让应用侧的推理成本出现明显变化。以前一个中等规模的多模态应用每月 token 费用可能占总成本的 30%-40%,现在缓存降 75% 后,重复查询场景的支出能减少大半。0.15 美元每百万输入 token 的定价,让原本只敢小范围测试的企业开始考虑把图像、文本混合的交互功能推到生产环境。阿里巴巴每 token 六亿参数的做法虽然没有直接报价格,但它暗示在同等算力下能获得更高智能密度,间接压低了单位智能的获取成本。
对开发者来说,这意味着以前因为 token 贵而放弃的长上下文、多轮对话或多模态分析项目,现在经济上变得可行。中文开发者尤其受益,因为很多企业内部文档、客服记录、产品图片都是混合模态,低价 token 直接降低了把这些数据喂给模型的门槛。成本曲线向下移动的速度比以往任何时候都快,过去需要数月才能摊平的 ROI,现在可能几周就看到正回报。
信号显示,三家实验室同时把价格或效率作为首要卖点,说明行业已经进入用价格争夺开发者注意力的阶段。谁能把 token 成本压得更低,谁就更容易把模型嵌入到现有业务流程里。这轮集体跳水把 token 定价带入新的低位区间,后续其他厂商大概率需要跟进,否则市场份额会被快速蚕食。
AWS 与 NVIDIA 同时下两百万 GPU 订单,算力军备竞赛再升级
就在模型价格向下狂奔的同时,基础设施侧的投入却在反向加速。AWS 和 NVIDIA 共同承诺新增两百万张 GPU 的订单,这个规模相当于把全球可用训练和推理算力一次性拉高一个数量级。订单细节没有公开交付时间表,但体量本身已经说明资本对 AI 长期需求的判断。
模型降价与巨额 GPU 订单之间存在明显张力。一方面,更低的 token 价格会刺激需求爆发,需要更多算力来满足新增推理负载;另一方面,只有把硬件成本通过规模效应摊薄,才能支撑持续降价。两百万张 GPU 的订单正是这种逻辑的体现:先把算力池做大,再用规模优势把单位成本压下去,最终把便宜 token 变成可持续的商业模式。
对中国市场而言,这轮军备竞赛的压力尤为直接。国内芯片供应链仍面临限制,自有算力增长速度难以完全匹配全球顶级厂商的扩张节奏。两百万 GPU 订单落地后,海外头部云服务商的推理能力会进一步领先,国内开发者如果依赖海外 API,低价 token 的好处能拿到,但数据主权和延迟问题依然存在。这也逼着国内云厂商必须加快自有卡的部署,否则在成本和性能上都会被拉开差距。
订单本身也反映出 NVIDIA 在当前生态里的主导地位。AWS 选择和 NVIDIA 深度绑定,等于把未来几年相当大一部分增量算力押在同一套技术栈上。这种集中投入会让 CUDA 生态的护城河更深,同时也让其他硬件厂商的竞争压力倍增。
阿里巴巴每 token 六亿参数架构,试图在算力受限下提升效率
阿里巴巴展示的新架构核心指标是每 token 计算六亿参数。这不是简单地把模型做大,而是把计算密度集中在每个 token 的处理过程中。在算力相对受限的环境里,这种做法能让有限的芯片发挥出更高效能。
对中国开发者来说,这项技术特点有很强的针对性。国内很多企业无法像海外巨头那样无限制调用最新 GPU,单卡算力、天数、功耗都受现实约束。每 token 六亿参数意味着在同样一块卡上,能获得比传统稀疏激活模型更高的智能输出。中文场景下,长文本、复杂指令、行业知识密集的任务能从中获益,因为模型在每个 token 上投入了更多计算,理解深度和生成质量有望提升。
落地效率的变化主要体现在两点。一是同样预算下能支撑更大规模的内部应用部署,中小企业无需等待更便宜的海外 API 就能尝试高级功能。二是训练-推理联合优化变得更重要,开发者需要重新调整 prompt 和上下文管理策略,以充分利用高参数密度带来的优势。
阿里巴巴此举也显示,国内实验室正在探索一条不完全依赖硬件堆叠的路线。通过架构创新把算力利用率提上去,在芯片供给不充分的情况下保持竞争力。这条路线对整个中文 AI 生态的意义在于,它降低了算力门槛,让更多团队有机会参与到前沿模型的微调和应用开发中。
AMD v10 软件栈围绕代理构建,竞争焦点从硬件转向 agent 生态
AMD 发布了 v10 版本软件栈,核心方向是围绕 AI 代理(agent)构建。这标志着竞争焦点正在从单纯的硬件性能转向软件层面的生态能力。
v10 栈的具体更新集中在代理开发工具链、运行时调度和多代理协作框架上。开发者可以更方便地定义代理的目标、工具调用流程和记忆管理,而无需从零搭建底层基础设施。这与 NVIDIA 当前以 CUDA 和大规模并行训练为核心的打法形成差异:NVIDIA 更强调算力本身,AMD 则试图在软件层面把代理类应用开发门槛降低。
对 agent 类应用的影响是显著的。以前搭建一个能自主调用工具、长期记忆、多轮规划的代理系统,需要大量定制代码。现在 v10 栈提供标准组件,开发周期有望缩短 30%-50%。这对国内团队尤其重要,因为很多企业希望把 AI 代理用于内部流程自动化、客户支持或数据分析,但缺乏足够的人才搭建复杂系统。
AMD 的策略也反映出行业趋势:硬件差异化越来越难,软件和生态成为新的护城河。谁能让开发者更快地构建出有实际商业价值的 agent,谁就能在下一阶段的竞争中占据优势。v10 栈的推出,意味着 AMD 不再满足于做“第二选择”,而是试图在 agent 这个高增长领域建立差异化优势。
MCP 护栏路线图同步收紧,安全合规成本或成国内新门槛
MCP 发布了新的路线图,重点是进一步收紧安全护栏。这与模型价格下降形成鲜明对比:应用成本在降低,合规成本却在上升。
路线图的具体信号包括更严格的内容过滤机制、实时审核流程强化、以及对高风险提示的主动阻断。这些措施旨在减少模型被滥用的可能性,但也直接增加了部署方的技术投入和运营成本。
对中国 AI 产品而言,合规挑战被进一步放大。国内已经有一套严格的内容审核和数据安全要求,MCP 路线图的收紧意味着海外模型如果想进入中国市场,需要额外开发适配层来满足双重标准。企业自建模型时,也必须把更多预算分配给安全模块,这会让原本因 token 便宜而降低的总体拥有成本再次抬高。
潜在影响是双重的。一方面,更强的护栏有助于提升公众对 AI 产品的信任,为大规模落地扫清政策障碍;另一方面,中小企业可能难以承担新增的合规开发和持续监控成本,导致市场进一步向有资源的大厂集中。审核流程的复杂化也会延长产品上线周期,影响迭代速度。
低成本 token 加速国内应用落地,但竞争格局可能向头部集中
低价 token 对中文场景的实际影响已经开始显现。0.15 美元每百万输入 token 的定价,让教育、医疗、法律、客服等需要大量文本处理的行业看到了快速上线的可能。企业不再需要为每一次实验性调用支付高额费用,可以放心地把模型嵌入到核心业务系统中。
但中国算力现实决定了受益者不会均匀分布。头部大厂拥有自有算力池和大规模数据,能快速把低成本 token 转化为定制化模型和闭环产品。中小企业虽然能以低价使用云 API,却难以建立自己的数据飞轮和专有知识库,在长期竞争中容易被甩开。
竞争格局的变化趋势是头部集中。低 token 成本降低了进入门槛,却提高了维持领先所需的资源门槛。谁能把便宜的推理能力和自有高质量数据结合,谁就能构建难以复制的护城河。国内开发者需要认清这一点:token 便宜是机会,但要把机会变成壁垒,仍需在数据、场景和工程能力上持续投入。
两百万 GPU 订单与安全护栏的长期效果,目前仍无定论
两百万 GPU 订单的实际交付时间表尚未明确,安全措施的具体落地细节也仍在制定中。这两个变量将共同决定行业下一阶段的走向。
订单如果能在 12-18 个月内逐步落地,全球算力供给会显著增加,token 价格有望继续下探。但如果交付延迟,短期内供需矛盾仍会存在,价格优势可能无法完全兑现。安全护栏的落地同样存在不确定性:路线图给出了方向,但技术实现和性能损耗之间的平衡仍需时间验证。
对中国竞争格局的最终影响目前还看不清。低成本 token 可能加速应用创新,也可能因为合规成本上升而让中小企业退出竞争。巨额 GPU 订单会强化海外领先优势,还是会倒逼国内加快自主算力建设,目前都没有确定答案。
行业目前处于价格、算力、安全三股力量同时作用的阶段。短期内开发者能享受到更低的调用成本,中长期则需要密切跟踪订单交付进度和护栏实际效果,才能做出正确的战略选择。
参考来源
- 原文作者:知识铺
- 原文链接:https://index.zshipu.com/ai002/post/20260902/%E4%B8%89%E5%AE%B6%E5%AE%9E%E9%AA%8C%E5%AE%A4%E9%9B%86%E4%BD%93%E5%8E%8B%E4%BD%8EToken%E4%BB%B7%E6%A0%BC%E4%B8%A4%E7%99%BE%E4%B8%87GPU%E8%AE%A2%E5%8D%95%E5%90%8C%E6%AD%A5%E8%90%BD%E5%9C%B0/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。
- 免责声明:本页面内容均来源于站内编辑发布,部分信息来源互联网,并不意味着本站赞同其观点或者证实其内容的真实性,如涉及版权等问题,请立即联系客服进行更改或删除,保证您的合法权益。转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。也可以邮件至 sblig@126.com