英伟达重启Rubin CPX项目:设计大改后算力接近标准GPU
英伟达已重启Rubin CPX人工智能推理预填充加速GPU项目。 分析师郭明錤最新产业调查显示,新设计大幅调整后算力接近标准Rubin GPU,预填充性能进一步提升,单体最高功耗2300W,配备168GB HBM4内存,旧版为128GB GDDR7,预计2027Q1开始生产。
英伟达重启Rubin CPX但设计大幅调整
郭明錤在9月1日发布的产业调查中明确指出,英伟达决定重启此前一度暂停的Rubin CPX项目。该项目专为人工智能推理中的预填充阶段优化,目标是加速大模型处理提示词的初始计算环节。
调查显示,新版Rubin CPX在芯片架构上进行了大幅调整。调整内容涉及计算单元布局、内存接口和数据通路等多方面,目的是让它更贴合实际推理工作负载。旧版设计曾采用GDDR7内存方案,而新版彻底转向HBM4,这本身就是一次重大转向。
这一重启发生在中美AI芯片竞争持续加剧的背景下。国内大模型企业在部署千亿参数模型时,经常遇到预填充阶段耗时过长的问题,导致整体推理吞吐量受限。Rubin CPX如果能按计划落地,将为云服务商提供更针对性的硬件选择。
目前公开信息仅限于郭明錤的调查结果,具体调整细节尚未披露。英伟达官方也没有就此项目发表任何声明。重启后的设计是否完全放弃了早期版本的某些特性,目前还不清楚。
这一调整反映出英伟达在推理芯片路线上的迭代思路:不再追求单一通用方案,而是针对预填充和解码两个阶段分别优化。Rubin CPX的回归,意味着英伟达认为专用加速芯片仍有市场空间。
新Rubin CPX算力接近标准Rubin GPU
新版Rubin CPX在芯片级别的整体算力上被调整到接近标准Rubin GPU的水平。这意味着它不再是单纯的窄域加速器,而是具备了较强的通用计算能力。
标准Rubin GPU是英伟达下一代主力架构,采用更先进的制程和架构创新。新CPX能达到接近它的算力,说明英伟达在重启项目时提高了对它的性能预期,不再满足于只做辅助芯片。
这种定位变化对国内AI开发者有直接意义。很多大模型团队在训练完成后发现,推理阶段的预填充瓶颈严重制约了服务并发能力。如果CPX能提供接近主流GPU的算力,同时在预填充上更高效,将降低企业对硬件的选型难度。
算力接近并不等于完全相同。新CPX依然保留了针对预填充的专用优化路径,这部分性能增益不会体现在标准GPU的常规基准测试中。实际部署中,它可能在特定推理场景下展现出比标准Rubin GPU更高的有效吞吐。
郭明錤的调查没有给出精确的TFLOPS对比数字,仅用“接近”一词描述。目前无法判断新CPX是否在FP8或INT8等推理常用精度下实现了对标。
168GB HBM4内存取代旧版GDDR7
内存配置是新Rubin CPX最显著的变化之一。从旧版的128GB GDDR7升级为168GB HBM4,这一调整直接指向更高的带宽和容量需求。
168GB的容量很可能来自7×24GB的HBM4堆叠设计。这种配置在当前公开的GPU产品中较为罕见,显示英伟达希望通过更大内存来应对超长上下文或多模态大模型的预填充需求。
HBM4相比GDDR7在带宽上具有明显优势。对于预填充阶段需要快速加载权重和KV Cache的场景,高带宽内存能显著减少数据搬运时间。国内企业在落地长上下文模型时,经常因为内存带宽不足导致预填充延迟居高不下,新CPX的这一变化正是瞄准了这个痛点。
容量从128GB增加到168GB,也为单卡处理更大batch size提供了硬件基础。这对云服务提供商提升推理服务密度有直接帮助。
不过HBM4目前仍处于早期量产阶段,其成本和供应稳定性都存在不确定性。英伟达选择在这个时间点切换到HBM4,显示出对未来内存技术路线的判断。
预填充性能进一步提升针对推理流程
预填充阶段是大模型推理中计算量集中但并行度高的部分。新Rubin CPX明确将性能提升重点放在这一环节,目标是缩短从接收提示到生成第一个token的时间。
在实际应用中,预填充时间过长会直接影响用户体验,尤其在对话、搜索和代码生成等实时性要求高的场景。国内多家大模型平台都把降低预填充延迟列为优化重点,但受限于现有硬件架构,效果有限。
新CPX的“预填充性能进一步提升”意味着它在架构上可能增加了更多并行计算单元或优化了数据流。结合算力接近标准Rubin GPU的描述,这种提升很可能来自专用指令集和内存子系统的协同优化。
对于企业用户来说,这意味着在相同硬件投入下能支撑更多并发请求。推理成本中的很大一部分来自等待时间,如果预填充能加快,整体服务成本有望下降。
目前尚无具体倍数或百分比的性能数据。郭明錤的调查仅指出“进一步提升”,没有给出与上一代或竞品对比的量化指标。
2300W功耗与标准Rubin保持一致
新Rubin CPX的单体最高功耗被设定为2300W,与标准Rubin GPU完全一致。这一设计选择显示英伟达希望两者能在同一数据中心基础设施上部署。
2300W是一个极高的功耗水平,远超当前主流GPU。维持这一功耗上限意味着新CPX在提升预填充性能的同时,没有进一步增加散热和供电压力。这对已经为下一代GPU准备液冷方案的超算中心来说,是一个相对友好的决定。
功耗一致也暗示了架构上的协同性。标准Rubin GPU和CPX可能共享部分电源交付和热设计规范,便于混合部署。
在中美芯片博弈背景下,高功耗芯片的落地面临电力供应和能耗指标的双重约束。国内数据中心在规划AI集群时,需要平衡性能与能耗配额。新CPX的功耗设定与主流产品对齐,降低了部署门槛。
不过2300W也意味着单卡成本中电力和冷却部分占比会显著增加。企业需要评估总拥有成本,而非仅看算力。
2027Q1投产定下Rubin路线时间表
郭明錤的调查给出了明确的时间表:新Rubin CPX预计在2027年第一季度开始生产。这一节点将Rubin系列的整体路线图进一步明确。
2027Q1投产意味着相关数据中心基础设施需要在2026年完成准备工作。对于计划在2027-2028年大规模部署下一代AI集群的云厂商来说,现在就要开始评估电源、冷却和机柜兼容性。
这一时间表也给国内AI企业提供了参考。当前很多团队还在Blackwell和Hopper架构上做适配,Rubin的到来将带来新一轮硬件切换周期。预填充优化芯片的加入,有望缓解大模型落地中的效率瓶颈。
投产时间确定后,英伟达的Rubin路线图变得更加清晰:标准GPU负责通用计算,CPX负责推理关键路径加速。这种分工策略可能成为未来几代产品的基础。
目前还不清楚新CPX是否会与标准Rubin GPU同步发布,还是作为后续补充产品推出。郭明錤的调查仅提及生产时间,未涉及具体上市窗口。
整体来看,Rubin CPX项目的重启和调整,体现了英伟达对推理市场需求的持续投入。在国内大模型从实验室走向实际服务的阶段,针对性硬件优化可能成为降低成本、提升体验的关键变量。
参考来源
- 原文作者:知识铺
- 原文链接:https://index.zshipu.com/ai002/post/20260901/%E8%8B%B1%E4%BC%9F%E8%BE%BE%E9%87%8D%E5%90%AFRubin-CPX%E9%A1%B9%E7%9B%AE%E8%AE%BE%E8%AE%A1%E5%A4%A7%E6%94%B9%E5%90%8E%E7%AE%97%E5%8A%9B%E6%8E%A5%E8%BF%91%E6%A0%87%E5%87%86GPU/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。
- 免责声明:本页面内容均来源于站内编辑发布,部分信息来源互联网,并不意味着本站赞同其观点或者证实其内容的真实性,如涉及版权等问题,请立即联系客服进行更改或删除,保证您的合法权益。转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。也可以邮件至 sblig@126.com