SemiAnalysis 7 月 29 日发布的报告称,英伟达正在向关键客户预览调整后的 Rubin Ultra。按其客户预览口径,主线 SKU 将采用 8-Hi HBM4,显存容量为 192GB,低于此前市场对 Rubin Ultra 更激进配置的期待。
这不是英伟达官方确认的最终产品规格。英伟达 7 月 21 日技术博客披露的 Rubin GPU 为双计算 die、采用 HBM4,最高 288GB、22TB/s 带宽和 50 PFLOPS NVFP4 性能,这能支撑「Rubin 是下一代关键产品」的基础判断,但 Rubin Ultra 的 192GB 主线版本仍应视为 SemiAnalysis 披露的客户预览口径。
对 AI 数据中心客户来说,显存、HBM 供给、单卡功耗和机柜部署难度,会直接影响训练和推理系统怎么建、建多快、成本多高。Rubin Ultra 若把主线显存压到 192GB,更像是英伟达在有限 HBM 和电力条件下,优先选择更容易大规模交付的版本,而不是把单颗 GPU 参数推到最满。
192GB 显存低于早期预期,主线版本先保可部署
此前 GTC 2025 以及多家券商、媒体材料中,Rubin Ultra 常被描述为更高显存、更高功耗、更复杂封装的一代产品,包括 HBM4E、1TB、NVL576 等更激进设想。
SemiAnalysis 此次给出的客户预览口径明显更保守:主线版本为 8-Hi HBM4、192GB 显存。这个变化应理解为相较此前市场预期和早期路线图的下调,而不是英伟达已经正式宣布某个规格后又撤回。
显存不是孤立参数。大模型训练和长上下文推理需要更多高速内存,显存越大,单颗 GPU 能承载的模型分片、缓存和数据越多。但 HBM 也是当前 AI 硬件里最紧、最贵的零部件之一。主线版本少用一些 HBM,可能帮助英伟达把有限供应分配给更多 GPU 和系统。
这也是「降规格」容易被误读的地方。现有信息并不支持把它直接写成 AI 需求放缓。更合理的解释是,在 HBM 和电力都紧张的环境里,主线产品需要在性能、成本、供货和部署之间取平衡。
算力叙事转向 NVL576,客户买的是整套系统
SemiAnalysis 称,Rubin Ultra 主线版本的峰值理论 FLOPs 大体维持,调整主要集中在显存容量、功耗和系统形态,而不是简单削弱计算能力。
这条路线的重点在 NVL576。简单说,英伟达仍在把更多 GPU 通过高速互联组成更大的统一计算域,让客户从单卡参数转向整机柜、整集群的系统能力。该报告提到,一个规划中的系统形态是 8 个 72-GPU 机柜互联,组成 NVL576 规模。
这对云厂商和大型 AI 实验室更现实。限制训练集群扩张的,不只是单颗 GPU 有多强,还包括机柜功耗、散热、电源、网络、HBM 供给、交付节奏和数据中心土建。单卡显存更高当然有价值,但如果带来更高功耗、更高 BOM 成本和更难部署的机柜,客户未必能用满。
Rubin Ultra 的主线变化,更像是保住计算性能和系统扩展,把显存和功耗控制在更容易量产、供货和部署的区间内。
1800W 成为主线口径,电力压住极限配置
功耗是这次路线变化的另一个关键数字。
SemiAnalysis 称,Rubin Ultra 主线版本芯片级功耗约 1800W,与此前 Rubin 1800W Max-Q 配置相近,低于此前市场讨论过的 2300W 版本。该报告还提到,英伟达可能仍会提供 2600W 至 2800W 的 Max-P 高功耗版本,并可能存在面向较低计算负载、例如 token decode 的 1200W SKU。
这些细节尚未得到英伟达官方确认,仍应按报告口径看待。但它们指向同一个现实问题:即便芯片本身能跑到更高功耗,客户的数据中心也未必能稳定承接。
单颗 GPU 功耗越高,机柜供电和散热要求越高。很多客户面对的问题不是「是否想买更强 GPU」,而是现有园区、电力接入和散热系统能不能支持。SemiAnalysis 此前公开文章也提到,Rubin 存在 2300W Max-P 与 1800W Max-Q 两类功耗配置,Max-Q 更强调每瓦性能,客户会因电力约束选择较低功耗运行。
在电力受限的环境下,1800W 版本反而可能更好放量。它牺牲一部分极限配置,但有助于降低供电和散热压力,也更接近客户可以较快部署的形态。
HBM 仍是瓶颈,降规格不是需求见顶
HBM 供应紧张,是显存降到 192GB 的另一条主线。
SemiAnalysis 的解释是,HBM 相对台积电前端制造产能更紧。英伟达通过降低单颗 GPU 的 HBM 用量,可以把有限供应分配给更多产品,并对冲未来 HBM 价格上涨带来的成本压力。该判断同样需要保留报告口径,但和当前 AI 硬件供应链的紧张状态一致。
这对产业链影响直接。若主线 GPU 单卡 HBM 容量低于此前市场预期,HBM 供应商的单位需求测算、云厂商采购模型和服务器 BOM 都会变化。但这并不等于 HBM 不紧。相反,正因为 HBM 供给紧,英伟达才有动力把主线方案调到更省 HBM、更容易放量的形态。
Rubin Ultra 也未必只剩一个版本。按 SemiAnalysis 口径,高功耗 Max-P 版本仍可能面向特定客户和极限场景,只是不一定成为最广泛部署的主线 SKU。
这次披露更像是 AI 算力扩张进入工程约束阶段后的产物。英伟达没有停止向更大系统规模推进,但下一代 GPU 能否顺利放量,越来越取决于 HBM 供应、机房电力和客户实际部署能力,而不只是单颗芯片参数。
