广发证券AI硬件报告指出,NVIDIA Blackwell架构的GB200 NVL72机架系统正重新定义AI基础设施的TCO(总拥有成本)模型。根据NVIDIA白皮书,与同规模H100相比,GB200 NVL72的成本和能耗最多可降低25倍。推理性能方面,GB200 NVL72相比HGX H100系列提升显著。TCO优势预计将带来两个核心结果:采用GB200的CSP算力租赁ROI改善,以及推理成本降低为AI应用大规模落地奠定基础。
2026 GB200 NVL72系统架构与TCO优势量化
GB200 NVL72是NVIDIA面向AI训练和推理的新一代机架级解决方案。核心优势来自三方面:Blackwell GPU的FP4/FP8算力提升、液冷散热带来的计算密度倍增、以及NVLink域架构实现的高带宽低延迟GPU通信。根据NVIDIA白皮书,与同规模H100相比,GB200 NVL72的成本和能耗最多可降低25倍。具体对比:训练一个1.8万亿参数的模型,8000个Hopper GPU需要15MW电力;而20000个Blackwell GPU(约278个GB200 NVL72机架)仅需4MW,约为原有功耗的1/4。液冷方案增加计算密度、减少数据中心占地面积,降低碳足迹和能源消耗。GB200 NVL72的TCO优势是架构级别的革新,而非单一芯片的性能提升。
推理性能对比:GB200 NVL72 vs DGX H100
GB200 NVL72在推理场景的性能优势同样显著。广发证券基于NVIDIA官方数据构建了推理性能测算框架。在相同推理任务下(ISL/OSL=32786/1024),NVL72系统(36颗B200 GPU in NVL72)Prefill环节计算耗时仅5980ms,而DGX H100服务器集群为11960ms,计算时间缩短约50%。每Token计算占用算力资源从DGX H100的2.9(卡·ms/token)降至NVL72的1.1,效率提升约2.6倍。结合FP4精度的算力优势,GB200 NVL72在推理场景的吞吐量优势更为明显。推理性能的提升直接转化为更低的单Token成本和更高的服务吞吐量,对于AI应用规模化部署至关重要。
GB200对2025年CSP ROI与推理成本的结构性影响
GB200 NVL72上量预计对2025年AI基础设施市场产生两个结构性影响。第一,采用GB200系统进行模型推理或算力租赁的ROI预计更好——更低单位成本、更高性能密度使CSP的AI基础设施投资回报率提升,进一步强化“投1块、4年营收5块”的ROI逻辑。第二,可进一步带来算力租赁价格(单P价格/时)降低,从而降低AI推理成本。成本降低将催化推理应用从“昂贵试点”向“规模化部署”转变,形成“成本↓→应用↑→推理需求↑→基础设施投入↑”的正向循环。这与英伟达推动AI从训练向推理转型的战略方向一致。
CSP的GB200采用节奏与产业链影响
GB200 NVL72的产能释放节奏将是2025年AI硬件产业链的核心变量。微软、谷歌、亚马逊、甲骨文等CSP均对Blackwell架构表达强烈兴趣——微软FY25Q1融资租赁支出达50.8亿美元(占比25.4%),为GB200部署做资金准备。Oracle签署了30份价值超125亿美元的AI合同(含OpenAI在Oracle Cloud中训练ChatGPT)。GB200的高价值量意味着单台机架价格远高于H100系统,对PCB、连接器、液冷、电源等零组件的规格和价值量均提出更高要求。拥有Blackwell产品布局的产业链公司——包括PCB(胜宏科技、沪电股份)、组装(华勤技术)、芯片(澜起科技、兆易创新)等——有望受益于GB200放量带来的量价齐升。
表:GB200 NVL72 vs DGX H100推理性能对比| 核心指标 | GB200 NVL72 | DGX H100集群 | 变化 |
|---|
| FP8算力(petaFLOPS) | 324 | 253 | +28% |
| FP4算力(petaFLOPS) | 648 | - | — |
| Prefill计算耗时(ms) | 5,980 | 11,960 | -50% |
| 每Token算力占用(卡·ms/token) | 1.1 | 2.9 | -62% |
| 训练1.8T模型功耗 | 4MW | 15MW | -73% |
| 成本能耗降低 | 最多降低25倍 | — |