AI大模型训练与推理的计算范式正在重塑数据中心网络架构。东吴证券报告指出,Scale Out网络实现集群内(如万卡集群)所有GPU互联,连接规模大;Scale Up网络实现超节点内(如NVL72)所有GPU互联,单卡带宽高。以NVL72计,Scale Up单卡带宽7200Gb/s是Scale Out(800Gb/s)的9倍。并行计算中,张量并行传输数据量(85GB)是数据并行(741MB)的115倍,催生了高带宽Scale Up需求。AEC作为铜连接方案,在10m以内的Scale Up互联中兼具成本和性能优势。
并行计算范式变革催生Scale Up网络需求
张量并行传输数据量达85GB,为数据并行的115倍
AI训推需要分布式并行计算,主要包含数据并行、流水线并行和张量并行三类。GPT-3B模型基于32个GPU训练数据显示:张量并行(TP)需传输约85GB数据、680条125MB消息;流水线并行(PP)约1GB/16条;数据并行(DP)仅741MB/17条。张量并行传输数据量远高于其他并行方式,且矩阵运算后需要高频低时延同步,催生了高带宽Scale Up网络需求。
模型内存墙+算力内存墙逐代放大,显存池化需Scale Up
单一大模型参数量与单卡显存的差距(模型内存墙)、单卡算力与单卡显存的差距(算力内存墙)均逐代放大。推理计算生成的KVCache占用显存可达模型的50%甚至以上。单卡运算时需从多张卡显存读取参数和数据,目前产业化应用最优解是使用Scale Up网络将显存池化,如NVL72方案。
Scale Up与Scale Out核心差异:带宽vs规模
Scale Out网络最大GPU数可达746496张,单卡带宽800Gb/s,实现集群内大规模互联;Scale Up网络最大GPU数72张,单卡带宽7200Gb/s,为Scale Out的9倍,实现超节点内高带宽互联。Scale Up源于AI训推的新兴需求,不构成对Scale Out光互联的侵蚀,而是增量市场。AEC在10m以内柜间/柜内Scale Up互联中,相比光连接在成本、功耗、稳定性上更具优势。
表2:Scale Out与Scale Up网络对比(NVL72+CX-8网卡+三层Quantum-X800 IB网络)| 网络类型 | 最大GPU数(张) | 单卡带宽(Gb/s) |
|---|
| Scale Out | 746,496 | 800 |
| Scale Up | 72 | 7,200 |