兴业证券2024年8月发布的《AI深度洞察系列报告(三)》指出,Scaling Laws法则驱动AI算力集群规模快速增长,集群组网已从千卡迈向10万卡阶段。Scaleout(集群规模扩展)推动节点间互联带宽快速提升,交换机端口数提升带来互联规模的指数级增长。本文基于报告核心数据,深度解析AI集群组网规模趋势与产业链影响。
Scaling Laws驱动AI集群从千卡迈向10万卡
Scaling Laws法则指出:增加模型参数量、数据集和计算量即可获得更优模型性能。模型参数量、数据集和计算量之间存在幂律关系,随着模型规模增加,模型出现涌现特质(未预期的新能力)。OpenAI 2020年首次提出该法则,成为AI大模型训练的重要指导。实际技术落地中,AI网络互联规模从早期千卡体量持续扩大,目前行业正部署10万卡集群,马斯克旗下xAI正在部署基于英伟达H100的10万卡AI大集群,刷新当前AI集群规模纪录。
表1:AI集群规模演进与互联规模| 阶段 | GPU数量 | 代表案例 |
|---|
| 早期 | 千卡级 | 早期AI训练集群 |
| 当前 | 万卡级 | 字节MegaScale 12,288 GPU |
| 当前 | 3.2万卡级 | Meta第三代AI集群 |
| 部署中 | 10万卡级 | xAI H100集群 |
Scaleout核心逻辑:做大AI集群整体规模,提升节点间互联带宽
Scaleout是指在整个网络整体规模上追求更大承载力。AI集群规模扩大驱动节点之间互联要求提升。集群组网已正式步入10万卡阶段,集群规模提升带来的带宽提升将推动交换机迭代、光模块升级,缩短产品周期并巩固行业竞争格局。在拓扑结构上,AI集群普遍采用Fat tree网络结构。根据Fat tree拓扑,若交换机端口数为K,两层网络可互联K²/2张算力卡,三层网络可互联K³/4张卡。当交换机端口数从64提升至128,三层互联规模从约8万卡升至约52万卡。
以太网AI组网加速落地,博通+英伟达双轮驱动
早期AI集群多采用IB协议,在以太网技术推动下,基于以太网的AI集群方案进入加速落地阶段。亚马逊、甲骨文、Meta、字节跳动等云厂商均采用以太网组网且已落地超1万张卡。博通Tomahawk5(51.2T)已发布,下一代102.4T预计2025年发布,博通上修AI收入指引至110亿美元以上。英伟达2024年首次拆分网络收入(Q1 31.7亿美元),Spectrum-X以太网交换机一年一代迭代(2025年51.2T/800G,2026年102.4T/1.6T),互联GPU规模有望升至百万颗。
字节MegaScale与Meta验证以太网大规模组网可行性
字节跳动联合清华大学MegaScale在12288个GPU上训练175B LLM模型,实现55.2%的MFU,相比Megatron-LM性能提升1.34倍。采用博通Tomahawk4芯片(25.6T,64×400G端口)构建三层无收敛CLOS架构。Meta建成基于以太网的2.4万GPU集群,第三代升至3.2万张卡(8个cluster,每个cluster内252个rack,每rack16张H100)。cluster内部完全无收敛互联,之间采用7:1收敛比优化带宽成本,验证以太网大规模组网可行性。