东吴证券在报告中指出,虽然业内对大模型发展方向仍处于讨论中,但头部大模型厂商的万卡集群建设未曾停歇。xAI 2024年建成10万张H100集群,计划扩展至100万张;Meta 2024年底目标35万张H100;AWS正部署40万张Trainium。北美四大云厂商24Q4 CapEx合计增速约70%。东吴证券认为,GPT-5将引发新一轮AI热潮,万卡集群规模从十万卡向百万卡演进,算力基础设施产业链持续受益。
头部厂商万卡集群建设规模持续扩大
2023-2024年,各厂商陆续建成5万卡以下集群。Meta于2024年3月宣布两个24k GPU集群(共49152张H100),2024年底目标大幅增长至35万张H100。xAI 2024年建成10万张H100集群(当前市场最大单集群),2025年目标扩展至100万张。
AWS 2023年部署2万张H100,正部署40万张Trainium自研芯片集群。Google 2023年部署2.6万张H100及0.9万张TPU v5p。Microsoft 2020年建成1万张集群。头部厂商算力基础设施投入呈现指数级增长态势,从万卡向十万卡、百万卡规模演进。
北美四大云厂商CapEx增速回升,释放积极信号
23Q2以来四大云厂商CapEx增速持续上行,24Q2-Q3出现增速持平或放缓引发市场担忧。但24Q4合计增速进一步提升至约70%,释放积极信号。英伟达表示,云服务厂商(CSP)占数据中心业务近一半营收,其CapEx投入直接影响GPU出货量。
Google 24Q4 CapEx约143亿美元,AWS约263亿美元,Meta约148亿美元,Microsoft约226亿美元。四大云厂商合计季度CapEx首次突破700亿美元,显示AI基础设施投入仍在加速,市场对算力需求的担忧得到缓解。
OpenAI的标杆效应——引发国内AI新一轮竞赛
聚焦国内市场,从GPT-4能力的大模型发布时间表来看,普遍比GPT-4晚约一年的时间。腾讯混元、DeepSeek、Qwen、GLM等国产大模型参数量从千亿到万亿级不等,但训练算力集群规模与海外头部厂商仍有差距。
GPT-5若引发新一轮AI热潮,更多大集群的建设会提上日程。DeepSeek-V3训练成本约557万美元(在2048个H800集群上完成),其成功证明高效训练路径的可能性,但同时也验证了算力基础设施是AI竞赛的基础门槛。预计GPT-5发布后,国内大模型厂商将加速万卡集群布局。
万卡集群建设的产业链投资机会
万卡集群建设直接拉动AI服务器、高速PCB、光模块、交换机芯片、散热等产业链需求。GPT-5训练需要35万张H100级集群,意味着千亿级算力基础设施投资。
产业链相关公司:工业富联(AI服务器整机)、沪电股份(高多层PCB)、胜宏科技(HDI板)、寒武纪(AI训练芯片)、海光信息(DCU)、盛科通信(交换机芯片)等。万卡集群规模从10万卡向100万卡演进,算力基础设施建设周期持续3-5年,产业链相关公司有望持续受益。
表:主流科技公司公开宣布的万卡集群情况| 厂商 | GPU类型 | GPU数量(万张) | 时间 |
|---|
| Microsoft | — | 1.0 | 2020年 |
| Google | H100 | 2.6 | 2023年5月 |
| Google | TPU v5p | 0.9 | 2023年5月 |
| Meta | A100 | 1.6 | 2022年 |
| Meta | H100 | 2.5 | 2024年初 |
| Meta | H100 | 35.0 | 2024年底目标 |
| AWS | H100 | 2.0 | 2023年7月 |
| AWS | Trainium | 40.0 | 部署中 |
| xAI | H100 | 10.0 | 2024年 |
| xAI | — | 100.0 | 计划 |