广发证券计算机团队指出,DeepSeek-V3通过数据与算法层面的极致优化,将训练算力消耗降至同规模模型的五分之一,证明了“算力效率”的可挖掘空间。然而,其完整部署单元在预填充阶段需32块H800、解码阶段需320块H800,算力硬件仍是不可替代的基础资源。本报告分析算力效率突破与算力刚需并存的行业逻辑。
算力效率突破:278万GPU小时完成671B模型训练
DeepSeek-V3每训练万亿token仅需18万H800 GPU小时,预训练总耗时266.4万GPU小时,后训练仅5000小时。这一效率源于多层级协同:MoE稀疏激活使每token仅计算37B参数,FP8混合精度降低显存带宽压力,DualPipe通信重叠将GPU空闲时间压缩至最低。广发证券认为,DeepSeek-V3的成功表明,即便硬件资源有限,通过算法和数据的创新仍可实现顶尖模型效果,算力效率的优化空间远超此前预期。
但需注意,效率突破并未削弱算力的核心地位。预训练阶段的算力消耗绝对值仍然巨大——266万GPU小时意味着即使有2048卡集群也需要近4天,普通团队无法企及。此外,高质量训练数据(14.8T token)的筛选和处理同样依赖大规模计算资源。
表:DeepSeek-V3部署硬件需求| 阶段 | 所需GPU数量 | 节点数(每节点8卡) | 并行策略 |
|---|
| Prefilling(预填充) | 32块H800 | 4节点 | 多种并行+冗余专家 |
| Decoding(解码) | 320块H800 | 40节点 | 每GPU单专家+64冗余专家 |
部署门槛依然高企:解码阶段需320块H800
尽管训练成本大幅降低,但DeepSeek-V3的推理部署对硬件要求仍然苛刻。在Prefilling阶段,最小部署单元需4个节点共32块H800,并额外增加冗余专家实现负载均衡;在Decoding阶段,最小部署单元需40个节点共320块H800,其中64块GPU承担冗余专家。这意味着,即使训练完成,实际商用部署仍需数百块高端GPU,硬件门槛并未消失。
推理驱动的新算力需求:实时性要求更严
广发证券强调,AI大模型的应用推理涉及大量实时数据快速处理与决策,对算力延迟和吞吐量的要求远高于训练。随着DeepSeek-V3这类高性价比模型普及,应用端爆发将产生海量推理请求,推理算力需求有望呈指数级增长。训练算力效率的提升并不改变推理侧算力总量需求持续上升的趋势。
算法优化降低入门成本,但长期算力军备竞赛仍将持续
DeepSeek-V3的技术路线为行业提供了低门槛训练范本,可能吸引更多参与者入局,但头部企业仍将持续投入更大规模算力以追求极致性能。算力效率提升只会改变“每单位性能所需算力”的斜率,而不会逆转“总算力需求向上”的方向。广发证券判断,算力基础设施的长期投资价值依然坚实,高效模型的出现将加速AI商业化,反过来进一步刺激算力需求。