返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

大模型算力效率

广发证券计算机团队指出,DeepSeek-V3通过数据与算法层面的极致优化,将训练算力消耗降至同规模模型的五分之一,证明了“算力效率”的可挖掘空间。然而,其完整部署单元在预填充阶段需32块H800、解码阶段需320块H800,算力硬件仍是不可替代的基础资源。本报告分析算力效率突破与算力刚需并存的行业逻辑。

算力效率突破:278万GPU小时完成671B模型训练

DeepSeek-V3每训练万亿token仅需18万H800 GPU小时,预训练总耗时266.4万GPU小时,后训练仅5000小时。这一效率源于多层级协同:MoE稀疏激活使每token仅计算37B参数,FP8混合精度降低显存带宽压力,DualPipe通信重叠将GPU空闲时间压缩至最低。广发证券认为,DeepSeek-V3的成功表明,即便硬件资源有限,通过算法和数据的创新仍可实现顶尖模型效果,算力效率的优化空间远超此前预期。

但需注意,效率突破并未削弱算力的核心地位。预训练阶段的算力消耗绝对值仍然巨大——266万GPU小时意味着即使有2048卡集群也需要近4天,普通团队无法企及。此外,高质量训练数据(14.8T token)的筛选和处理同样依赖大规模计算资源。
表:DeepSeek-V3部署硬件需求
阶段所需GPU数量节点数(每节点8卡)并行策略
Prefilling(预填充)32块H8004节点多种并行+冗余专家
Decoding(解码)320块H80040节点每GPU单专家+64冗余专家

部署门槛依然高企:解码阶段需320块H800

尽管训练成本大幅降低,但DeepSeek-V3的推理部署对硬件要求仍然苛刻。在Prefilling阶段,最小部署单元需4个节点共32块H800,并额外增加冗余专家实现负载均衡;在Decoding阶段,最小部署单元需40个节点共320块H800,其中64块GPU承担冗余专家。这意味着,即使训练完成,实际商用部署仍需数百块高端GPU,硬件门槛并未消失。

推理驱动的新算力需求:实时性要求更严

广发证券强调,AI大模型的应用推理涉及大量实时数据快速处理与决策,对算力延迟和吞吐量的要求远高于训练。随着DeepSeek-V3这类高性价比模型普及,应用端爆发将产生海量推理请求,推理算力需求有望呈指数级增长。训练算力效率的提升并不改变推理侧算力总量需求持续上升的趋势。

算法优化降低入门成本,但长期算力军备竞赛仍将持续

DeepSeek-V3的技术路线为行业提供了低门槛训练范本,可能吸引更多参与者入局,但头部企业仍将持续投入更大规模算力以追求极致性能。算力效率提升只会改变“每单位性能所需算力”的斜率,而不会逆转“总算力需求向上”的方向。广发证券判断,算力基础设施的长期投资价值依然坚实,高效模型的出现将加速AI商业化,反过来进一步刺激算力需求。
点击阅读报告原文: 广发证券:计算机行业比较试用DeepSeek看模型走向应用的新迹象(37页)
相关报告