华龙证券发布的《DeepSeek重塑AI产业格局,助力AI端侧落地》报告揭示了DeepSeek-V3在训练成本优化上的重大突破。DeepSeek-V3以仅266.4万H800 GPU小时的经济成本完成14.8万亿标记预训练,打造目前最强开源基础模型。FP8混合精度训练框架首次在超大规模模型上验证可行性,MoE架构配合无需辅助损失的负载均衡策略大幅提升训练效率,为AI大模型的成本优化提供了全新范式。
266万GPU小时——大模型训练成本的里程碑
DeepSeek-V3以仅266.4万H800 GPU小时的经济成本,完成了在14.8万亿标记上的预训练【2†L5-L6】。这一成本远低于行业同类模型的训练支出,标志着大模型训练成本进入可控时代。DeepSeek通过算法、框架和硬件的协同设计,克服了跨节点MoE训练中的通信瓶颈,实现了近乎完全的计算与通信重叠【2†L5-L6】。训练效率的显著提升直接降低了训练成本,使得更多企业和研究机构有能力参与大模型的研发与迭代。
FP8混合精度训练首次验证超大规模可行性
DeepSeek设计了一个FP8混合精度训练框架,并首次在超大规模模型上验证了FP8训练的可行性和有效性【2†L5-L6】。FP8精度相比传统的FP16和BF16进一步降低了计算和存储精度要求,在保证模型收敛效果的前提下大幅减少了显存占用和计算开销【2†L5-L6】。这一突破为未来更大规模模型的训练提供了新的技术路径,有望进一步降低大模型的训练门槛和成本。
MoE架构+负载均衡策略提升训练效率
DeepSeek-V3在DeepSeek-V2高效架构的基础上,率先采用了一种无需辅助损失的负载均衡策略,该策略将因鼓励负载均衡而导致的性能下降降至最低【2†L5-L6】。MoE(Mixture of Experts)架构通过仅激活部分参数(37B激活参数/671B总参数)来实现高效计算【1†L4-L5】。无需辅助损失的负载均衡策略有效降低了传统负载均衡方法带来的性能损耗,使得MoE架构的优势得以充分发挥。生成吐字速度从20TPS大幅提高至60TPS,相比V2.5模型实现了3倍的提升【1†L4-L5】。
表2:DeepSeek-V3训练成本与效率关键数据| 指标 | 数据 | 意义 |
|---|
| 总参数 | 671B | 超大规模模型 |
| 激活参数 | 37B | MoE架构高效计算 |
| 预训练Token | 14.8万亿 | 海量数据训练 |
| 训练成本 | 266.4万H800 GPU小时 | 行业最低水平 |
| 生成速度 | 60 TPS | 较V2.5提升3倍 |
| FP8训练 | 首次验证 | 超大规模可行性 |
多标记预测(MTP)与推理加速
DeepSeek-V3研究的多标记预测(Multi-Token Prediction, MTP)目标,证明其对模型性能有益,并可用于推理加速中的推测性解码【2†L5-L6】。MTP目标不仅提升了模型性能,还支持推理加速中的推测性解码【1†L4-L5】。这一技术突破意味着模型在推理阶段可以更高效地生成内容,进一步降低推理成本和时间延迟。在后训练阶段,DeepSeek通过知识蒸馏技术,将长链推理(CoT)模型的推理能力融入其中,显著提升了推理性能,同时保持了输出风格和长度的可控性【1†L4-L5】。
低成本训练对AI产业格局的深远影响
DeepSeek-V3的低成本训练模式将对全球AI产业格局产生深远影响。以266.4万H800 GPU小时的经济成本完成顶尖性能模型的训练,打破了"大模型必须依赖巨额算力投入"的固有认知【2†L5-L6】。这一突破将降低AI大模型的研发门槛,使得更多中小企业和研究机构能够参与大模型的研发与创新。同时,极低的训练成本也为AI技术的快速迭代和广泛应用提供了基础支撑,有望加速AI在各行业的落地与普及。DeepSeek-V3/R1的推出代表中国在全球AI领域的技术引领,极大地提振了全球AI产业的信心【1†L4-L5】。
Meta Description见标题下方。
导语见正文起始。