中原证券报告对DeepSeek的技术突破进行了深度解读。DeepSeek-V3通过MLA和MoE架构减少算力消耗,在训练架构上展现强大的软硬协同优化能力——FP8混合精度训练框架、DualPipe算法、跨节点All-to-All通信内核等系列创新。在带宽和显存落后的H800上,DeepSeek实现了较英伟达H200 151%的推理性能超越。训练成本仅为GPT-4o的二十分之一,DeepSeek开创了大模型发展的新范式。
MLA+MoE架构创新,算力消耗大幅降低
DeepSeek-V3模型架构中减少算力消耗的两个关键点均来自架构层面的创新。
多头潜注意力机制首次在V2中引入,通过对传统多头注意力机制的改进,将低秩近似方法引入键值缓存压缩,大概贡献了2-4倍的计算效率提升。传统多头注意力的KVCache较大,DeepSeek通过压缩技术显著降低了显存占用和计算开销。
DeepSeekMoE架构对传统MoE架构进行改进,贡献了4倍以上的计算效率提升。V3总参数6710亿,但每个Token仅激活370亿参数。相比传统MoE,DeepSeek使用专家数量大幅提升,并通过无辅助损失的负载平衡策略提高训练稳定性,实现更高的训练效率。V3训练基于自研HAI-LLM框架,在模型架构之外展现出软硬协同优化能力,成为超越其他大模型团队的关键。
FP8混合精度训练,首个成功案例
FP8虽然可以提升计算速度和降低存储需求,但由于计算精度不高容易损失数据信息。DeepSeek结合自身在GPU硬件架构和训练误差方面的强大整合分析能力,专门设计出针对FP8的训练框架体系。
DeepSeek将大多数计算密集型操作在FP8中进行,而一些关键操作保持原有数据格式,兼顾了训练效率和稳定性。DeepSeek成为首个成功使用FP8混合精度训练超大规模大模型的公司。FP8训练框架的突破意味着在同等硬件条件下可以实现更高的训练效率,对于受GPU供应限制的国内AI产业具有特殊意义。
DualPipe算法与通信优化,隐藏通信开销
DualPipe算法实现高效的流水线并行,通过计算和通信的重叠,隐藏了大模型训练中的大部分通信开销。该算法规避了单个服务器中8个GPU共享一个IB NIC流水线并行期间出现的网络带宽竞争。在代表8个GPU的流水线并行中,不同任务的穿插计算使"气泡时间"得到极大压缩。
跨节点All-to-All通信内核使用PTX编程,充分利用节点间InfiniBand和NVLink带宽。对显存分配进行优化,无需使用昂贵的张量并行即可完成训练。DeepSeek通过破译英伟达后台指令并巧妙使用,极致优化了算法性能。
H800性能超越H200达151%
英伟达在2月25日公布8张H200和B200节点的R1推理吞吐分别为5899 tokens/s和21088 tokens/s。DeepSeek通过算法优化,在显存(80GB vs 141GB)和带宽(2TB/s vs 4.8TB/s)远不及H200的情况下,单节点平均输出吞吐达8575 tokens/s,实现了对H200 151%的性能超越。
在训练方面,DeepSeek-V3用2048张H800,总训练GPU卡时278.8万小时。Grok-3累计训练时长达2亿GPU小时,是DeepSeek-V3的约72倍。DeepSeek-V3性能比肩GPT-4o,验证了精细化训练路径的有效性。
DeepSeek关键技术创新汇总| 技术领域 | 创新点 | 效率提升 |
|---|
| 模型架构 | 多头潜注意力(MLA) | 2-4倍计算效率 |
| 模型架构 | DeepSeekMoE | 4倍以上计算效率 |
| 训练框架 | FP8混合精度训练 | 首个超大规模FP8模型 |
| 训练架构 | DualPipe算法 | 隐藏大部分通信开销 |
| 推理优化 | 软硬协同优化 | H800性能超H200 151% |
精细化路线引领大模型发展方向
从目前大模型能力构建路径来看大致分为两类:一是通过精细化模型和软硬件结合的训练架构,实现较低算力消耗下的模型能力建设,DeepSeek展现出超强能力和开创性;二是通过大算力投入带动整体模型能力提升,xAI的Grok-3证明了堆算力路径暂时有效。
无论从经济性还是能源消耗来看,简单依靠大力出奇迹的发展路径瓶颈都显而易见。DeepSeek所处的精细化处理发展路径,给后续大模型应用推广和能力提升创造了更多发展空间。结合中国在互联网应用、数据积累和工程师团队方面的优势,在底层模型能力实现突破后,中国在AI应用发展上有望实现全球领先。