返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

大模型训练成本优化

源达信息证券研究所报告深入剖析了DeepSeek在训练成本优化上的技术突破。DeepSeek-V3通过MoE混合专家架构、MLA多头潜在注意力、FP8混合精度训练、DualPipe流水线并行等创新,将训练成本降至557万美元,仅为Llama 3的约7%、GPT-4o的约1/14。DeepSeek-V3是官方认可唯一进入“最佳性价比”三角区的模型,以极低成本实现了与行业巨头相媲美的模型性能。这些创新共同构建了对“算力军备竞赛”发展路径的系统性颠覆。

MoE架构:671B参数每次推理仅激活37B

DeepSeek-V3放弃了Dense路线,使用MoE路线。MoE由多个子模型(“专家”)组成,每个专家专门处理输入空间的一个子集。门控网络选择性地激活特定专家而非整个神经网络。DeepSeekMoE具备更细粒度专家划分,采用共享专家机制,降低每个专家参数量、增大专家数量。共享专家捕捉共性,路由专家处理差异性,提高泛化能力和适应性。

DeepSeek-V3包含1个共享专家和256个路由专家,单次推理仅激活8个路由专家。总参数量671B,实际激活参数量37B(占比5.5%),相比稠密模型节省87%算力。无辅助损失的负载均衡策略确保各专家激活频率接近,不会导致性能额外损耗,GPU利用率从65%提升至92%。DeepSeek-V3用14.8万亿高质量token训练,构建出超越所有开源模型、直逼GPT-4和Claude-3.5的AI系统。

MLA与FP8:推理效率与训练速度双提升

MLA(多头潜在注意力)通过低秩联合压缩键值,将KV缓存大小减少93.3%。数据读取和处理量大幅减少,推理速度显著提升,相对基准系统吞吐量提升3-7倍。与DeepSeek 67B相比,MLA使V2节省42.5%训练成本,最大生成吞吐量提高5.76倍,在处理长序列数据时优势尽显。

FP8混合精度训练框架将内存占用减少50%,训练速度提升2.1倍。前向传播使用FP8(8位浮点数),反向传播使用FP16(16位浮点数),首次验证FP8训练在极大规模模型上的可行性。自研动态缩放算法根据梯度幅值自动调整量化参数,GLUE基准测试精度损失仅0.3%。DualPipe算法优化并行流水线,实现接近0的通信开销。DeepSeek-V3完整训练仅需278.8万GPU小时。

MTP多token预测与蒸馏技术提升模型能力

MTP(多token预测)机制实现一次预测多个token,通过自推测解码实现高达3倍推理速度提升。预测窗口滑动机制使长文本生成困惑度降低15%,文本更加流畅自然、逻辑连贯。DeepSeek-V3生成速度较V2.5提升3倍,每秒生成60个tokens。

蒸馏技术将DeepSeek-R1推理能力迁移至小模型。通过已有高质量模型合成少量高质量数据作为新模型训练数据,达到接近于在原始数据上训练的效果。DeepSeek发布从1.5B到70B参数的R1蒸馏版本,基于Qwen和Llama等架构。R1-Distill-Qwen-32B在AIME 2024达72.6%,MATH-500达94.3%,多项能力对标OpenAI o1-mini。复杂推理能力可封装在更小、更高效的模型中。

DeepSeek-V3位于模型性能/性价比最优范围

DeepSeek-V3是官方认可唯一进入“最佳性价比”三角区的模型。API服务定价每百万输入tokens 0.5元(缓存命中)/2元(缓存未命中),每百万输出tokens 8元。DeepSeek-R1每百万输入tokens 1元/4元,每百万输出tokens 16元。OpenAI o1每百万输出tokens 438元,DeepSeek-R1定价仅为o1的约1/30。

训练成本方面DeepSeek-V3完整训练仅278.8万GPU小时,557.6万美元。Llama 3 405B训练时长3080万GPU小时,GPT-4o达7800万至1亿美元。DeepSeek-V3训练使用英伟达H800(性能被削弱的特供AI芯片),OpenAI使用上万张H100。DeepSeek通过算法创新和工程优化,以极低成本实现与行业巨头相媲美的性能,构建了对“算力军备竞赛”路径的系统性颠覆。
技术优化效果
MoE混合专家架构激活参数仅37B(总671B),节省87%算力,GPU利用率65%→92%
MLA多头潜在注意力KV缓存减少93.3%,吞吐量提升3-7倍,节省42.5%训练成本
FP8混合精度训练内存占用减少50%,训练速度提升2.1倍,精度损失仅0.3%
MTP多token预测推理速度提升3倍,生成速度60 tokens/秒
DualPipe算法通信开销接近0,优化并行流水线
点击阅读报告原文: 人工智能行业DeepSeek专题研究:“低成本、高性能、强推理”三位一体DeepSeek驱动高质量模型平价化-250214(17页)
相关报告