招商证券AIGC系列报告深入分析了DeepSeek的成本优势。DeepSeek-V3正式训练成本仅为557.6万美元,R1 API定价为每百万输出tokens 16元,约为OpenAI o3-mini的八分之一。本文基于招商证券研报,详细拆解DeepSeek的降本路径与AI模型平价化趋势。
557.6万美元——DeepSeek-V3训练成本全拆解
根据DeepSeek-V3论文,正式训练成本仅为557.6万美元。具体来看:预训练阶段每训练一万亿个标记仅需18万H800 GPU小时,在2048块H800集群上仅需3.7天。完整训练包括预训练266.4万GPU小时、上下文长度扩展11.9万GPU小时、后期训练0.5万GPU小时,合计278.8万H800 GPU小时。
以H800 GPU租赁价格每小时2美元计算,总训练成本为557.6万美元。虽然这一成本不包括前期架构、算法或数据方面的研究和消融实验,但V3成本仍显著低于其他主流大模型。GPT-4等模型的训练成本通常在数千万至数亿美元量级,DeepSeek以不到其十分之一的成本实现了对标o1的推理能力,体现了算法创新的巨大杠杆效应。
API定价仅为OpenAI的八分之一,倒逼行业降价
DeepSeek-R1 API服务定价为每百万输入tokens 1元(缓存命中)/4元(缓存未命中),每百万输出tokens 16元。对比OpenAI最新发布的o3-mini,其API定价为每百万输入tokens 1.1美元(约8元人民币),每百万输出tokens 4.4美元(约31元人民币)。
输出token价格方面,DeepSeek约为o3-mini的1/8。如此显著的价格差距直接倒逼OpenAI降低GPT使用成本,1月31日OpenAI推出的o3-mini已向免费用户开放,体现了市场竞争对AI平价化的推动作用。招商证券认为,DeepSeek的成功将进一步加速全球AI模型从“高价稀缺”向“平价普及”转型。
算法进步驱动成本每年下降4-10倍
根据SemiAnalysis估计,算法的进步速度为每年4倍,即每过一年实现相同功能所需计算量减少4倍。Anthropic首席执行官Dario认为算法进步速度更快,可带来10倍的改进。过去一年,算法的改进和优化已使成本降低了约10倍,而模型能力则有进一步提升。
DeepSeek的降本路径验证了这一趋势。MLA(多头潜在注意力)通过低秩键值联合压缩显著减少KV缓存量;DeepSeekMoE通过细分专家和共享专家隔离提升专家利用效率;FP8混合精度训练使计算速度相比BF16方法提升一倍;DualPipe算法实现高效的流水线并行,减少通信开销。多项创新叠加,使DeepSeek在保持高性能的同时实现了行业最低的训练和推理成本。
DeepSeek-R1与OpenAI o3-mini API定价对比| 定价项目 | DeepSeek-R1 | OpenAI o3-mini | 价格倍数 |
|---|
| 输入(缓存命中) | 1元/百万token | — | — |
| 输入(缓存未命中) | 4元/百万token | 约8元/百万token | 约1/2 |
| 输出 | 16元/百万token | 约31元/百万token | 约1/8 |
低成本+高性能的商业化飞轮效应
DeepSeek的低成本策略正在形成正向飞轮。更低的使用成本吸引更多开发者和企业用户,规模化应用带来更多反馈数据和优化机会,算法进一步优化又降低单位成本,从而持续扩大用户基础。
目前DeepSeek已迅速集成进华为云、腾讯云、百度智能云、阿里云等国内主要云平台,以及英伟达、微软、亚马逊等海外平台。广泛的云部署降低了开发者使用门槛,使DeepSeek模型能够在更大规模的生产环境中稳定运行。招商证券认为,这一趋势将推动AI应用从“探索期”进入“规模化部署期”,AI产业链的生态繁荣正在加速到来。