DeepSeek开源周最反直觉的发现是——算力效率的提升并未抑制算力需求,反而在杰文斯悖论框架下推动全球算力消耗进入加速扩张周期。FlashMLA使单卡效率达行业平均8倍,V3训练成本仅557万美元,但推理服务峰值时仍占用278个H800节点、日处理token超776亿。中泰证券认为,AI应用爆发催生庞大推理需求,多模态智能体提升单任务算力消耗,国产算力结合算法创新有望弯道超车。
杰文斯悖论:效率越高,需求越大
19世纪经济学家杰文斯发现,蒸汽机效率提升后煤炭消耗量反而增加。类似现象正发生在AI算力领域——DeepSeek将H800算力效率提升至行业平均8倍,但AI应用爆发催生的推理需求使算力消耗总量持续攀升。单H800节点日处理prefill 73.7k tokens/s、decode 14.8k tokens/s,推理服务峰值占278个节点、日处理token超776亿。效率提升降低单位算力成本,扩大AI应用覆盖面,驱动算力需求总量增长。
多模态智能体提升单任务算力消耗
当前AI以文本交互为核心,但未来图像识别、音视频生成、3D场景建模的复合型Agent将显著提升单任务算力消耗强度。DeepSeek开源周展示的3FS并行文件系统(180节点6.6TiB/s吞吐)和Smallpond分布式排序能力(110.5TiB数据30分钟完成),正是为支撑多模态海量数据训练与推理而设计。多模态智能体的普及将使同等规模业务场景的算力需求呈指数级跃升。
国产算力:算法创新结合硬件有望弯道超车
DeepSeek通过优化Hopper架构适配策略释放了国际主流算卡潜力,更为国产GPU厂商提供了可复现的算法优化路径。DeepGEMM的JIT编译技术可动态适配不同硬件配置,无需预编译即可生成优化内核;EPLB负载均衡策略可适配国产芯片的异构计算架构。海外高性能芯片供应受限背景下,国产算力结合算法架构创新有望在训练/推理效率上逼近国际水平。
投资建议:公有云与国产算力标的
大型云厂商具备规模与infra优势,能以更低成本支持高并发业务需求。阿里巴巴未来三年计划投入超3800亿元强化云计算基础设施。国产算力方面,DeepSeek已证明算法优化可弥补硬件差距,建议关注海光信息、中科曙光、神州数码。R2模型有望于5月前发布,进一步验证国产算力+算法创新的可持续性。
表:DeepSeek算力效率关键数据| 指标 | 数据 |
|---|
| FlashMLA单卡效率 | 行业平均8倍 |
| V3训练成本 | 557万美元 |
| 单H800 Prefill吞吐 | 73.7k tokens/s |
| 单H800 Decode吞吐 | 14.8k tokens/s |
| 推理服务峰值节点 | 278个H800节点 |
| 日处理输入token | 608B |
| 日处理输出token | 168B |
| 成本利润率 | 545%(理论值) |