财通证券研究报告聚焦DeepSeek-V3/R1推理系统的成本效率分析。在开源周结束后的第6天,DeepSeek发布了推理系统概述文档,披露了令人瞩目的数据:在24小时内处理6080亿输入token和1680亿输出token,理论日收入达56万美元,日成本仅8.7万美元,成本利润率高达545%。这一数字刷新了全球AI大模型领域的盈利天花板。DeepSeek通过跨节点专家并行、三种负载均衡器和动态资源管理,实现了高吞吐量、低延迟和高性价比的推理服务。
推理系统架构:三大负载均衡器驱动效率革命
DeepSeek-V3/R1推理系统的核心设计目标是“更大的吞吐,更低的延迟”。为实现这一目标,系统引入了三种负载均衡器。Prefill Load Balancer解决不同数据并行实例上请求个数和长度不同导致的计算量不均衡问题,平衡各GPU的core-attention计算量和输入token数量。Decode Load Balancer解决KVCache占用量不均衡问题,确保解码阶段各GPU负载均匀。Expert-Parallel Load Balancer解决某些专家天然负载较高导致的计算不均衡问题,平衡每个GPU上的专家计算量。
系统在H800 GPU上运行,精度与训练时保持一致:矩阵乘法和分派传输采用FP8格式,核心MLA计算和组合传输使用BF16格式。这种混合精度策略在保证性能的同时最大化硬件利用率。推理服务采用动态资源调度策略,白天服务负载高时占用全部节点,夜间低负载时减少推理节点并将资源分配给研究和训练。
成本与收入结构:545%利润率的数字拆解
成本端,在24小时统计周期内(2月27日12点至2月28日12点),V3和R1推理服务的峰值节点占用数达278个节点,平均占用数为226.75个节点。每个节点包含8个H800 GPU,假设每小时租赁一个H800 GPU的成本为2美元,日总成本为87,072美元。
收入端,24小时内系统处理了6080亿输入token(其中56.3%命中磁盘KV缓存)和1680亿输出token。按照DeepSeek-R1的定价标准(缓存命中输入0.14美元/百万token、缓存未命中输入0.55美元/百万token、输出2.19美元/百万token),缓存命中输入收入47,923美元、缓存未命中输入收入173,921美元、输出收入146,133美元,合计理论日收入367,920美元。但实际日收入达561,975美元。理论成本利润率为(561,975-87,072)/87,072=545%。
实际收入与理论收入的差距分析
DeepSeek明确表示实际收入远低于理论数值。差距主要来自三个方面。第一,DeepSeek-V3的定价低于R1,而推理系统中同时运行V3和R1两个模型。第二,网页端和应用程序访问是免费的,仅部分API服务产生实际收入。第三,夜间非高峰时段自动应用了折扣。
尽管如此,545%的理论成本利润率依然具有重要的产业意义。它证明了大模型推理服务在技术优化充分的情况下可以具备极高的商业价值。业内分析指出,DeepSeek的开源策略与成本控制能力正在打破AI领域的资源垄断。长江证券研报认为,此次开源将通过开源模式与低成本路径,改变此前“大力出奇迹”——即堆算力、堆数据的AI开发逻辑,加速技术普惠化。
表2:DeepSeek-V3/R1推理系统24小时成本与收入明细| 项目 | 数值 | 备注 |
|---|
| 平均节点占用 | 226.75个 | 每节点8个H800 GPU |
| GPU租赁成本 | 2美元/小时/GPU | 行业标准假设 |
| 日总成本 | 87,072美元 | 226.75×8×2×24 |
| 输入token处理量 | 6,080亿 | 缓存命中率56.3% |
| 输出token处理量 | 1,680亿 | 平均输出速度20-22 token/秒 |
| 理论日收入 | 561,975美元 | 按R1定价计算 |
| 理论成本利润率 | 545% | 刷新全球AI盈利天花板 |
推理效率革命的产业意义与未来展望
545%的理论成本利润率具有深远的产业意义。它首次向市场证明,大模型推理服务在技术优化到位的情况下可以产生极高的商业回报。这一发现可能加速AI应用层的爆发——当推理成本大幅降低、服务效率显著提升时,更多开发者和企业将有能力部署和应用大模型。
DeepSeek所有模型均为开源模型,即所有应用厂商都拥有了可以比肩顶级AI的大模型,而且还可自行二次开发、灵活部署。当模型的成本越低,AI应用的创新门槛就越低。DeepSeek的推理系统优化经验——跨节点专家并行、三种负载均衡器、动态资源调度——为整个行业提供了可复用的技术范式。未来,随着更多企业采用类似优化策略,大模型推理的整体成本有望持续下降,推动AI从“奢侈品”走向“基础设施”。