慧博智能投研报告显示,AI产业正经历从“训练驱动”向“推理驱动”的结构性转变。2022年云端推理占比已达58.5%,预计2026年升至62.2%。生成式AI的快速落地使推理算力需求呈指数级增长——字节跳动豆包模型日均token使用量7个月增长33倍,从约1200亿飙升至4万亿。随着DeepSeek等开源模型降低应用门槛,推理算力有望在2025年迎来井喷。
AI产业从训练驱动向推理驱动转型
AI技术在实际应用中包含训练和推理两大环节。训练是指通过大数据训练出复杂的神经网络模型;推理则是利用训练好的模型对新数据进行快速处理和响应。在产业发展早期,训练算力需求是AI芯片市场的主要驱动力(大模型参数规模的军备竞赛)。但随着大模型训练趋于收敛、AI应用进入规模化部署阶段,推理算力需求开始后来居上。2022年云端推理占算力已达58.5%,训练仅41.5%。预计到2026年推理占比将升至62.2%,训练降至37.8%。这一结构性转变说明AI模型正从“实验室训练”走向“大规模投产”,推理算力将成为AI产业链的核心增长极。
生成式AI爆发式增长,token使用量指数级攀升
生成式AI的快速发展是推理算力需求爆发的直接驱动力。以字节跳动豆包模型为例,截至2024年12月中旬,其日均token使用量已经超过4万亿,短短七个月内增长了33倍。每一次token的生成都对应着一次推理计算——从文本生成到图像创作,从代码辅助到知识问答,推理算力正在成为AI应用的“燃料”。随着大模型从文本生成向多模态(图像、视频、3D)拓展,单次推理的计算量将进一步增加。OpenAI o1-preview等新一代推理增强模型在回答前进行更长时间的“链式推理”,也直接拉长了推理计算的时间消耗,增加了单次推理的算力成本。推理算力需求的增长斜率有望继续陡峭化。
大模型推理算力消耗测算:万亿参数需50张A100
大模型推理需要消耗大量GPU显存和算力。以GPT-3的1750亿参数为例,对应约350GB的GPU显存需求(推理时还需加上中间参数量约1倍,即700GB),需9张A100(80GB)或30张A10(24GB)。万亿参数规模的大模型推理需约4000GB显存,需50张A100。集群中的GPU数量越多意味着更复杂的互连要求;A10无法应用NVLink和NVSwitch,仅靠PCIe通信,互连带宽相比A100劣势明显,可能导致模型推理时效性不佳。因此超大规模模型的推理更倾向于选择A100/H100等旗舰级GPU,而非专用推理卡。云端推理占比提升的同时,推理侧的硬件配置也在升级,单卡价值量持续走高。
2025年算力爆发元年,推理端迎来井喷期
2025年被认为是算力爆发的元年,推理算力的需求将迎来井喷式增长。DeepSeek等低成本、高性能大模型的开源降低了AI应用部署门槛,将进一步催化推理算力需求。AI基础模型的开源生态有望加快创新速度,AI应用部署门槛降低以及成本下降带动应用繁荣,最终形成“模型开源→应用爆发→推理需求增长”的正循环。据IDC预测,2026年中国智能算力规模将达到每秒十万亿亿次浮点运算(ZFLOPS),年复合增长率52.3%,主要来自于推理端的需求释放。
云端推理与训练占比趋势及驱动因素| 指标 | 2022年 | 2026E | 变化 | 核心驱动 |
|---|
| 云端推理占比 | 58.5% | 62.2% | +3.7pct | 生成式AI应用落地 |
| 云端训练占比 | 41.5% | 37.8% | -3.7pct | 大模型训练趋于收敛 |
| 豆包日均token | ~1200亿 | >4万亿 | 33x | 7个月内增长 |