端侧AI的爆发并不意味着云端算力需求的减弱。东吴证券电子团队基于手机AI推理的复杂功能需求,测算云端算力需求折算Blackwell GPU卡的FP8算力——2025年约12万张、2026年约103万张。苹果Writing Tools中Summary、Key Points等复杂功能需接入云端大模型;GPT-4(1.8万亿参数,推理激活280B)对1000 tokens文本推理需560 TFLOPS,与7B端侧模型的14 TFLOPS差距约40倍。东吴证券认为,端侧与云端算力不是此消彼长的关系,端侧AI对算力总盘子的拉动作用会长期存在。
云端推理算力需求的测算逻辑与方法
东吴证券将AI手机文本推理划分为简单功能(短文本,由端侧7B模型承载)和复杂功能(长文本,由云端大模型承载)。复杂功能主要包括Summary、Key Points、List、Table等需要长文本处理的任务,经测评发现此类场景需接入网络,由云端大模型实现。基于"推理算力需求=2×参数量×token数"公式,假设复杂功能单次推理需求约1000个汉字(折合约2000 tokens),参数量参考GPT-4的1.8万亿(推理时激活280B)。单日复杂功能调用次数从2024年3次/日增至2026年9次/日。云端算力需求若折算成Blackwell GPU卡的FP8算力,假设算力利用率约50%、峰值算力需求集中在5小时内释放,2025年需求量约12万张,2026年约103万张。
端侧与云端算力差距约40倍
端侧SoC算力虽持续提升,但与云端大模型算力需求仍存在量级差距。主流端侧7B小模型推理1000 tokens需14 TFLOPS,而GPT-4(1.8万亿参数,推理时激活280B)需560 TFLOPS,端侧与云端算力需求相差约40倍。SuperCLUE 2024年12月榜单显示,云端大模型(o1总分80.4、ChatGPT-4o-latest 70.2)得分明显高于端侧小模型(Qwen2.5-7B-Instruct 55.5、GLM-4-9B-Chat 52.4)。长文本处理时,大型计算开销因输入提升而急速上升,端侧算力有限场景下性能受明显制约。东吴证券认为,当前端侧AI推理还处于从0到1阶段,用户更多关注端侧AI"有没有"以及"效果好不好";到从1到10阶段,推理速度将是重要优化环节,云端推理在网络、用电设施部署相对完备的室内场景中仍具优势。
云端推理算力需求的长期结构性增长
东吴证券强调,端侧算力和云端算力不是此消彼长的关系,端侧AI对算力总盘子的拉动作用会长期存在。结构上看,云端算力需求来自两个维度:一是AI手机复杂功能调用量的自然增长——豆包大模型2024年日均tokens使用量从5月1200亿增至12月4万亿,增长超33倍,信息处理场景调用量占比最高约35-40%;二是端侧模型向云端外溢的增量需求——当端侧硬件无法承载复杂任务或用户对推理速度有更高要求时,云端推理仍是重要选择。东吴证券测算云端算力需求2025-2026年增速分别达765%和183%,Blackwell GPU需求从12万张跃升至103万张。云端算力基础设施的确定性受益方向包括工业富联(AI服务器)、沪电股份(PCB)、胜宏科技(PCB)、寒武纪(AI芯片)、海光信息(AI芯片)等。
表:云端推理算力需求测算(Blackwell GPU卡)| 指标 | 2025年 | 2026年 |
|---|
| 云端算力需求(亿TFLOPS) | 21,465 | 185,653 |
| yoy | 765% | 183% |
| Blackwell单卡FP8算力(TFLOPS) | 10,000 | 10,000 |
| 算力利用率 | 50% | 50% |
| Blackwell GPU需求量(万张) | 12 | 103 |