国信证券2024年AI大模型报告指出,GPT-o1引入的思维链推理机制正在重塑AI推理算力需求格局。思维链需要多步推理,大幅提升推理算力的消耗;同时,思维链仅对1000亿以上参数模型有显著提升,反向限定了模型参数量下限,进一步拉动推理阶段算力需求增长。推理芯片更关注功耗、时延和成本,对精度要求相对较低,ASIC芯片在推理领域效率约为CPU的100-1000倍。本文深入分析AI推理算力需求的增长逻辑与芯片市场格局。
思维链对推理算力的拉动效应——从单步到多步的算力跃升
GPT-o1的核心技术思维链大幅改变了推理阶段的算力消耗模式。传统LLMs推理阶段仅需一次前向传播即可生成回答,过程较短;而思维链需要模型在内部生成多步推理链条,每步推理都需要独立的计算资源。思维链长度与推理精度呈正相关,更长的思维链带来更高的准确率,但也意味着更多的算力消耗。
思维链的算力拉动效应体现在三个层面:一是推理步数增加,每步推理均需计算资源;二是推理时间增长,与传统LLMs推理阶段短的范式形成显著差异;三是并发推理需求增加,思维链过程中模型需要维护完整的推理状态。这三个层面叠加,使得GPT-o1类模型的推理算力消耗数倍甚至数十倍于传统LLMs。
千亿参数门槛——思维链对模型规模的约束效应
思维链技术对模型参数量提出了更高要求。根据Jason Wei等人在2023年发表的《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》研究,思维链仅对1000亿以上参数模型的推理有显著提升。1000亿以下参数模型使用思维链效果不明显甚至可能降低性能。
这一发现对推理算力需求产生了重要影响。此前,为节省推理算力消耗,大多数厂商通过知识蒸馏、模型剪枝等方式缩小模型参数量。而思维链反向限定了模型参数量下限——要获得思维链带来的推理能力提升,模型必须保持在1000亿参数以上。大参数模型推理本身消耗更多算力,与思维链的多步推理叠加,进一步拉动推理阶段算力需求增长。
推理芯片市场格局——ASIC芯片优势凸显
深度学习由训练和推理两个任务组成,AI芯片的主要功能就是支撑这两个任务。训练任务对AI芯片有高算力、高容量、高精度和通用性要求;推理任务则更加关注芯片功耗、时延、成本,对精度要求相对较低。
ASIC芯片在推理领域具有显著优势。根据CSET数据,ASIC芯片的推理效率和速度约为CPU的100-1000倍,相较于GPU和FPGA具备明显竞争力。具体对比:GPU在推理领域效率约CPU的1-10倍、速度约1-100倍;FPGA推理效率和速度约CPU的10-100倍;ASIC推理效率和速度均可达CPU的100-1000倍。ASIC推理准确率约90-98%,低于CPU和GPU(98-99.7%),但推理场景对精度要求相对较低,更关注功耗、时延和成本。ASIC芯片在功耗、成本和时延方面的综合优势使其成为推理场景的理想选择。
推理算力市场空间展望
思维链驱动的推理算力需求增长有望打开广阔市场空间。以GPT-o1在编程领域的渗透为例:2022年全球有2690万软件开发者,假设程序员每天写200行代码(2000单词≈2666 tokens),渗透率75%、重复修改10次/天、工作300天/年,年度tokens消耗量约1,613,596.5亿个,对应市场空间约96.82亿美元(仅计算模型输出tokens,60美元/百万tokens)。
随着思维链技术在更多领域(科研、教育、法律、策略制定等)的渗透,推理算力市场空间将持续增长。ASIC芯片作为推理场景的最优解,有望在这一趋势中获取最大的市场份额。国产ASIC芯片厂商海光信息等有望受益于推理算力需求的快速增长。
表2:各类芯片在训练与推理领域的效率对比(以CPU为基准)| 芯片类型 | 训练效率 | 训练速度 | 推理效率 | 推理速度 | 推理准确率 |
|---|
| CPU | 1x | 1x | 1x | 1x | 98-99.7% |
| GPU | 10-100x | 10-1,000x | 1-10x | 1-100x | 98-99.7% |
| FPGA | — | — | 10-100x | 10-100x | 95-99% |
| ASIC | 100-1,000x | 10-1,000x | 100-1,000x | 10-1,000x | 90-98% |
GPT-o1的思维链技术正在重塑AI推理算力市场。千亿参数模型的推理需求叠加多步推理的算力消耗,推理算力需求有望迎来快速增长。ASIC芯片凭借在推理场景中的效率、速度和成本优势,有望成为这一趋势的核心受益者。