大模型的算力消耗正在从训练侧向推理侧迁移。中信建投研报显示,OpenAI o1-preview API输出价格为60美元/百万tokens,是GPT-4o(15美元/百万tokens)的4倍。o1在推理过程中反复进行思维树检索和自我博弈,推理算力消耗的大幅增加直接体现在API定价上。推理侧Scaling Law的发现意味着,算力需求不会因模型训练完成而回落,推理侧的持续性消耗将成为算力需求的长期支撑。
o1 API定价:推理成本是GPT-4o的4倍
OpenAI o1-preview API定价为输入15美元/百万tokens、输出60美元/百万tokens。相比之下,GPT-4o的API定价为输入5美元/百万tokens、输出15美元/百万tokens。o1-preview的输出价格是GPT-4o的4倍,这一定价差异直接反映了o1在推理过程中消耗的额外算力成本。
o1-mini版本定价为输入3美元/百万tokens、输出12美元/百万tokens,成本比o1-preview低80%,在STEM推理任务上性能相当。不同版本的定价差异体现了o1系列在性能与成本之间的平衡策略——高性能场景使用o1-preview,高性价比场景使用o1-mini。
推理侧算力消耗的大幅增加
o1在推理过程中反复进行思维树检索和反复自我博弈,呈现出类人的逻辑思维潜力。与传统大模型一次前向传播即可输出结果不同,o1在输出答案前需要经过多轮内部推理——探索多条思维路径、评估各路径的质量、选择最优方案。这种“深度思考”机制的算力消耗显著增加。
推理侧Scaling Law的发现意味着:模型推理时间越久,处理复杂问题能力越强。这为企业通过增加推理算力投入来提升模型性能提供了技术路径,同时也意味着推理侧的算力消耗将成为持续性的运营成本。推理成本的优化将成为大模型商业化的核心竞争力。
算力需求从训练侧向推理侧迁移
过去,大模型行业的算力需求主要集中在训练侧——训练一个GPT-4级别模型需要数万张GPU、数月的训练时间、数亿美元的成本。训练完成后,算力需求一度被认为会大幅回落。
推理侧Scaling Law的发现改变了这一逻辑。o1展示了推理侧同样存在“投入越多、性能越好”的规律,推理算力消耗不仅不会回落,反而可能随着用户对更高质量推理结果的需求而持续增长。训练侧Scaling Law和推理侧Scaling Law构成算力需求的“双引擎”,训练侧塑造模型基础能力,推理侧决定模型在复杂任务上的表现上限。
推理成本优化:大模型商业化的关键变量
o1-preview高昂的推理成本为商业化提出了挑战。60美元/百万tokens的输出价格,意味着处理一个复杂问题可能需要数美元的成本,这超出了多数应用场景的承受范围。
o1-mini提供了折中方案——成本降低80%的同时保持STEM推理能力,这体现了大模型厂商在性能与成本之间寻求平衡的努力。未来,推理成本优化将成为大模型商业化的核心竞争力,技术路径包括:更高效的推理架构设计、专用推理芯片(如推理专用ASIC)、模型蒸馏与量化、缓存与复用机制等。推理侧算力消耗的大幅增加既是挑战也是机遇——对于算力基础设施提供商而言,推理需求的持续增长意味着更广阔的市场空间。
表:OpenAI大模型API定价对比| 模型 | 输入价格(美元/百万tokens) | 输出价格(美元/百万tokens) | 输出价格倍数(vs GPT-4o) |
|---|
| GPT-4o | 5 | 15 | 1x |
| o1-preview | 15 | 60 | 4x |
| o1-mini | 3 | 12 | 0.8x |