Scaling Law——这一在训练侧被验证的定律,如今在推理侧同样成立。中信建投研报显示,OpenAI o1的性能随着更多强化学习投入和更多思考时间投入而不断提高,模型推理时间越久,处理复杂问题能力越强。推理侧Scaling Law的发现,意味着大模型的逻辑推理能力仍有巨大提升空间,同时也意味着推理算力消耗将持续增长,算力需求从训练侧向推理侧迁移的趋势正在加速。
推理侧Scaling Law:时间换智能的数学规律
过去,大模型领域关注的焦点是训练侧的Scaling Law——训练数据越多、模型参数越大、算力投入越高,模型能力越强。OpenAI o1首次在推理侧验证了相似的规律:模型推理时间越久,处理复杂问题能力越强。
在IMO数学竞赛中,o1通过更长的推理链条实现了从13%(GPT-4o)到83%的正确率跃升。在IOI编程竞赛中,当每题允许10000次提交时,模型得分从213分(前49%)提升至362.14分(金牌)。微软亚洲研究院rStar的研究进一步验证了这一规律——LLaMA-3模型通过4-rollouts和MCTS推理,整体准确率从24.36%提升至58.24%。
推理侧算力消耗的大幅增加
o1在推理过程中反复进行思维树检索和反复自我博弈,呈现出类人的逻辑思维潜力。这种“深度思考”是有代价的——模型当前推理算力需求大幅提升。OpenAI o1-preview API输出价格为60美元/百万tokens,是GPT-4o(15美元/百万tokens)的4倍,直接反映了推理过程中额外算力消耗的成本。
大模型整体算力消耗正从训练侧逐渐迁移至推理侧。过去市场对大模型训练侧的算力需求给予高度关注,但o1验证了推理侧Scaling Law的存在,推理算力的持续增长将成为算力需求的长期支撑。训练侧算力投入塑造模型基础能力,推理侧算力投入决定模型在复杂任务上的表现——两者共同构成大模型算力需求的双轮驱动。
推理侧Scaling Law的产业影响
推理侧Scaling Law的发现带来三重影响:第一,大模型逻辑推理能力的提升路径更加清晰——通过增加推理时间投入即可提升性能,无需等待新一代模型训练完成;第二,算力需求的可持续性增强,过去担忧训练完成后算力需求断崖,推理侧Scaling Law提供了长期需求支撑;第三,推理成本成为大模型商业化的关键变量,o1-preview 4倍的API定价反映高推理成本,如何在性能提升与成本控制之间取得平衡,是o1系列商业化的核心挑战。
训练侧与推理侧算力需求的再平衡
o1之前,大模型行业重点聚焦训练侧的算力投入——GPT-3、GPT-4等模型的训练消耗了数十亿美元级别的算力成本,训练完成后算力需求可能回落。o1验证的推理侧Scaling Law改变了这一逻辑:推理侧同样遵循“投入越多、性能越好”的规律,这意味着大模型在全生命周期(训练+推理)都需要持续的算力投入。
训练侧算力的一次性投入,叠加推理侧算力的持续性消耗,构成了大模型算力需求的新范式。训练侧Scaling Law和推理侧Scaling Law的双重存在,使算力成为大模型能力提升和商业化落地的核心基础设施,算力需求的长期增长确定性进一步增强。
表:训练侧Scaling Law与推理侧Scaling Law对比| 维度 | 训练侧Scaling Law | 推理侧Scaling Law |
|---|
| 核心规律 | 训练数据↑ 参数↑ → 模型能力↑ | 推理时间↑ → 复杂问题处理能力↑ |
| 验证模型 | GPT系列、LLaMA系列 | OpenAI o1、rStar |
| 算力特征 | 一次性投入 | 持续性消耗 |
| 性能提升案例 | GPT-4 vs GPT-3 | o1 IMO 83% vs GPT-4o 13% |
| 商业化影响 | 训练成本决定模型门槛 | 推理成本决定应用成本 |