AI训练范式正从“预训练至上”转向“多阶段并举”。黄仁勋在CES 2025提出AI三大Scaling Law:预训练阶段决定模型通用性能;后训练阶段通过强化学习等技术优化模型;推理阶段通过多步推理延长模型思考过程。24H2之前发展重心在Pre-training,而OpenAI o1和DeepSeek R1的发布,让Post-Training和Test-time的重要性显著提升。申万宏源计算机团队认为,后训练和推理阶段的Scaling Law仍处于起步阶段,模型厂商将继续加码强化学习,算力投入仍有增量空间。
三大Scaling Law——算力需求的结构性重塑
Pre-training Scaling Law:AI模型通用性能与训练数据量、参数量大小和算力投入成正比,此阶段投入算力主要用于模型初始训练。Post-Training Scaling Law:在预训练后通过强化学习、人类反馈等技术优化模型的一系列技术,提升算力投入对模型效果有正向影响。Test-time(“Reasoning”)Scaling Law:在推理阶段通过多步推理延长模型思考过程,增加推理算力投入能够实现更好的效果。三大定律相互叠加而非相互替代——o1模型分配给后训练和推理的资源显著提升。o1-preview参数量约3000亿,仅为GPT-4o(约2000亿)的1.5倍,但推理成本高达3-4倍,折射出后训练+推理阶段的高算力成本投入。
o1与DeepSeek R1的后训练革命——强化学习算力激增
OpenAI o1发布后,Post-Training阶段的强化学习(Reinforcement Learning)成为模型能力提升的关键。o1模型在多项测评上较GPT-4o显著提升,尤其在数学推理和复杂问题求解领域。DeepSeek R1在后训练阶段大规模使用强化学习技术,在仅有极少标注数据情况下极大提升模型推理能力,在数学、代码、自然语言推理等任务上性能比肩OpenAI o1正式版。AIME 2024测评中DeepSeek R1 pass@1达79.8%,超越o1的79.2%;MATH-500中97.3%对标o1的96.4%。后训练阶段的Scaling Law仍处于起步阶段,强化学习所需的算力投入仍有显著增长空间。模型厂商将继续加码RL,训练端算力需求不会因为单点优化而减少。
推理阶段Scaling Law——长思考时代的算力新需求
Test-time Scaling Law在DeepSeek R1中被充分验证——延长模型思考链可显著提升推理准确性,而长思考需要更多推理算力。o1的收费水平(输出60美元/百万tokens)远高于GPT-4o(输出15美元/百万tokens),实际代表其推理成本高于GPT-4o数倍。DeepSeek R1 API定价为输出16元/百万tokens,远低于o1但性能对标,其性价比进一步推动了推理阶段算力需求的普及化。申万宏源认为,后训练和推理阶段的Scaling Law仍处于起步阶段,这两个阶段的算力投入具有结构性增量空间。三大Scaling Law的共同演化将重塑算力需求结构——预训练算力需求趋于稳定,后训练和推理算力需求加速增长,算力总需求不会因单点优化而减少。
表:三大Scaling Law算力投入对比| 阶段 | 算力投入特征 | 当前状态 |
|---|
| Pre-training | 数据量×参数量×算力 | 趋于稳定 |
| Post-Training | 强化学习、RLHF | 起步阶段,增量大 |
| Test-time | 长思考、多步推理 | 起步阶段,增量大 |