返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

AI训练范式变革

AI训练范式正从“预训练至上”转向“多阶段并举”。黄仁勋在CES 2025提出AI三大Scaling Law:预训练阶段决定模型通用性能;后训练阶段通过强化学习等技术优化模型;推理阶段通过多步推理延长模型思考过程。24H2之前发展重心在Pre-training,而OpenAI o1和DeepSeek R1的发布,让Post-Training和Test-time的重要性显著提升。申万宏源计算机团队认为,后训练和推理阶段的Scaling Law仍处于起步阶段,模型厂商将继续加码强化学习,算力投入仍有增量空间。

三大Scaling Law——算力需求的结构性重塑

Pre-training Scaling Law:AI模型通用性能与训练数据量、参数量大小和算力投入成正比,此阶段投入算力主要用于模型初始训练。Post-Training Scaling Law:在预训练后通过强化学习、人类反馈等技术优化模型的一系列技术,提升算力投入对模型效果有正向影响。Test-time(“Reasoning”)Scaling Law:在推理阶段通过多步推理延长模型思考过程,增加推理算力投入能够实现更好的效果。三大定律相互叠加而非相互替代——o1模型分配给后训练和推理的资源显著提升。o1-preview参数量约3000亿,仅为GPT-4o(约2000亿)的1.5倍,但推理成本高达3-4倍,折射出后训练+推理阶段的高算力成本投入。

o1与DeepSeek R1的后训练革命——强化学习算力激增

OpenAI o1发布后,Post-Training阶段的强化学习(Reinforcement Learning)成为模型能力提升的关键。o1模型在多项测评上较GPT-4o显著提升,尤其在数学推理和复杂问题求解领域。DeepSeek R1在后训练阶段大规模使用强化学习技术,在仅有极少标注数据情况下极大提升模型推理能力,在数学、代码、自然语言推理等任务上性能比肩OpenAI o1正式版。AIME 2024测评中DeepSeek R1 pass@1达79.8%,超越o1的79.2%;MATH-500中97.3%对标o1的96.4%。后训练阶段的Scaling Law仍处于起步阶段,强化学习所需的算力投入仍有显著增长空间。模型厂商将继续加码RL,训练端算力需求不会因为单点优化而减少。

推理阶段Scaling Law——长思考时代的算力新需求

Test-time Scaling Law在DeepSeek R1中被充分验证——延长模型思考链可显著提升推理准确性,而长思考需要更多推理算力。o1的收费水平(输出60美元/百万tokens)远高于GPT-4o(输出15美元/百万tokens),实际代表其推理成本高于GPT-4o数倍。DeepSeek R1 API定价为输出16元/百万tokens,远低于o1但性能对标,其性价比进一步推动了推理阶段算力需求的普及化。申万宏源认为,后训练和推理阶段的Scaling Law仍处于起步阶段,这两个阶段的算力投入具有结构性增量空间。三大Scaling Law的共同演化将重塑算力需求结构——预训练算力需求趋于稳定,后训练和推理算力需求加速增长,算力总需求不会因单点优化而减少。
表:三大Scaling Law算力投入对比
阶段算力投入特征当前状态
Pre-training数据量×参数量×算力趋于稳定
Post-Training强化学习、RLHF起步阶段,增量大
Test-time长思考、多步推理起步阶段,增量大
点击阅读报告原文: 计算机行业华为系列深度之十八暨GenAI系列深度之四十九:算力新变局训练范式、架构创新、工程优化-250207(24页)
相关报告