单一大模型路线下,需要完成大规模参数计算。以 GPT-3 模型为例,随着模型朝更大体量的方向演进,参数量从 GPT-3 Small 的 1.25 亿个增长到 GPT-3 175B 的 1746 亿个,一次训练所需的计算量从 2.6PFlop/s-day 增至 3640PFlop/s-day。与此同时,在不同学习样本 (包括小 样本、单一样本、零样本)条件下的模型,随 着参数量的提升均实现不同幅度的上下文学习能力改善,外在表现为语言准确率的提升。我们认为,随着大模型训练表现出越来越强大的实战能力,未来或将成为 NLP 训练的主流选择。