等)和专家模型中激活的部分。1)稠密部分:假设GPT-5模型参数量为2万亿,则稠密部分参数量为0.2万亿,FP16下单参数占2bit空间,对应0.40TB显存需求;2)激活专家部分:专家模型参数量为1.8万亿,假设单次激活专家参数量占比为3%,则单次激活参数量为0.054万亿,对应0.10TB显存需求。综上,运行单个模型推理需要0.4+0.10=0.50TB显存。假设单个模型副本每秒可以输出1000个token,而GPT-5的用户需求为6067万token/s,则需求副本数量为60758个,对应HBM总需求为60758*0.50TB=29.4PB。