在推理侧,影响计算效率的核心是访存,提高访存效率极为关键。大模型的推理主要包括 Prefill 和 Decode 两个阶段,据中国电信官网,Prefill 和 Decode 两者计算类型不同:Prefill 为计算密集型,时延主要由算力决定;Decode 为访存带宽密集型,时延主要由访存带宽决定。PD 混合部署时,两者互相干扰:Prefill 时,Decode 等待;Decode 时,Prefill 时延增加,P/D 时延不稳定,资源需求更大;中国电信天翼云携手昇腾围绕大 EP 与 PD 分离技术进行深度创新,将 DeepSeek 671B 满血版大模型按专家维度切分到不同的 NPU 上,使得单卡权重占用内存比例大幅降低,权重加载耗时大幅减少,且可用于 KV 数据计算的内存显著增加,实现高并发、高吞吐、低时延的推理性能。