共建大模型推理生态:Mooncake、KTransformer 与 SGLang-区庆亮.pdf
2026-02-14
文档编号:1152896
文档页数:16
文档大小:2.06MB
下载积分:VIP专享
文档格式:PDF
1、区庆亮:清华大学研究生,KTransformers 核心开发者https:/ SPR+8*DDR5-4800规格80GB VRAM,2 TBps$15,0008*64GB DRAM,8*40GB/s$8,000带宽成本$7.5 per GBps$25 per GBps容量成本$187 per GB$15.6 per GB注:价格随时间波动大,仅供意会适合稀疏 5B(128K 上下文)17B654B注意力模块线性变换&共享专家模块路由专家模块模块容量计算强度高中低卸载到 CPU 处理由 GPU 处理解码(Decode)预填充(Prefill)设备间协同开销大CPU/GPU 重叠不充分CUDA G
2、raphNuma 感知的张量并行专家推迟机制最新工作:Expert Parallelism Load BalanceCPU 是计算密集阶段的瓶颈先进 CPU 指令集:Intel AMX最新工作:Layerwise Prefill难点:CPU-CPU 协同开销大现代 CPU 通常包含多个 NUMA 节点,跨 NUMA 节点访问的延迟和带宽都差于节点内部访问。解决方案:Numa 感知的张量并行均匀切分专家权重,放置在各个 NUMA 节点,尽可能使 CPU 只访问本地内存,避免高成本的跨节点内存访问。合入原精度适配Layerwise PrefillExpert Parallelism Load Ba





点击查看更多