刘童旋_基于C++构建大模型推理优化框架xLLM实践.pdf
1、基于C+构建大模型推理优化框架xLLM实践刘童璇电商场景的 AI 需求AI 生成商品图生成、短视频、AI营销内容生成、AI 数字人AI 生成商品图、短视频、AI 营销内容生成、AI 数字人AI 生成商品图生成、短视频、AI营销内容生成、AI 数字人AI 客服与售后管理、AI 经营托管、AI 仓配优化、AI 交互式推荐AI 生成商品图生成、短视频、AI营销内容生成、AI 数字人自动分拣机器人、智能空间、自动驾驶Generative AIAgentic AIPhysical AI电商场景 AI 推理的挑战大模型、多模态、文生图/视频、生成式推荐等多场景多模型的推理效率的挑战不同模型采用的不同推理框
2、架,带来无法实现多模型间的协同的挑战输入的多样性,硬件异构,用户的优先级,不同 SLO,分布式调度的挑战模型的规模、效果和效率的平衡,性能优化和轻量化的挑战为什么选择C+来构建大模型推理引擎?大模型推理引擎xLLM大模型多模态文生图/视频生成式推荐深度解耦的分布式设计,推理从单机走向集群动态PD分离、结合大规模专家负载均衡混合的EPD分离架构,异构实例协同推理全局多级KV Cache,推理内存池化全局智能调度,严格SLO下最大化资源利用率在离线任务的统一调度和弹性调度多优先级的用户请求调度请求快迁移和快恢复的容错机制Runtime运行时,极致性能优化全图化、多层流水线的执行引擎xTensor显
3、存管理优化高效融合算子库、异构硬件、通算并行xLLM-自适应PD调度-问题和挑战初期 PD 分离架构中 Prefill 和 Decode 节点比例固定实际场景的Input 和 Output 变化显著,PD 资源浪费xLLM-自适应PD调度-实现方案P和D 可自动切换身份PD 间 KV Cache迁移和请求可平滑迁移xLLM-自适应PD调度-实验效果在不同模型上,自适应PD调度可以实现吞吐提升1.59X-2.2X自适应PD调度使用的SLO Aware调度策略对比Mini Load和Round Robin具有显著的效果优势xLLM EPD分离调度-问题和挑战Encoder/Prefill/Deco





点击查看更多