记忆感知的大模型KVCache优化马腾 .pdf
1、记忆感知的大模型记忆感知的大模型 KVCache KVCache 优优化化以 KVCache 为中心的开源推理框架 Mooncake 的技术实践马腾|kvcache.ai/Mooncake 开源社区AICon 上海 2026目录目录01背景:从对话到多智能体协作02核心视角:KVCache 即物理工作记忆03Mooncake:KVCache-Centric 分离架构04实战:OpenClaw+Mooncake 尾延迟优化05多 Agent 记忆优化的关键技术06协议与缓存的融合 未来展望与社区路线01背景:从对话到多智能体协作背景:从对话到多智能体协作单一对话 工具调用 多 Agent 协作M
2、ulti-Agent Multi-Agent 时代的到来时代的到来单一对话单一对话 工具调用工具调用 多多 Agent 协作协作系统提示词系统提示词+工具描述工具描述+多轮历史多轮历史+Agent 间状态间状态=庞大的庞大的工作记忆工作记忆从简单的人机对话,到复杂的多智能体协作工作流,每一次 LLM 调用都需要携带越来越大的上下文窗口。Agent Working Memory Agent Working Memory 的构成的构成系统提示词系统提示词(System Prompt)定义角色、行为规则与约束条件永久固定永久固定工具定义工具定义(Tool Definitions)函数签名、参数描述与
3、调用规范半固定半固定多轮对话历史多轮对话历史(Conversation History)用户输入、模型输出与工具返回值持续增长持续增长Agent 间状态传递间状态传递(Inter-Agent State)上下游 Agent 的输出与中间结果动态变化动态变化典型场景:10 个 Agent x 20 轮交互=百万级 token 的工作记忆核心矛盾:重复核心矛盾:重复 Prefill Prefill 的代价的代价当前问题当前问题每次 LLM 调用独立处理完整上下文结果结果大量重复 Prefill 显存碎片化+高延迟相同上下文被反复计算的示意:调用 1重复上下文重复上下文新新调用 2重复上下文重复上下
4、文新新调用 3重复上下文重复上下文新新调用 N重复上下文重复上下文新新无 KV Cache 持久化TTFT 慢慢 136x首 token 延迟急剧恶化MCP 动态加载工具命中率命中率 85%0%工具列表变化导致缓存失效JSON 序列化不确定性TTFT 慢慢 65%字段顺序/空格差异破坏前缀匹配02KVCache KVCache 即物理工作记忆即物理工作记忆从内存管理到一等系统资源KVCache=Agent KVCache=Agent 的物理工作记忆的物理工作记忆KVCache 不只是推理引擎的内部数据结构,它是智能体系统最核心的物理工作记忆载体30 年前的数据库年前的数据库数据库的 Buffe
5、r PoolDB 从通用 OS 中独立自己管理内存现在的现在的 AGENTIC 推理推理Agentic 系统的 KVCacheAgentic 推理从通用 LLM Serving 中独立自己管理 KVCache数据库的数据库的 Buffer Pool Agentic 系统的系统的 KVCache 历史的类比历史的类比,未来的方向未来的方向Agentic vs Agentic vs 传统推理工作负载传统推理工作负载维度维度传统传统 Chat 推理推理Agentic 推理推理交互模式交互模式单轮/少量多轮数十轮(LLM Tool 循环)KV Cache 生命周期生命周期请求内释放需跨工具调用持久化P
6、rompt 结构结构相对固定高度模块化+动态组合前缀共享前缀共享同一用户多轮多 Agent 间共享输入输入/输出比输出比10:1100:1工作流拓扑工作流拓扑线性DAG/动态图KV Cache KV Cache 优化的分层技术栈优化的分层技术栈L5应用应用/协议层协议层A2A/MCPL4工作流优化层工作流优化层Helium/ParrotL3KV Cache 策略层策略层KVCOMM/EPICL2缓存编排层缓存编排层HiCache/TokencakeL1基础设施层基础设施层Mooncake/llm-d本次重点本次重点L0硬件硬件/传输层传输层PagedAttention/RDMA 越往上越贴近应





点击查看更多