返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

MoE架构推理成本分析

财通证券报告详细拆解了Doubao-1.5-pro的MoE架构与推理成本优化方案。豆包通过模型结构调优和训练算法优化,在9T tokens数据下用激活参数仅为稠密模型1/7的MoE模型即超越稠密模型性能,将MoE性能杠杆提升至7倍(业界普遍不到3倍)。在Prefill/Decode与Attention/FFN四个象限采用异构硬件结合不同低精度优化策略,并通过自研服务器集群方案、定制化网卡和自主研发网络协议,大幅降低硬件成本。千tokens输入单价0.0008元,仅为GPT-4o批量版本的10%。财通证券认为豆包在保障性能的同时具备显著价格优势,加速国内企业接入国产大模型API服务。

MoE性能杠杆——从不到3倍到7倍的质变

MoE模型的性能通常用表现相同的稠密模型总参数量与MoE模型激活参数量的比值来衡量。IBM Granite系列约2.5倍,业界普遍不到3倍。豆包团队通过模型结构调优和训练算法优化,在9T tokens数据下,用激活参数仅为稠密模型参数量1/7的MoE模型即超越了稠密模型性能,将性能杠杆提升至7倍。Doubao-MoE在9T tokens时性能已优于Llama3.1-405B(15T tokens),且Doubao稠密模型参数量远小于Llama3.1-405B。完整的MoE训练性能比9T tokens中间版本有更大提升,标志着国产大模型在MoE架构优化上已实现国际领先。

推理成本优化——异构硬件+自研网络协议

Doubao-1.5-pro在Prefill/Decode与Attention/FFN四个象限中表现出显著不同的计算与访存特征。针对四个象限采用异构硬件结合不同低精度优化策略,在确保低延迟的同时大幅提升吞吐量,兼顾TTFT和TPOT最优化。针对Tensor传输进行定制化RPC Backend,通过零拷贝、多流并行等手段优化TCP/RDMA网络上的Tensor传输效率,提升PD分离下的KVCache传输效率。在框架上将GPU计算和CPU前后处理异步化,使GPU推理第N步时CPU提前发射第N+1步Kernel,保持GPU始终被打满,全流程零开销。自研服务器集群方案灵活支持低成本芯片,硬件成本比行业方案大幅降低,定制化网卡和自主研发网络协议显著优化小包通信效率。

PostTraining闭环——用户数据飞轮持续提升体验

豆包在PostTraining阶段构建高效标注团队与模型自提升技术深度融合的数据生产体系,数据标注“不走捷径”,不使用任何其他模型数据,确保数据来源独立可靠。构建统一Reward框架实现数学、编程、知识、对话多维度能力均衡提升;基于veRL打造高并行化多角色训练推理一体框架;通过自适应数据分布调节机制解决多任务训练冲突;token-wise稳定建模收敛速度提升4倍,高难度任务性能提升超10个绝对点;通过对比学习方法缓解reward hacking问题。依托字节在推荐、搜索、广告领域的ABTest经验,构建从问题发现、数据挖掘、人机结合标注到快速迭代的闭环优化系统,通过用户数据飞轮持续提升模型实际使用体验。

成本优势的产业意义——大模型API服务普惠化

Doubao-1.5-pro-32k千tokens输入单价0.0008元、输出0.002元,与Doubao-pro版本保持一致,性能升级但价格不变。对比GPT-4o-0806批量版本(千tokens输入0.00125美元),豆包价格约为其10%。显著的价差意味着国产大模型API服务从“大厂专属”向“普惠化”迈进。低推理成本将降低AI应用开发门槛,鼓励更多中小企业和开发者基于豆包大模型构建应用层产品,推动AI应用生态繁荣。财通证券认为,豆包在MoE架构和推理成本上的突破已形成显著竞争优势,有望加速国产AI应用从“试点”走向“规模商用”。
表2:MoE架构推理成本核心优化方案
优化维度技术手段效果
模型结构MoE稀疏架构+训练算法优化7倍性能杠杆(业界<3倍)
计算策略Prefill/Decode四象限异构硬件+低精度优化低延迟+高吞吐量
传输优化定制RPC Backend+零拷贝+多流并行KVCache传输效率提升
框架设计GPU计算与CPU前后处理异步化全流程零开销
硬件成本自研服务器集群+定制化网卡+自研网络协议硬件成本比行业方案大幅降低
点击阅读报告原文: 计算机行业专题报告:豆包大模型更新至1.5~pro更真实、更懂你-250124(19页)
相关报告