财通证券报告详细拆解了Doubao-1.5-pro的MoE架构与推理成本优化方案。豆包通过模型结构调优和训练算法优化,在9T tokens数据下用激活参数仅为稠密模型1/7的MoE模型即超越稠密模型性能,将MoE性能杠杆提升至7倍(业界普遍不到3倍)。在Prefill/Decode与Attention/FFN四个象限采用异构硬件结合不同低精度优化策略,并通过自研服务器集群方案、定制化网卡和自主研发网络协议,大幅降低硬件成本。千tokens输入单价0.0008元,仅为GPT-4o批量版本的10%。财通证券认为豆包在保障性能的同时具备显著价格优势,加速国内企业接入国产大模型API服务。
MoE性能杠杆——从不到3倍到7倍的质变
MoE模型的性能通常用表现相同的稠密模型总参数量与MoE模型激活参数量的比值来衡量。IBM Granite系列约2.5倍,业界普遍不到3倍。豆包团队通过模型结构调优和训练算法优化,在9T tokens数据下,用激活参数仅为稠密模型参数量1/7的MoE模型即超越了稠密模型性能,将性能杠杆提升至7倍。Doubao-MoE在9T tokens时性能已优于Llama3.1-405B(15T tokens),且Doubao稠密模型参数量远小于Llama3.1-405B。完整的MoE训练性能比9T tokens中间版本有更大提升,标志着国产大模型在MoE架构优化上已实现国际领先。
推理成本优化——异构硬件+自研网络协议
Doubao-1.5-pro在Prefill/Decode与Attention/FFN四个象限中表现出显著不同的计算与访存特征。针对四个象限采用异构硬件结合不同低精度优化策略,在确保低延迟的同时大幅提升吞吐量,兼顾TTFT和TPOT最优化。针对Tensor传输进行定制化RPC Backend,通过零拷贝、多流并行等手段优化TCP/RDMA网络上的Tensor传输效率,提升PD分离下的KVCache传输效率。在框架上将GPU计算和CPU前后处理异步化,使GPU推理第N步时CPU提前发射第N+1步Kernel,保持GPU始终被打满,全流程零开销。自研服务器集群方案灵活支持低成本芯片,硬件成本比行业方案大幅降低,定制化网卡和自主研发网络协议显著优化小包通信效率。
PostTraining闭环——用户数据飞轮持续提升体验
豆包在PostTraining阶段构建高效标注团队与模型自提升技术深度融合的数据生产体系,数据标注“不走捷径”,不使用任何其他模型数据,确保数据来源独立可靠。构建统一Reward框架实现数学、编程、知识、对话多维度能力均衡提升;基于veRL打造高并行化多角色训练推理一体框架;通过自适应数据分布调节机制解决多任务训练冲突;token-wise稳定建模收敛速度提升4倍,高难度任务性能提升超10个绝对点;通过对比学习方法缓解reward hacking问题。依托字节在推荐、搜索、广告领域的ABTest经验,构建从问题发现、数据挖掘、人机结合标注到快速迭代的闭环优化系统,通过用户数据飞轮持续提升模型实际使用体验。
成本优势的产业意义——大模型API服务普惠化
Doubao-1.5-pro-32k千tokens输入单价0.0008元、输出0.002元,与Doubao-pro版本保持一致,性能升级但价格不变。对比GPT-4o-0806批量版本(千tokens输入0.00125美元),豆包价格约为其10%。显著的价差意味着国产大模型API服务从“大厂专属”向“普惠化”迈进。低推理成本将降低AI应用开发门槛,鼓励更多中小企业和开发者基于豆包大模型构建应用层产品,推动AI应用生态繁荣。财通证券认为,豆包在MoE架构和推理成本上的突破已形成显著竞争优势,有望加速国产AI应用从“试点”走向“规模商用”。
表2:MoE架构推理成本核心优化方案| 优化维度 | 技术手段 | 效果 |
|---|
| 模型结构 | MoE稀疏架构+训练算法优化 | 7倍性能杠杆(业界<3倍) |
| 计算策略 | Prefill/Decode四象限异构硬件+低精度优化 | 低延迟+高吞吐量 |
| 传输优化 | 定制RPC Backend+零拷贝+多流并行 | KVCache传输效率提升 |
| 框架设计 | GPU计算与CPU前后处理异步化 | 全流程零开销 |
| 硬件成本 | 自研服务器集群+定制化网卡+自研网络协议 | 硬件成本比行业方案大幅降低 |