返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

2026年豆包大模型趋势

财通证券计算机报告指出,Doubao-1.5-pro(包括文本、视觉、实时语音、推理等多个专家模型)采用MoE架构,仅用较小激活参数即可超过Llama3.1-405B等一流稠密模型。千tokens输入单价0.0008元,仅为GPT-4o的约10%。2025年1月20日豆包实时语音大模型落地移动端,近50%受访者打出5分满分,情感理解与情绪表达优势明显。财通证券认为豆包正从“办公助手”向“生活助手”扩散,AI应用触达人群将从知识型中青年向老人与儿童延伸。

MoE架构突破——7倍性能杠杆,推理成本仅为GPT-4o的10%

Doubao-1.5-pro采用稀疏MoE架构,通过训练-推理一体化设计,在保证模型性能的同时降低推理成本。豆包团队通过模型结构和训练算法优化,在9T tokens数据下,用激活参数仅为稠密模型参数量1/7的MoE模型即超越了稠密模型性能,将MoE性能杠杆提升至7倍(业界普遍不足3倍,IBM Granite系列约2.5倍)。Doubao-1.5-pro-32k千tokens输入单价0.0008元、输出0.002元,约为GPT-4o批量版本的10%。性能比肩国际一流模型,成本却大幅下降,加速国内企业接入国产大模型API服务。

技术深度拆解——Scaling Law+异构硬件+PostTraining三重驱动

豆包在训练前通过研究MoE模型的Scaling Law确定最优参数设置,在不同计算量下研究激活参数变化对训练损失的影响,从而确定最优激活参数与预训练token数量。推理层面,豆包针对Prefill/Decode与Attention/FFN四个象限采用异构硬件结合不同低精度优化策略,在确保低延迟的同时大幅提升吞吐量,兼顾TTFT和TPOT最优化。PostTraining阶段,豆包构建了统一Reward框架,实现数学、编程、知识、对话多维度均衡提升;基于veRL打造高并行化多角色训练推理一体框架;通过自适应数据分布调节机制解决多任务训练冲突;token-wise稳定建模收敛速度提升4倍,高难度任务性能提升超10个绝对点。数据标注“不走捷径”,不使用任何其他模型的数据,确保数据来源独立可靠。

多模态能力全面提升——视觉SOTA+语音端到端

视觉方面,Doubao-1.5-vision-pro在多模态数据合成、动态分辨率、多模态对齐、混合训练上全面升级,自研DoubaoViT仅2.4B参数即在多项基准取得SOTA表现(综合评分83.9%),超越7倍于自身规模的模型。支持任意分辨率和极端长宽比图像识别,文档识别和细粒度信息理解能力大幅提升。语音方面,Doubao-1.5-realtime-voice-pro打破传统“ASR+LLM+TTS”级联限制,通过Speech2Speech端到端框架实现语音理解和生成一体化,在语音表现力、控制力、情绪承接方面表现惊艳,具备低时延、对话中可随时打断等特性。近半年国内科大讯飞、智谱、昆仑万维等厂商密集推出端到端语音大模型,情感语音应用加速落地。

情感语音落地移动端——图灵测试“终结者”雏形初现

2025年1月20日豆包实时语音大模型落地移动端,电话页面新增“灵魂歌手”“百变大咖”“悄悄说话”“戏精本精”“受气小包”“英语陪练”等细分功能。外部用户测试(27人10城市810通对话)显示近50%受访者给豆包5分满分(GPT-4o不足10%),“一听就是AI与否”评测中超30%反馈GPT-4o“过于AI”,豆包仅2%以内。豆包在情绪理解、情感承接、情感表达方面进展显著,能准确捕捉和回应人类情感信息。大模型应用触达人群将从知识型中青年迅速向老人与儿童扩散,AI应用场景从办公学习扩展至聊天娱乐、教学陪练、心理疏导、查询播报等领域。
表1:Doubao-1.5-pro核心数据与竞品对比
维度Doubao-1.5-pro对比基准
模型架构稀疏MoE(7倍性能杠杆)业界MoE平均<3倍
千tokens输入成本0.0008元约为GPT-4o的10%
视觉模型参数2.4B(综合评分83.9% SOTA)超越17.5B模型
语音架构端到端Speech2Speech打破ASR+LLM+TTS级联
用户满意度(5分)近50%GPT-4o不足10%
“过于AI”反馈仅2%GPT-4o超30%
点击阅读报告原文: 计算机行业专题报告:豆包大模型更新至1.5~pro更真实、更懂你-250124(19页)
相关报告