返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

豆包实时语音大模型

民生证券最新研报指出,语音交互是AI情感陪伴从“可用”走向“好用”的关键瓶颈。2025年1月20日,豆包正式推出实时语音大模型,在情感理解、情感承接以及情感表达方面取得显著进展。外部众测数据显示,豆包实时语音大模型满意度评分为4.36(满分5分),50%的测试者打出满分,而GPT-4o评分仅为3.18;在“一听就是AI与否”的评测中,反馈豆包“过于AI”的比例仅2%以内,而GPT-4o的比例超过30%。豆包实时语音大模型的发布有效弥补了“猫箱”APP及AI玩具在语音交互层面的短板,为AI情感陪伴从手机APP向硬件载体延伸扫清了关键障碍。

端到端语音大模型——突破“真人级”对话的限制

豆包实时语音大模型是一款语音理解和生成一体化的模型,实现了端到端语音对话,与传统的“语音识别→语义理解→语音合成”级联模式有本质区别。传统级联模式中,语音识别、语义理解和语音合成三个模块独立运行,信息在模块间传递时会产生损耗,导致语音交互生硬机械、延迟较高、无法自然打断。豆包端到端模型将语音与文本模态深度融合,实现了从语音输入到语音输出的端到端一体化处理,主要面向中文语境和场景(可进行英语对话)。基于字节大模型团队自研的端到端框架,该模型突破了真人级语音对话能力的限制,提供更亲和的交互体验和情感价值。在具体特性上,模型具备低时延、对话中可随时打断等特性,更接近真实的人与人对话体验。民生证券指出,端到端语音大模型是AI语音交互从“工具型”走向“情感型”的技术转折点,其技术门槛远高于传统的级联模式。

满意度数据对比——豆包远优于GPT-4o

豆包实时语音大模型的用户满意度数据展现了其显著的竞争优势。众测结果显示,豆包模型满意度评分为4.36(满分5分),其中50%的测试者为模型打出了满分;而GPT-4o评分仅为3.18,满分率远低于豆包。在“一听就是AI与否”的评测中,测试者反馈豆包“过于AI”的比例仅2%以内,而GPT-4o的比例超过30%。这意味着使用豆包实时语音大模型时,98%的用户认为其语音交互足够自然、不“出戏”;而使用GPT-4o时,近三分之一的人能明显感知到“这是AI”。豆包在语音语气自然度和情绪饱满度上远高于GPT-4o,成为其在中文AI语音交互领域的核心优势。民生证券认为,豆包实时语音大模型的语音表现力已经达到了商用级别,足以支撑AI陪伴类产品对“真人感”的体验要求,这是字节系AI产品从“功能领先”走向“体验领先”的关键一步。

补足“猫箱”和AI玩具的语音交互短板

当前的“猫箱”在文字交互体验上已较为出色,但语音交互依旧比较生硬机械,无法给用户带来足够的“真人感”,严重影响沉浸感。民生证券在实际测试中发现,“猫箱”APP内AI角色的语音交互存在语调单一、情感表达不足、响应延迟等问题,难以满足用户在情感陪伴场景中对“对话伙伴”的期待。豆包实时语音大模型的发布恰逢其时。依托于语音和语义联合建模,该模型拥有丰富表现力和极大的拓展潜力,能够呈现出接近真人的语音表达水准。接入“猫箱”后,AI角色的语音将具备情感温度——开心时语调轻快、难过时语气低沉、惊讶时语调上扬,而非当前机械的“文字转语音”。对于AI玩具而言,语音交互是“生命力”的核心载体——一个会说话的玩具和一个能用不同情绪“说话”的玩具,给用户的感受天差地别。民生证券看好豆包实时语音大模型以“猫箱”等APP为载体,深度服务广大用户的情感陪伴需求,并进一步赋能AI玩具产业。

从APP到硬件的延伸——字节系AI的终端战略

豆包实时语音大模型的发布不仅是技术迭代,更是字节系AI终端战略的关键一环。字节具备性能优秀的大模型+布局硬件入口的意愿,后续有望开放“猫箱”、“即梦”等APP和各种大模型给合作供应商,赋予传统玩具生命力。从技术落地的节奏看,手机APP将率先受益——豆包实时语音大模型已接入新版豆包APP,通话体验已显著升级。随后是AI玩具——字节系情感大模型将赋能AI玩具的语音交互,让玩具具备“AI角色”的性格和情感表达。最终,随着具身智能技术成熟,机器人伴侣将成为AI情感陪伴的终极形态。民生证券认为,2025年有望涌现一批现象级AI玩具,实现AI照进现实的第一步。字节系凭借大模型能力和硬件生态布局,有望在这一进程中占据核心地位。
表:豆包实时语音大模型 vs GPT-4o 核心评测数据
评测维度豆包实时语音大模型GPT-4o
满意度评分(满分5分)4.363.18
满分率50%远低于50%
“一听就是AI”比例≤2%>30%
点击阅读报告原文: 【民生证券】AI终端系列专题(一):AI故事:《银翼杀手》,以及情感大模型-250123(22页)
相关报告