返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

豆包情感语音应用

财通证券报告指出,2025年1月20日豆包实时语音大模型(Doubao-1.5-realtime-voice-pro)落地移动端,通过Speech2Speech端到端框架实现语音理解和生成一体化,打破传统“ASR+LLM+TTS”级联限制。外部用户测试中近50%受访者给豆包5分满分(GPT-4o不足10%),“一听就是AI与否”评测中超30%反馈GPT-4o“过于AI”,豆包仅2%以内。豆包在情绪理解、情感承接、情感表达方面取得显著进展,电话页面新增“灵魂歌手”“百变大咖”等细分功能,AI从“办公助手”向“生活助手”全面扩散。

端到端语音突破——Speech2Speech打破级联限制

传统语音生成模型多采用“ASR+LLM+TTS”级联技术路线,将语音→文本→理解→生成→语音分步处理,技术成熟但延迟严重、交互体验不佳。豆包实时语音大模型通过Speech2Speech端到端框架,将语音和文本token进行融合,为语音多模态数据的Scaling提供必要条件。在Pretrain阶段开发多样化数据生产和使用方式,探索多种训练方案,通过Scaling最大化融合语音和文本能力;在PostTraining阶段使用高质量真实与合成数据,优化RL算法,提升高情商对话能力与安全性,在“智商”与“情商”之间寻求平衡。模型主要面向中文语境和场景(可进行英语对话),部分方言和口音源自Pretrain阶段数据泛化,呈现接近真人的语音表达水准,涌现超出预期的指令理解、声音扮演和声音控制能力。

情感建模技术——异构图+情感标签实现高拟人化

豆包将“情感模态”连同文本、音频等一同编码压缩至大模型。根据字节跳动此前论文,对话语音合成(CSS)因情感对话数据集稀缺和状态情感建模困难,导致情感渲染力不足。豆包将文本、音频、说话人、情感和情感强度信息作为节点构建异构图ECG,创建14种不同类型的边连接各节点以建模双向关系。为DailyTalk数据集设计7个情绪标签(快乐、悲伤、愤怒、厌恶、恐惧、惊讶、中性)和3个情绪强度标签(弱、中、强),由专业从业者注释。ECSS模型由多源知识、基于异构图的情感上下文编码器和情感对话语音合成器三部分组成,为情感语音的高拟人化表达提供了技术基础。

应用场景多元——从办公助手到生活助手

豆包电话页面新增“灵魂歌手”(歌曲演唱)、“百变大咖”(角色扮演)、“悄悄说话”(私密对话)、“戏精本精”(夸张演绎)、“受气小包”(情绪宣泄)、“英语陪练”(语言学习)等细分功能。豆包已能:融入生活成为智能助手(解放双手语音交互)、模仿经典文艺作品(懂国人自己的“梗”)、演唱歌曲(娱乐性为主)、做情感/心理疏导(理解相处模式给出建议)、角色扮演中切换自如(发展“单人游戏”模式)、快速切换喜怒哀乐等情绪表达(应用于短剧配音)、根据复杂要求绘声绘色编故事(应用于儿童玩具)、实时联网查询播报信息(应用于家庭智能终端)。大模型应用从“办公学习”向“生活娱乐”全面扩展,触达人群从中青年迅速向幼年与老年人群扩散。

满意度评测——情感理解优势明显

豆包团队2025年1月12-14日招募27名来自全国10个城市的用户进行810通对话测试(270个话题组)。体验者中11.11%从未体验过豆包、70.37%为轻度用户(每周1-2天)、14.81%为粘性较高用户(每周3-5天)、3.7%每天使用。用户最常用豆包咨询问题、学习知识,其次是聊天倾诉、分享生活。近50%受访者给豆包5分满分,GPT-4o不足10%。在“情绪理解”和“情感表达”方面豆包优势明显。“一听就是AI与否”评测中超30%反馈GPT-4o“过于AI”,豆包仅2%以内。豆包在情感理解、情感承接、情感表达等方面取得显著进展,能较为准确地捕捉和回应人类情感信息,实现了“去AI味”的拟人化突破。
表3:豆包实时语音与GPT-4o用户满意度评测对比
评测维度豆包GPT-4o
5分满意度近50%不足10%
“过于AI”反馈仅2%超30%
情绪理解优势显著-
情感表达优势显著-
点击阅读报告原文: 计算机行业专题报告:豆包大模型更新至1.5~pro更真实、更懂你-250124(19页)
相关报告