返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

DeepSeek-R1技术突破

DeepSeek-R1的横空出世正在改变全球大模型的竞争格局。光大证券《互联网大厂如何受益于DeepSeek-R1"破圈"?》报告显示,DeepSeek-R1在AIME 2024、MATH-500、LiveCodeBench等多个基准测试中超越OpenAI-o1,在Chatbot Arena排名全球第四(1,361分),超越OpenAI o1(1,351分)。在几乎没有任何广告投放的情况下,DeepSeek 7天完成1亿用户增长,成为史上最快达成该里程碑的应用。本文从性能表现、技术突破、传播路径三个维度,解析DeepSeek-R1的"破圈"密码。

性能全面对标OpenAI-o1,多个基准测试实现超越

DeepSeek-R1在多个权威基准测试中展现了与OpenAI-o1正面竞争的实力。在AIME 2024 pass@1测试中,DeepSeek-R1得分79.2%,大幅超越o1-mini的63.6%;在MATH-500达96.4%;在LiveCodeBench达63.4%;在Codeforces rating达2,061(超过93.4%人类程序员)。在AIME 2024 cons@64测试中,DeepSeek-R1得分97.3%,o1-mini仅80.0%。DeepSeek-R1仅在GPQA Diamond(65.7% vs o1-0912的73.1%)等少数科学推理测试中略逊于OpenAI-o1-0912。这一性能水平使DeepSeek-R1成为首个在推理能力上全面对标o1的开源模型,填补了OpenAI o1闭源后行业对高质量推理模型的迫切需求。

Chatbot Arena排名全球第四,开发者社区高度认可

Chatbot Arena是一个基于人类偏好评估LLM的开放平台,采用成对比较方法,用户投票选出两个模型响应中更好的一个。截至2025年2月9日,平台共收集到超过260万次用户投票。DeepSeek-R1以1,361分的Arena Elo分数排名全球第四,仅次于Gemini-2.0-Flash-Thinking-Exp-01-21(1,384分)、Gemini-2.0-Pro-Exp-02-05(1,379分)和ChatGPT-4o-latest(1,365分),超越OpenAI o1(1,351分)。值得注意的是,DeepSeek-R1上线时间较晚,投票次数仅4,193次(前十名中最少),但仍获得高排名。海外科技媒体arstechnica对DeepSeek-R1与OpenAI-o1和o1-Pro进行评测,结果显示DeepSeek-R1在多个日常提问中返回优于o1系列的回复,包括创意写作、数学推理、指令遵循等领域。
DeepSeek-R1与OpenAI-o1关键基准对比
基准测试DeepSeek-R1OpenAI-o1-miniOpenAI-o1-0912
AIME 2024 pass@179.2%63.6%
AIME 2024 cons@6497.3%80.0%
MATH-50096.4%90.0%
Codeforces rating2,0611,820
GPQA Diamond65.7%60.0%73.1%

GRPO+MoE+MLA+FP8——多项算法工程突破叠加的技术奇迹

DeepSeek-R1的技术突破是多年迭代积累的结果。自2023年11月发布DeepSeek-Coder以来,DeepSeek逐步在GRPO算法、DeepSeekMoE架构、MLA机制、FP8精度、MTP方法等多方面实现突破。GRPO(群组相对策略优化)算法是DeepSeek在强化学习上的核心创新,省去了传统PPO方法中需要额外训练价值网络的步骤,通过组内比较评估动作优劣,大幅节省计算资源。R1-Zero完全跳过了监督微调(SFT)阶段,仅用强化学习训练,模型自行出现了“顿悟时刻”——响应平均时长从约150 token提升至约1,800 token,学会了用更长的思维链进行深度推理思考。DeepSeek-V3的MoE架构拥有6,710亿总参数,但每个输入仅激活约370亿参数;MLA机制降低KV缓存量;FP8精度实现加速训练和减少GPU内存使用。多项技术突破的叠加,使DeepSeek能够在有限的算力资源下实现与闭源巨头相当的性能。

7天用户破亿,开源+免费重塑大模型传播范式

DeepSeek-R1采用了完全开源策略(MIT许可证),允许商用和修改,并在技术报告中详细公布训练思路。同时推出免费的C端产品,使普通用户首次体验到优质的AI推理模型。根据Questmobile数据,DeepSeek在1月28日日活首次超越豆包,2月1日突破3,000万大关。根据AI产品榜,1月DeepSeek用户增长达1.25亿(Web+App累加不去重),其中80%以上来自最后一周,即7天完成1亿用户增长,超越ChatGPT(约2个月)和TikTok(约6个月)的增速纪录。开源策略吸引了海内外开发者和研究人员的广泛关注,免费策略降低了C端用户的体验门槛,两者结合形成了“口碑传播+技术社区共振”的裂变效应,使中国大模型首次受到海外AI科技界的全面推崇认可。
点击阅读报告原文: 互联网行业专题研究:互联网大厂如何受益于DeepSeek~R1“破圈”?-250214(29页)
相关报告