2025年1月20日,DeepSeek正式发布DeepSeek-R1系列模型,包括R1-Zero、R1和R1-Distill三组模型。财通证券报告指出,DeepSeek-R1在AIME 2024基准测试中取得79.8%的成绩,略高于OpenAI-o1-1217的79.2%,在MATH-500上取得97.3%的惊人成绩,与o1正式版表现相当。R1-Zero更是在技术路线上实现突破性创新——成为首个完全摒弃监督微调、完全依赖强化学习训练的大语言模型。671B总参数、37B激活参数的MoE架构,搭配仅为OpenAI o1约1/27的API定价,DeepSeek-R1正在重塑大模型竞争格局。
DeepSeek-R1的基准测试表现——与OpenAI o1正式版正面竞争
DeepSeek-R1在多个权威基准测试中展现了与全球最先进闭源模型并驾齐驱的推理能力。在AIME 2024数学推理测试中,R1取得79.8%的pass@1成绩,略高于OpenAI-o1-1217的79.2%;在MATH-500上,R1取得97.3%的惊人成绩,与o1-1217表现相当并明显优于其他模型。
编程能力方面,DeepSeek-R1在Codeforces竞赛中取得2029 Elo评级,表现优于96.3%的人类参与者。在LiveCodeBench代码竞赛任务中,R1以65.9%的pass@1成绩超越Claude-3.5-Sonnet-1022的38.9%和GPT-4o的32.9%。对于软件工程相关的SWE Verified任务,R1的表现(49.2%)略优于OpenAI-o1-1217(48.9%)。
中文评测方面,R1在C-Eval上达91.8%,在CLUEWSC上达92.8%,体现了良好的多语言处理能力。从架构角度看,DeepSeek-R1采用MoE(混合专家)架构,总参数671B,激活参数仅37B,在保证推理性能的同时保持了较高的计算效率。
表:DeepSeek-R1与OpenAI o1关键基准测试对比| 基准测试 | DeepSeek-R1 | OpenAI-o1-1217 | DeepSeek-V3 |
|---|
| AIME 2024 (pass@1) | 79.8% | 79.2% | 39.2% |
| MATH-500 (pass@1) | 97.3% | 96.4% | 90.2% |
| Codeforces Rating | 2029 | 2061 | 1134 |
| GPQA Diamond | 71.5% | 75.7% | 59.1% |
| LiveCodeBench | 65.9% | 63.4% | 36.2% |
R1-Zero——纯强化学习的范式革命
DeepSeek-R1-Zero在技术路线上实现了突破性创新,成为首个完全摒弃监督微调环节、完全依赖强化学习训练的大语言模型。传统上,SFT作为大模型训练的核心环节,需要先通过人工标注数据进行监督训练,再结合强化学习进行优化,这一范式曾被认为是ChatGPT成功的关键技术路径。
R1-Zero以DeepSeek-V3-Base为基础,通过群组相对策略优化(GRPO)算法实现训练效率与模型性能的双重提升。该算法通过构建智能体群体间的相对优势评估机制,在策略优化过程中最大化群体得分,同时设计了包含准确性奖励和格式规范奖励的多维度奖励模型。
随着RL训练逐步推进,R1-Zero的性能稳定且持续提升。在AIME 2024基准测试中,模型平均pass@1得分从初始的15.6%持续提升至71.0%,最终达到与OpenAI-o1-0912相当的性能水平。这一技术突破验证了强化学习在提升大模型推理能力方面的有效性,更揭示了语言模型通过自主演化机制实现能力跃迁的可能性。
“顿悟现象”——AI自主推理能力的涌现
DeepSeek-R1-Zero在训练过程中出现了一个引人注目的现象——“顿悟现象”(Aha Moment)。在训练的中期阶段,模型会自发地重新评估之前的步骤,并进行反思,还会探索解决问题的替代方法,类似于人类的“灵光一现”。
报告中的示例显示,模型在求解复杂方程的过程中,当发现之前的推导可能有误时,出现了“Wait, wait. Wait. That's an aha moment I can flag here.”的自我反思,随后重新审视并修正了解题步骤。这种自发涌现的复杂行为展示了纯强化学习训练的巨大潜力。
这一发现对AI研究具有深远意义。传统上,复杂的推理能力被认为需要大量的人类标注数据来教导模型“如何思考”。而R1-Zero证明,通过强化学习提供正确的激励信号,模型可以自主探索并发展出先进的问题解决策略,无需人类明确教导推理过程。
DeepSeek-R1的架构与训练——冷启动+多阶段强化学习
DeepSeek-R1在R1-Zero的基础上进行了改进,在保留大规模强化学习的同时对齐真实场景需求。训练流程分为四个阶段。
第一阶段引入冷启动数据。针对R1-Zero存在的可读性和语言混杂问题,R1通过引入数千条高质量的、包含长推理链(CoT)的冷启动数据,对DeepSeek-V3-Base模型进行了初始微调,显著提升了模型的可读性和多语言处理能力。
第二阶段进行推理导向强化学习。在冷启动数据基础上,使用与R1-Zero相同的大规模RL训练过程,重点提升模型在推理密集型任务上的性能。为解决语言混合问题,引入了语言一致性奖励,鼓励模型在CoT中使用目标语言。
第三阶段进行拒绝采样和监督微调。在RL接近收敛时,结合拒绝采样和多领域的数据集,生成包含推理数据和非推理数据的新SFT数据,涵盖写作、角色扮演、问答等领域以提升模型的通用能力,最终收集了约20万个与非推理训练样本相关的数据。
第四阶段进行全场景强化学习。使用包含推理和非推理数据的SFT数据集对模型进行微调,进行第二轮RL以进一步优化推理能力和通用性,分别对模型的帮助性和无害性进行训练。