DeepSeek正在用强化学习重新定义大模型训练范式。财通证券研报显示,DeepSeek-R1-Zero成为首个完全摒弃监督微调(SFT)、完全依赖强化学习训练的大语言模型,AIME 2024成绩随RL训练稳定提升。经R1蒸馏的Qwen-32B在AIME 2024达72.6%,远超直接强化学习的版本(47.0%)和QwQ-32B-Preview(50.0%)。GRPO算法构建智能体群体间的相对优势评估机制,实现训练效率与模型性能的双重提升。
DeepSeek-R1-Zero:纯强化学习训练的开创性验证
DeepSeek-R1-Zero在技术路线上实现了突破性创新,成为首个完全摒弃监督微调环节、完全依赖强化学习训练的大语言模型。传统上,SFT作为大模型训练的核心环节,需要先通过人工标注数据进行监督训练,再结合强化学习进行优化,这一范式曾被认为是ChatGPT成功的关键技术路径。
DeepSeek-R1-Zero以DeepSeek-V3-Base为基础,通过群组相对策略优化(GRPO)算法实现训练效率与模型性能的双重提升。GRPO通过构建智能体群体间的相对优势评估机制,在策略优化过程中最大化群体得分,同时设计了包含准确性奖励和格式规范奖励的多维度奖励模型,确保生成内容在保持正确性的基础上具备清晰的推理逻辑。
随着RL训练推进,DeepSeek-R1-Zero的AIME 2024基准测试成绩稳定且持续提升。这证明了无监督或弱监督学习方法在提升模型推理能力方面的巨大潜力,验证了后训练阶段强化学习Scaling Law的有效性,为行业提供了全新的技术路线参考。
DeepSeek-R1在此基础上进一步改进,通过引入冷启动数据,并历经推理导向强化学习、拒绝采样、监督微调以及全场景强化学习的多阶段训练,充分发挥了强化学习的自学习和自进化能力。
QwQ-32B-Preview与Qwen-32B模型基准测试对比| 模型 | AIME 2024 | MATH-500 | GPQA Diamond |
|---|
| QwQ-32B-Preview | 50.0% | 90.6% | 54.5% |
| DeepSeek-R1-Zero-Qwen-32B(直接RL) | 47.0% | 91.6% | 55.0% |
| DeepSeek-R1-Distill-Qwen-32B(蒸馏) | 72.6% | 94.3% | 62.1% |
推理能力蒸馏:大模型向小模型的范式转移
DeepSeek团队深入探索了将R1的推理能力蒸馏到更小模型中的潜力。利用DeepSeek-R1生成的800K数据对Qwen和Llama系列的多个小模型进行了微调,并发布了DeepSeek-R1-Distill系列模型。
研究发现,经过R1蒸馏的小模型在推理能力上实现了显著提升,甚至超过了在这些小模型上直接进行强化学习的效果。对比实验显示,直接在Qwen-32B-Base上进行的强化学习仅达到QwQ-32B-Preview的水平,而经过R1蒸馏的Qwen-32B模型则远超两者,证明了R1学到的推理模式具有很强的通用性和可迁移性,能够通过蒸馏有效传递给其他模型。
这一技术方向为业界提供了新的启示:对小模型而言,蒸馏优于直接强化学习,大模型学到的推理模式在蒸馏中得到了有效传递。这意味着企业可以通过蒸馏技术,将大模型的推理能力高效压缩到小模型中,从而在端侧设备上实现高性能推理,大幅降低部署成本和门槛。
GRPO算法:强化学习效率提升的关键
GRPO(Group Relative Policy Optimization,群组相对策略优化)是DeepSeek实现强化学习效率突破的核心算法创新。该算法通过构建智能体群体间的相对优势评估机制,在策略优化过程中最大化群体得分,相比传统的PPO等算法,显著降低了计算成本。
GRPO同时设计了多维度奖励模型,包含准确性奖励和格式规范奖励,确保生成内容在保持正确性的基础上具备清晰的推理逻辑。这种多维度的奖励设计使模型在学习推理能力的同时,保持了输出的结构化和可解释性。
DeepSeek的强化学习突破验证了o1类模型的技术路线可行性和有效性,同时提供了开源实现。DeepSeek几乎将所有研究成果直接开源,使全球AI开发者能够基于这些技术进行二次开发,有望加速整个AI产业的推理能力提升。