AI模型蒸馏技术正成为提升推理能力的关键路径。DeepSeek-R1使用挑选的80万个样本,直接微调了Qwen和Llama等开源模型,结果表明简单的蒸馏方法显著增强了较小模型的推理能力。DeepSeek-R1-Distill-Qwen-32B在AIME 2024上达72.6%的pass@1,而依赖大规模RL训练的模型仅达47.0%。华泰证券指出,蒸馏策略既经济又有效,让小模型在推理能力上实现了“平权”,但要超越智能边界仍需更强大的基础模型和更大规模的强化学习。本报告基于华泰证券2025年1月发布的《DeepSeek模型深度解析》,深入分析AI模型蒸馏技术。
AI模型蒸馏技术总览
蒸馏是一种将大型复杂模型(教师模型)的知识迁移到小型模型(学生模型)的技术。主要步骤包括:训练性能较好的大模型(教师模型)、用大模型在训练数据上生成软标签(对样本进行预测时输出的概率分布)、使用小模型通过软标签和真实标签进行训练。DeepSeek-R1产品协议明确允许“模型蒸馏”,全部模型开源,包括DeepSeek-R1-Zero、DeepSeek-R1以及基于Qwen和Llama从DeepSeek-R1中蒸馏的六个密集模型(1.5B、7B、8B、14B、32B、70B)。华泰证券认为,蒸馏技术是AI模型降本增效的核心手段。
蒸馏效果验证:小模型的“推理平权”
DeepSeek-R1-Distill-Qwen-32B在AIME 2024 pass@1达72.6%、MATH-500达94.3%、GPQA Diamond达62.1%、LiveCode Bench达57.2%。最小1.5B模型在AIME 2024上仍达28.9%的pass@1。蒸馏后的32B模型性能超越了更大规模的QwQ-32B-Preview(50.0%)。在Qwen-32B-Base上使用数学、代码和STEM数据进行大规模RL训练(超10K步)得到DeepSeek-R1-Zero-Qwen-32B,AIME 2024得分仅47.0%。华泰证券指出,这一对比证明蒸馏策略既经济又有效,让小模型在RL上实现了“平权”。
蒸馏与RL的关系:互补而非替代
DeepSeek-R1论文明确指出两点结论:将更强大的模型蒸馏成更小的模型可以取得优异结果,而依赖大规模RL的小模型需要巨大计算能力,甚至可能达不到蒸馏的性能;虽然蒸馏策略既经济又有效,但要超越智能边界可能仍需更强大的基础模型和更大规模的强化学习。基础模型强的厂商做小模型同样更有优势,尤其是对于RL算法。华泰证券认为,蒸馏与RL是互补关系——蒸馏用于高效传播模型能力,RL用于探索智能边界。
蒸馏技术的产业影响
全部模型开源使开发者可以基于DeepSeek-R1的蒸馏模型快速构建应用。最小的1.5B模型可在端侧设备运行,最大的70B模型可在服务器部署。微软CEO纳德拉表示,Copilot+ PC未来将能本地运行DeepSeek的R1蒸馏模型。华泰证券认为,模型蒸馏技术的成熟将大幅降低AI应用的部署门槛——小模型可嵌入手机、PC、IoT设备等端侧硬件,实现本地化AI推理,同时保持接近大模型的推理能力。
表:蒸馏模型与RL训练效果对比(AIME 2024)| 模型 | pass@1 | cons@64 |
|---|
| DeepSeek-R1-Distill-Qwen-32B(蒸馏) | 72.6% | 83.3% |
| DeepSeek-R1-Zero-Qwen-32B(RL) | 47.0% | 60.0% |
| QwQ-32B-Preview | 50.0% | 60.0% |