国泰君安证券研究所报告指出DeepSeek的开源策略将重塑AI产业格局,打破少数科技巨头在AI领域的技术垄断。DeepSeek已将模型完整开源,包括DeepSeek-R1-Zero、DeepSeek-R1以及基于Qwen和Llama的六个蒸馏模型(参数规模从1.5B到70B),均采用MIT许可协议发布,允许免费商用、任意修改和衍生开发、支持二次蒸馏训练。DeepSeek在当下的AI时代将扮演重要角色,就像Android之于移动互联网革命,将重构产业生态、引发链式反应,加速上层应用发展与下层系统统一。
DeepSeek开源策略:MIT协议下的全面开放
DeepSeek已将模型完整开源,包括DeepSeek-R1-Zero、DeepSeek-R1以及基于Qwen和Llama的六个蒸馏模型(参数规模分别为1.5B、7B、8B、14B、32B和70B)。这些模型均采用MIT许可协议发布在Hugging Face平台上,可以免费商用、允许任意修改和衍生开发、支持进行二次蒸馏训练。MIT协议被称为最宽松的开源协议之一,主要因为其赋予开发者极大的自由度,同时保留了原作者的基本权利。
MIT协议允许将开源软件用于商业用途,为企业的技术创新提供了灵活性。企业可以在MIT协议下的开源软件基础上进行开发,降低研发成本,同时推动技术的商业化应用。MIT协议的宽松性吸引了大量开发者参与开源项目,促进了开源社区的发展。这种开放的生态模式不仅促进了技术的交流与合作,还推动了AI技术的标准化和规范化发展。通过开源,DeepSeek等项目吸引了大量开发者,形成了蓬勃发展的社区。
蒸馏小模型弯道超车,比肩OpenAI o1-mini
DeepSeek通过模型蒸馏技术,将R1的推理能力蒸馏到其他模型中,生成高质量训练样本并用于监督微调,提升小模型的推理能力。经过R1蒸馏的小模型在推理能力上实现了显著提升,甚至超过了在这些小模型上直接进行强化学习的效果。对小模型而言,蒸馏优于直接强化学习,大模型学到的推理模式在蒸馏中得到了有效传递。
R1-Distill-Qwen-32B在AIME 2024上取得72.6%的惊人成绩,在MATH-500上得分94.3%,在LiveCodeBench上得分57.2%,这些结果显著优于之前的开源模型,并与o1-mini相当。R1-Distill-Llama-70B在AIME 2024达70.0%,GPQA Diamond达65.2%,Codeforces评分1633。六款蒸馏小模型覆盖从1.5B到70B的完整参数范围,使不同规模的企业和开发者都能找到适合自身需求的模型版本。
DeepSeek重构AI产业生态
开源模型DeepSeek在当下的AI时代将扮演重要角色,就像Android之于移动互联网革命。当年谷歌通过开源安卓消除了硬件制造商使用操作系统的成本障碍,使三星、华为、小米等众多厂商能够基于安卓开发设备,迅速扩大安卓覆盖面。随着搭载安卓系统的设备数量急剧增加,吸引了大量开发者,形成了良性循环,推动安卓设备市场份额不断增长。
DeepSeek的开源策略显著降低了AI应用的成本,推动了AI技术的普及。通过降低硬件依赖和训练成本,DeepSeek让更多企业能够负担得起AI技术的开发和应用。DeepSeek的低成本优势使一些中小银行也开始着手研发专属金融大模型,推动了金融行业的AI应用创新。DeepSeek的开源策略也促进了AI技术在医疗、教育、制造等垂直领域的深度渗透。
DeepSeek的开源和低价策略对国际上依靠高收费的主流AI工具带来巨大冲击。那些闭源且高收费的AI产品在DeepSeek开源免费或低成本的模式对比下优势不再明显。DeepSeek抓住填补生态位的绝佳机会,为需要基础模型支持的企业和开发者提供了新的选择。未来随着端侧AI与多模态技术的深化,DeepSeek有望进一步推动AI从“技术红利”向“普惠价值”演进。
| 模型 | AIME 2024 | MATH-500 | GPQA Diamond | Codeforces评分 |
|---|
| o1-mini | 63.6% | 90.0% | 60.0% | 1820 |
| DeepSeek-R1-Distill-Qwen-32B | 72.6% | 94.3% | 62.1% | 1691 |
| DeepSeek-R1-Distill-Llama-70B | 70.0% | 86.7% | 65.2% | 1633 |
| DeepSeek-R1-Distill-Qwen-14B | 69.7% | 93.9% | 59.1% | 1481 |