财通证券研究报告评估了DeepSeek开源周对全球AI开源生态的深远影响。2025年2月24日至28日,DeepSeek连续开源六大代码库,在GitHub上累计获得星星数量接近2.8万颗。更引人注目的是,FlashMLA代码中包含一行内联PTX(Parallel Thread Execution)指令——这标志着DeepSeek团队深入至CUDA与GPU底层机器代码之间,对并行计算和内存访问进行细粒度控制。这种“打破CUDA护城河”的做法,加上DeepSeek一贯的开源理念,正在重塑全球AI市场的竞争格局。
开源周代码库生态与社区反响
DeepSeek开源周自2月24日启动以来,陆续开源了FlashMLA、DeepEP、DeepGEMM、DualPipe和EPLB对应的优化并行策略、3FS并行文件系统和Smallpond轻量化数据处理工具。这些开源项目覆盖了AI开发的多个核心环节,从硬件性能优化、模型训练加速到数据处理效率提升。
GitHub社区反响热烈,累计获星近2.8万颗。DeepSeek官方表示:“这里没有象牙塔,只有秉持纯粹的车库创业精神和社区驱动的创新理念”。这种开放姿态与DeepSeek一贯的开源战略一脉相承——DeepSeek所有模型均为开源模型,所有应用厂商都拥有了可以比肩顶级AI的大模型,还可自行二次开发、灵活部署。开源模式正在降低AI行业的进入门槛与成本,长期看将推动总需求上升而非下降。
PTX底层优化:打破CUDA生态垄断
FlashMLA开源后,技术社区发现其中包含一行内联PTX代码。PTX(Parallel Thread Execution)是NVIDIA设计的中间语言,介于高级编程语言CUDA和GPU底层机器代码(SASS)之间。通过PTX编程,开发者可以实现寄存器分配、线程/线程束级别调整等细粒度优化,这些是CUDA C/C++等高级语言无法实现的操作。
这一发现引发了广泛讨论。此前已有报道称DeepSeek在V3模型开发中绕过了CUDA,通过对英伟达GPU的低级汇编语言PTX进行优化从而实现最大性能。在训练V3模型时,团队对H800 GPU进行了重新配置,划分出20个SM用于服务器间通信,其优化能力远超常规CUDA开发水平。FlashMLA中的内联PTX代码再次印证了DeepSeek团队深入底层、追求极致性能的工程哲学。业界人士表示,这种做法意味着CUDA的“护城河”可能不再那么难以逾越。
开源模式对AI市场格局的重塑效应
DeepSeek的开源策略正在产生深远的市场影响。一方面,开源降低了AI行业的进入门槛与成本。当顶级大模型和配套的Infra工具链全部开源时,中小企业和开发者无需巨额投入即可获得与巨头同等水平的技术能力。另一方面,开源加速了技术迭代和创新。全球开发者可以基于DeepSeek的开源代码进行二次开发和优化,形成正向循环的创新生态。
长江证券研报认为,此次DeepSeek开源代码库将围绕降本增效这一核心,通过开源模式与低成本路径,改变此前“大力出奇迹”的AI开发逻辑。民生证券指出,DeepSeek所有模型均为开源模型,降低AI行业进入门槛与成本,长期看将推动总需求上升而非下降。当模型的成本越低,AI应用的创新门槛就越低。
表4:DeepSeek开源生态核心影响维度| 影响维度 | 具体表现 | 长期趋势 |
|---|
| 技术生态 | 六大代码库全链路覆盖,GitHub星数近2.8万 | 开源社区驱动创新加速 |
| 开发门槛 | PTX底层优化打破CUDA生态限制 | 硬件优化能力普惠化 |
| 市场竞争 | 开源模型+开源Infra降低进入壁垒 | AI从垄断走向普惠 |
| 成本结构 | 推理效率大幅提升,成本利润率545% | AI商业化模型重构 |
极客精神与开源理念的行业启示
DeepSeek开源周所展现的不仅是技术实力,更是一种发展范式的启示。当AI竞争进入深水区,真正的突破往往源于对基础原理的重新思考,而非简单的规模叠加。DeepSeek团队通过将数学家的严谨、工程师的务实与开源社区的力量深度融合,正在引领AI大模型的发展方向。
这种变革带来的不仅是技术上的超越,更是一种发展范式的启示。在既有规则之外寻求突破,往往就是颠覆的开始。DeepSeek此次在海内外掀起的技术浪潮,有望松动整个AI产业链的既有秩序。从FlashMLA的内联PTX到545%的成本利润率,从全链路开源到极致工程追求,DeepSeek正在证明:在AI领域,创新的深度决定竞争的高度。