国泰君安海外科技报告指出,AI芯片的性能发挥不仅取决于硬件,配套软件生态同样关键。英伟达CUDA以380万注册开发者和先发优势占据主导,但AMD ROCm、英特尔oneAPI等开源平台正加速追赶。云厂商谷歌、Meta、微软、亚马逊均为AI ASIC研发了全栈软件生态,从编译器到运行时全面自研。软件生态正从CUDA单一主导走向多元化、开放化,为ASIC的规模化部署扫清软件障碍。
CUDA——难以撼动的软件生态护城河
CUDA于2006年发布,是NVIDIA专为GPU通用计算开发的并行计算平台和编程模型。2023年CUDA注册开发者数量达380万,从2016年的50万持续增长。CUDA拥有庞大的开发者生态和成熟的软件库:cuBLAS(线性代数)、cuFFT(傅里叶变换)、cuDNN(深度神经网络)、cuRAND(随机数生成)等,被广泛集成至TensorFlow、PyTorch等主流深度学习框架。CUDA与NVIDIA硬件紧密集成,代码直接编译至GPU指令集,内核执行效率通常高出OpenCL等实现60%。CUDA的护城河在于:先发优势(2006年发布,早于竞争对手十余年)、与硬件的高度绑定优化、全面覆盖的软件库、以及庞大的开发者社区。
开源追赶者——ROCm与oneAPI
AMD推出ROCm开源平台,提供编译器、库、HIP编程语言等工具。开发人员可通过HIP和OpenCL两种编程模型实现CUDA代码向ROCm迁移,目前已推出ROCm 6。ROCm支持AMD GPU全系列产品,并在Linux生态中持续完善。英特尔推出oneAPI,支持跨CPU、GPU、FPGA、AI加速器编程,旨在为异构计算提供与供应商无关的解决方案。oneAPI基于SYCL和C++,可一次编写、多处部署。国内厂商方面,摩尔线程构建MUSA架构,借助MUSIFY工具将CUDA代码迁移至MUSA平台;壁仞科技开发BIRENSUPA平台兼容CUDA;华为推出CANN软件生态,兼容MindSpore、TensorFlow、PyTorch等框架。
云厂商自研软件生态——从依赖走向自主
云厂商普遍具备较强研发能力,均为AI ASIC研发配套全栈软件生态。谷歌提供Cloud TPU Multislice Training全栈服务,XLA即时编译器将机器学习框架的图编译为TPU机器代码,支持TensorFlow、PyTorch、JAX。Meta的MTIA软件堆栈与PyTorch 2.0、TorchDynamo、TorchInductor完全集成,并创建Triton-MTIA编译器后端,极大提高开发人员效率。微软为Maia 100集成PyTorch、ONNX Runtime等开源框架,与OpenAI合作构建Triton开源平台,通过抽象底层硬件简化内核创作。AWS构建三层生成式AI堆栈,提供Neuron SDK开发工具包,开发者可轻松将GPU实例迁移至Trainium。随着云厂商全栈自研能力提升,CUDA的迁移成本持续降低,ASIC软件生态正从“追赶CUDA”走向“超越CUDA的特定场景优化”。
表:AI芯片软件生态对比| 软件生态 | 所属公司 | 支持硬件 | 核心特点 |
|---|
| CUDA | 英伟达 | NVIDIA GPU | 380万开发者,生态最成熟 |
| ROCm | AMD | AMD GPU | 开源,支持CUDA代码迁移 |
| oneAPI | 英特尔 | CPU/GPU/FPGA/AI加速器 | 跨架构,供应商无关 |
| TPU软件栈 | 谷歌 | TPU | XLA编译器,Multislice训练 |
| MTIA软件堆栈 | Meta | MTIA | PyTorch完全集成 |
| Neuron SDK | 亚马逊 | Trainium/Inferentia | TensorFlow/PyTorch原生集成 |