国泰君安海外科技报告指出,AI推理场景正成为ASIC芯片发挥性价比优势的主战场。随着大模型从训练走向规模化部署,推理算力需求激增,成本成为云厂商和AI应用方的核心考量。ASIC芯片在INT8/FP8精度下展现出显著高于GPU的每美元算力(TFLOPS/S),同时功耗优势突出——Meta MTIA v2功耗仅90W,仅为A100的36%。谷歌TPUv5e标价1.2美元/芯片/小时,较TPUv4降低63%。AI推理芯片的性价比竞争正在重塑算力供给格局。
推理场景——ASIC性价比优势最显著的领域
AI推理与训练对芯片的需求存在本质差异:训练强调高精度和大规模并行计算能力,推理则更关注低延迟、高吞吐和单位算力成本。ASIC针对特定算法和模型架构优化,在推理场景中展现出突出的性价比优势。从单卡算力看,ASIC普遍低于H100,但由于成本显著更低,在INT8/FP8精度下ASIC的每美元算力(TFLOPS/S)显著高于GPU。以Meta MTIA v2为例,INT8稠密算力354 TFLOPS,稀疏算力708 TFLOPS,功耗仅90W,价格预计2000至3000美元。A100 INT8算力约624 TFLOPS(稀疏),功耗250W,价格约1万美元。MTIA v2以不到A100三分之一的功耗和五分之一的成本,实现了超一半的算力,性价比优势突出。
ASIC推理芯片的核心设计理念——计算、内存、通信的平衡
梳理近年计算系统可以发现,存储和通信带宽提升速度慢于计算性能,影响了工作负载的表现。当前工作负载很大一部分时间被网络通信占据。Meta在设计MTIA时明确提出寻求计算能力、存储带宽和通信带宽三个维度的平衡。MTIA v2采用LPDDR5片外内存(128GB容量,204.8GB/s带宽)和超大片上SRAM(256MB,2.7TB/s带宽),每个PE内存384KB(1TB/s带宽)。相比之下,A100 L2缓存仅40MB,每个SM内存192KB。更大的片上内存有助于降低推理时延,提升吞吐量。MTIA v2对低复杂度和高复杂度的排名推荐模型均适用,由于Meta对整个软件堆栈的掌握程度高,实际运行中可实现比GPU更高的效率。
成本结构与TCO——ASIC规模部署的经济学
从总拥有成本(TCO)角度看,ASIC在推理场景的优势更为明显。芯片采购成本方面,MTIA v2预计2000至3000美元,A100约1万美元,H100约2.5万至3万美元。运营成本方面,MTIA v2功耗90W,按0.10美元/kWh电费计算,年电费约79美元;A100功耗250W,年电费约219美元;H100功耗700W,年电费约613美元。散热成本与功耗正相关,低功耗芯片可显著节约数据中心散热开支。谷歌TPUv5e标价1.2美元/芯片/小时,TPUv4公开标价3.22美元/芯片/小时,TPUv5e以更低成本实现更高算力。随着AI推理需求从百万级token向千亿级token演进,ASIC的规模部署将成为云厂商降低推理成本、提升ROI的关键路径。
表:AI推理芯片性价比对比| 芯片 | INT8算力(TFLOPS) | 功耗(W) | 估算价格(美元) | 性价比(TFLOPS/$) |
|---|
| MTIA v2 | 708(稀疏) | 90 | 2,000-3,000 | 0.24-0.35 |
| A100 | 624(稀疏) | 250 | 10,000 | 0.06 |
| TPUv5e | 394 | — | — | 高 |