返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

大模型计算效率提升趋势

财通证券最新大模型系列报告指出,大模型计算效率的低下正成为制约AI产业发展的核心瓶颈。从2018年BERT-Large的3.4亿参数到2024年GPT-4的约1.8万亿参数,参数规模增长了5000倍,但计算复杂度也随之从O(N)跃升至O(N²),导致训练成本从数万美元飙升至超1亿美元。报告系统梳理了计算效率提升的关键技术方向:线性注意力将复杂度降至O(N)、Mamba状态空间模型实现线性增长、RetNet推理加速8.4倍。财通证券认为,计算效率革命将决定AI产业能否实现从“实验室玩具”到“普惠化基础设施”的跨越。

算力膨胀的“囚徒困境”——万亿参数背后的效率代价

大模型规模的膨胀正在形成一个“囚徒困境”:更大的模型带来更强的能力,但更强的能力需要更多的算力,更多的算力又推高了成本,使得只有少数科技巨头能参与前沿竞赛。GPT-4参数约1.8万亿,单次训练成本估算超1亿美元;GPT-5的预期训练成本可能更高。这种模式的不可持续性日益凸显。自注意力机制的计算复杂度O(N²d)是效率问题的根源——当处理长序列时,每个token都需要与所有其他token计算注意力权重,计算量随序列长度平方增长。这意味着上下文长度从4K扩展到1M,计算量增加约62500倍。当前大模型支持的上下文长度虽已有所拓展,但这是通过改进注意力机制换来的,计算效率的边际改善正在放缓。真正的智能不应仅是数据量的堆积,而应是对信息的压缩和提炼——类似于通过总结第一性原理获取更深层次的智能。当前AI的局限性或在于其学习效率的低下,而非数据不足。

线性注意力——从O(N²)到O(N)的范式突破

线性注意力机制通过将Softmax注意力矩阵分解为两个低维矩阵的乘积,将计算复杂度从O(N²)降至O(N)。这并非简单的工程优化,而是算法层面的根本性变革。Agent Attention在传统注意力中引入代理向量A,高效聚合键K和值V的信息再广播回查询Q,在保持全局建模能力的同时大幅降低计算开销。TransNormerLLM由上海AI实验室和OpenNLPLab开发,首个完全放弃Softmax注意力的线性注意力Transformer大模型,采用LightningAttention技术将训练速度提升2倍、内存减少4倍,在相同模型大小下支持的上下文长度显著优于标准Transformer。MiniMax-01首次将线性注意力扩展到商用模型级别,采用Hybrid-lightning方案(每隔8层交替使用线性与Softmax注意力),兼顾了效率与scaling能力。线性注意力机制的核心价值在于使大模型处理超长文本(如整本书籍、完整代码库、长时间序列数据)成为可能,而无需承受二次方级算力开销。目前线性注意力建模长距离依赖能力仍弱于标准Softmax注意力,但这正是学界和工业界着力攻克的方向。

状态空间模型与RetNet——线性复杂度架构的突破

状态空间模型(SSM)是另一条实现线性复杂度的技术路线。SSM是一种描述系统随时间动态变化的数学框架,Mamba引入选择机制让模型根据输入动态调整状态空间参数,在滤除不相关信息的同时无限期保留必要数据,计算复杂度线性增长(O(LD²)而非O(L²D))。Mamba-2进一步利用结构化空间状态对偶构建了将结构化SSM与多种注意力连接起来的理论框架。在实际表现中,Mamba在长序列任务上展现出比Transformer更高的效率,但在复杂模式理解方面仍有差距。RetNet则从另一角度切入——多尺度保留机制融合RNN和Transformer优点,并行表征支持训练加速7倍、循环表征实现O(1)推理、分块循环表征高效处理长序列。RetNet的推理速度是带键值缓存的Transformers的8.4倍,内存节省70%,同时Scaling曲线和上下文学习表现具有竞争力。RWKV通过RNN变体实现线性复杂度,运行和训练时对VRAM、CPU、GPU等资源需求更低,与较大上下文Transformer相比计算需求降低10-100倍,且支持“无限”上下文长度。

计算效率提升的产业影响——从“奢侈品”到“基础设施”

计算效率的提升对大模型产业的商业化路径具有决定性影响。当前大模型的训练和推理成本居高不下,严重制约了应用的普及。如果计算效率能实现数量级的提升,推理成本将从“每次查询数美分”降至“每次查询数美分”,大规模商业化应用(如AI客服、AI编程助手、AI教育)的商业模式将更加清晰。更高效的计算也意味着更低的能耗——数据中心电力消耗的快速增长是AI可持续发展的重大挑战,线性复杂度的架构有望将长序列任务的能耗降低数个数量级。从产业格局看,计算效率革命将降低AI模型的准入门槛,中小企业和开发者将有能力在合理成本下部署和运行大模型,AI生态将从“巨头垄断”走向“百花齐放”。财通证券认为,计算效率提升将催生新的基础设施需求——高性能GPU、AI芯片、液冷设备、数据中心等环节将持续受益,但受益逻辑将从“算力堆砌”转向“效率优化”。
表:大模型计算效率关键技术对比
技术路线时间复杂度关键突破代表性模型效率提升
标准TransformerO(N²d)自注意力机制GPT-4、BERT基线
线性注意力O(Nd²)Softmax线性化MiniMax-01、TransNormer复杂度降一个数量级
MambaO(LD²)状态空间+选择机制Mamba-2线性增长
RetNetO(1)推理多尺度保留RetNet推理快8.4倍
RWKVO(N)RNN变体+token shiftRWKV-7算力需求低10-100倍
点击阅读报告原文: 计算机行业大模型系列报告(一):Transformer架构的过去、现在和未来-250119(26页)
相关报告