财通证券最新大模型系列报告深入分析了线性注意力机制的演进方向。线性注意力通过对传统Softmax注意力进行线性化处理,将计算复杂度从O(N²)降至O(N),是突破Transformer架构效率瓶颈最具产业化前景的技术路线之一。目前该方向已涌现出Agent Attention(代理注意力)、TransNormerLLM(首个完全线性注意力大模型)和MiniMax-01(首个商用级线性注意力模型)等代表性成果。财通证券认为,线性注意力机制正从学术研究走向产业落地,有望在不牺牲模型性能的前提下大幅降低长序列处理的计算成本,是Transformer升级最现实的路径之一。
线性注意力——从Softmax到线性运算的范式转换
传统Transformer的Softmax注意力机制虽强大但计算密集,其计算复杂度O(N²d)在处理长序列时成为瓶颈。线性注意力机制的核心思想是对Softmax操作进行数学近似或分解,将注意力计算从O(N²)降至O(N)。具体而言,Softmax注意力矩阵可分解为三个线性运算的乘积:查询Q和键K的相似度通过非线性Softmax归一化,而线性注意力则通过核函数近似(如φ(Q)φ(K)^T)替换Softmax,使计算顺序从(QK^T)V变为Q(K^TV),后者先计算K^T·V(复杂度O(d²))再乘Q,避免了N×N矩阵的计算和存储。这种看似简单的运算顺序调整,使复杂度从O(N²d)降至O(Nd²),当序列长度N远大于特征维度d时(实际中往往如此),效率提升显著。线性注意力因此得以在保持全局建模能力的同时高效处理超长序列,为大模型突破上下文窗口限制提供了可行的技术路径。
Agent Attention与TransNormerLLM——学术前沿的突破
Agent Attention由Dongchen Han等研究者提出,在传统注意力模块中引入一组额外的代理向量A(数量远少于序列长度N)。这些代理向量作为“中间人”,先从键K和值V中高效聚合全局信息,再将信息广播回查询Q,使Q不必与每个K直接交互,计算复杂度从O(N²)降至O(N)。更重要的是,Agent Attention成功将Softmax注意力与线性注意力无缝集成,形成一种“混合范式”——具备高表达能力的同时拥有低计算复杂度。实验表明,Agent Attention在多种视觉Transformer模型及不同视觉任务中表现出色,处理高分辨率场景时效果更显著。TransNormerLLM由上海AI实验室和OpenNLPLab共同开发,是首个完全放弃Softmax注意力的线性注意力Transformer大模型。其关键技术LightningAttention将输入分割成多个块分别计算,减少内存访问次数,将线性注意力训练速度提升2倍、内存用量减少4倍。TransNormerLLM在相同模型大小下支持的上下文长度显著优于标准Transformer(7B模型支持48K vs 37K),且相对速度更快、内存需求更低,验证了线性注意力在超大模型上的可行性。
MiniMax-01——商用级线性注意力的里程碑
2025年初发布的MiniMax-01是线性注意力从学术走向产业的关键里程碑,首次将线性注意力机制扩展到商用模型的级别。MiniMax-Text-01架构以结构化方式整合线性注意力和Softmax注意力,其核心创新在于两点:第一,Lightning Attention技术将原生Transformer复杂度从O(N²)大幅降至O(N),得益于“右乘技巧”即先计算K^T·V;第二,Hybrid-lightning方案每隔8层将Lightning Attention替换为Softmax注意力,这一设计既解决了纯线性注意力在scaling能力上的不足,也保留了Softmax注意力的强大建模能力。MiniMax-01证明了线性注意力在商用规模(百亿至千亿参数)下的可行性和有效性,消除了市场对线性注意力“只是学术玩具”的疑虑。从产业意义看,线性注意力的商用化意味着大模型处理超长上下文(如整本书籍、完整代码库、长时间视频)的成本将大幅下降,有望催生新的应用场景(如AI写书、AI代码库理解、AI视频分析)。
线性注意力与产业落地——算力需求的再平衡
线性注意力的推广将改变大模型算力需求的结构。传统Transformer的计算资源消耗主要集中在注意力矩阵的计算和存储上,线性注意力将这部分开销从O(N²)降至O(N),使长序列任务的算力需求大幅下降。这意味着:第一,推理成本降低——处理长上下文的每次查询成本下降,AI应用的商业化模型更清晰;第二,训练效率提升——更快的训练速度意味着更短的迭代周期,加速模型创新;第三,设备门槛降低——线性注意力使在边缘设备(手机、PC)上运行大模型成为可能,推动端侧AI的普及。但线性注意力也有其短板——建模长距离依赖能力仍弱于标准Transformer,这限制了其在某些任务(如复杂推理、长程依赖理解)上的表现。财通证券认为,线性注意力和Softmax注意力将长期共存,Hybrid方案(如MiniMax-01的交替结构)将是产业落地的主流选择。这种“混合模式”既保证了模型性能又控制了计算成本,兼顾了效果与效率。
表:线性注意力演进关键里程碑| 成果 | 核心创新 | 关键指标 | 意义 |
|---|
| Agent Attention | 引入代理向量高效聚合信息 | Softmax+线性混合 | 高表达+低复杂度 |
| TransNormerLLM | 完全线性注意力、LightningAttention | 训练速度2倍、内存减4倍 | 首个线性注意力大模型 |
| MiniMax-01 | Hybrid-lightning交替结构 | 商用级别、复杂度O(N) | 线性注意力产业化里程碑 |