返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

RetNet与Mamba架构比较

财通证券最新大模型系列报告对两种最受关注的Transformer替代架构——RetNet和Mamba进行了深入比较。RetNet由微软研究院提出,通过多尺度保留机制融合RNN和Transformer优点,首次实现训练并行性、良好性能和低推理成本这一“不可能的三角”,推理速度是带键值缓存的Transformers的8.4倍,内存节省70%。Mamba由卡内基梅隆大学等机构提出,基于状态空间模型引入选择机制,实现计算复杂度线性增长,在长序列处理上效率突出。两者各有侧重,共同探索突破Transformer局限性的可行路径。

RetNet——实现“不可能的三角”

传统架构在训练并行性、模型性能和推理成本三者中只能兼顾其二。RNN训练慢但推理快,Transformer训练快但推理慢且内存消耗大。RetNet通过引入多尺度保留机制(Retention)首次同时实现三者平衡。保留机制本质上融合了RNN的递归计算和Transformer的自注意力,有三种计算范式:并行表征使训练可充分利用GPU,加速7倍、节省25-50%内存;循环表征实现O(1)推理,无需键值缓存,部署成本和延迟大幅降低;分块循环表征对局部块并行编码、全局块循环编码,既提高速度又节省GPU内存。在实际性能上,对于7B模型和8k序列长度,RetNet的解码速度是带键值缓存的Transformers的8.4倍,内存节省70%,且推理延迟对批大小不敏感,吞吐量巨大。RetNet的Scaling曲线和上下文学习能力与标准Transformer竞争力相当。RetNet的建模长距离依赖能力仍需后续验证,实际落地应用也较少,但其“不可能的三角”突破是架构创新领域的重大进展。

Mamba——状态空间模型的线性进化

Mamba集中了RNN的循环框架、Transformer的并行计算/注意力机制和状态空间模型的线性特性。状态空间模型(SSM)是描述系统动态行为的传统数学框架,Mamba的关键创新在于引入选择机制——根据输入对SSM重新参数化,使模型在滤除不相关信息的同时无限期保留必要相关数据。硬件感知型算法使用扫描而非卷积循环计算模型,提升计算速度。Mamba-2进一步利用结构化空间状态对偶构建了将结构化SSM与多种注意力连接起来的理论框架,让原本为Transformer开发的算法和系统优化技术可迁移用于SSM。在性能上,Mamba在长序列任务上表现出色,计算开销线性增长,显著优于标准Transformer的二次方增长。但Mamba并非没有缺陷——记忆丢失、难以泛化到不同任务、在复杂模式方面的表现不及Transformer等问题仍然存在。开源社区已提出诸多改进方案(修改块设计、扫描模式、记忆管理等),为Mamba后续优化提供了方向。

RetNet vs Mamba——架构哲学与应用场景的差异

RetNet和Mamba代表了两种不同的架构哲学。RetNet的核心思路是“融合”——将RNN和Transformer的优点融合到一个框架中,通过保留机制实现多范式统一。这种思路的优势在于可以灵活切换计算范式(训练时并行、推理时循环),在不同阶段选择最优模式。RetNet更接近Transformer的“改良者”角色,保留了注意力机制的全局建模能力,但通过结构优化大幅降低了复杂度。Mamba的核心思路则是“替代”——用状态空间模型的线性特性从根本上取代Transformer的二次方注意力机制。Mamba更激进地摆脱了注意力机制,用选择机制动态调整状态空间参数来实现类似注意力的“聚焦”效果。从应用场景看,RetNet更适合需要兼顾训练效率和推理成本的通用场景,Mamba更适合超长序列处理(如基因组分析、长时间序列预测、长文档处理)。从生态看,RetNet由微软研究院提出,Mamba由学术机构主导,两者的后续发展将取决于社区采纳度和更大规模的验证结果。

从实验室到产业化——替代架构的商业化挑战

尽管RetNet和Mamba在学术基准上表现出色,但从实验室走向产业化仍面临多重挑战。第一,生态兼容性——Transformer已有完整的软件栈(PyTorch、TensorFlow、HuggingFace等),替代架构需要重建工具链和优化库。第二,大规模验证——当前RetNet和Mamba的实验规模多在1B-7B参数级别,能否在100B+的超大规模上复现性能优势尚不确定。第三,硬件适配——Transformer已深度优化了GPU架构(如FlashAttention、Tensor Core),替代架构需要新一轮的硬件-软件协同设计。第四,开发者惯性——全球AI研究人员和工程师已熟悉Transformer的编程范式,新架构的学习曲线可能减缓采纳速度。财通证券认为,替代架构的商业化落地将是一个渐进过程——短期内Transformer仍将是大模型的主流,但RetNet、Mamba等架构的突破将推动AI基础设施的长期演进,相关算力、存储、网络设备需求将持续受益。
表:RetNet与Mamba核心对比
对比维度RetNetMamba
核心机制多尺度保留机制(Retention)状态空间模型+选择机制
训练并行性支持(加速7倍)支持(卷积计算)
推理复杂度O(1)(循环表征)O(LD²)(线性)
推理速度比Transformer快8.4倍长序列优势明显
内存节省70%未明确
长距离依赖需后续验证存在记忆丢失
主要不足实际应用较少泛化能力弱,复杂模式欠佳
点击阅读报告原文: 计算机行业大模型系列报告(一):Transformer架构的过去、现在和未来-250119(26页)
相关报告