返回顶部
返回首页 会员充值 我的足迹 返回上一页

【东吴证券】汽车行业深度报告:AI系列深度08期:GAN与Diffusion两类生成范式有何差异?-260731(12页).pdf

2026-07-31
文档编号:1284215
文档页数:12
文档大小:596.59KB
下载积分:VIP专享
文档格式:PDF
核心结论速览: 生成模型核心目标:学习数据背后的整体分布,并据此生成此前不存在的新样本。与判别模型负责识别和分类不同,生成模型回答的是如何从噪声、潜变量或条件输入中生成图像、视频、声音和动作。 五条演进脉络:VAE代表显式概率和潜变量建模,GAN点燃高真实感图像生成,自回归路线把图像当作token序列逐步预测,DDPM重塑扩散范式,得分匹配与流匹配将扩散、得分模型和连续生成路径纳入统一视角。 GAN与Diffusion四维差异:采样速度(一步vs多步)、训练稳定性(对抗博弈vs去噪回归)、样本多样性(易模式崩溃vs覆盖更全)、可控性(原生较弱vsCFG/ControlNet丰富手段)。 通用主线已转向Diffusion:Stable Diffusion、DALL-E2、Sora、Veo、可灵等均体现这一趋势。扩散与Transformer结合的DiT证明生成路线可接入规模化骨干。 GAN并未退出:对抗思想仍在对抗蒸馏、一步生成和扩散提速中回流;一致性模型、整流流、流匹配等方法也在持续改善采样效率。 数字AI与物理AI分工:数字AI底座模型发展路径已逐渐清晰,价值在于确定性;物理AI将成为物理世界的AI解决方案,增量更大,智能驾驶作为最先跑通闭环的代表场景应重点关注。H2:研究背景与全景图谱——从识别世界到生成世界的范式跃迁。生成模型是表征体系从编码走向解码的重要环节。相较于CNN/ViT、RNN/Transformer等模型回答如何读取数据并形成表征,生成模型则进一步回答如何基于噪声、潜变量或条件输入生成新数据。判别式模型的核心是学习类别边界,回答“这是什么”;生成式模型的核心是还原数据分布,回答“如何生成一个符合分布的新样本”。从文生图、文生视频到自动驾驶场景仿真、机器人动作生成,底层均涉及生成模型。GAN与Diffusion是过去十余年最具代表性的两条路线,前者以生成器和判别器的对抗博弈为核心,后者以加噪和去噪过程为核心。当前图像和视频生成的通用主线已转向Diffusion及其流匹配变体,主要原因在于GAN训练不稳定、易模式崩溃且规模化难度较高,而Diffusion在训练稳定性、分布覆盖和条件控制上优势更突出。(数据来源:东吴证券《AI系列深度08期:GAN与Diffusion两类生成范式有何差异?》)。H2:服务商生态分析——生成模型的竞争格局与技术路线分工。生成模型领域的技术路线分工已逐步清晰,形成了多路线并存的竞争格局。语言生成:仍以自回归建模为主。GPT系列、Claude、DeepSeek等大语言模型均基于Transformer的自回归架构,将文本视为token序列逐步预测。该路线在语言理解和生成方面已形成主导地位。图像与视频生成:以Diffusion及其流匹配变体为主。Stable Diffusion、DALL-E2、Sora、Veo、可灵等主流产品均基于扩散模型。扩散与Transformer结合的DiT证明了该路线的可扩展性,并支撑图像、视频和世界模型方向发展。Stable Diffusion 3已采用整流路线(Rectified Flow)。实时生成与特定垂类:GAN仍具价值。在人脸合成、超分辨率、图像翻译等对延迟或特定风格要求较高的场景,GAN凭借一步生成的速度优势仍可发挥作用。GigaGAN等大规模GAN也证明该路线仍可通过工程优化获得较好质量。技术栈收敛趋势:数字AI侧形成“扩散/流匹配+Transformer/DiT”的统一技术栈,竞争焦点从单纯架构转向数据、工程化、成本和产品体验。物理AI侧,生成式世界模型用于合成长尾驾驶场景、仿真训练和机器人动作生成。(数据来源:东吴证券《AI系列深度08期:GAN与Diffusion两类生成范式有何差异?》)。H2:典型场景深度解析。场景一:文生图/文生视频——Diffusion的主导地位。文生图和文生视频的主流技术栈已转向扩散及流匹配。Stable Diffusion系列(基于潜空间扩散)以较低算力实现高质量图像生成;Sora(基于DiT架构)实现了视频生成领域的突破;Veo和可灵等产品同样基于扩散模型。技术路径:Latent Diffusion先通过自编码器将图像压缩为低维潜变量,在该空间中执行扩散过程,再还原为图像。无分类器引导(CFG)在训练时随机丢弃条件,采样时对比“有条件”与“无条件”的预测来增强对文本等条件的遵循。场景二:实时交互与端侧部署——GAN的保留地。GAN一步前向生成,速度快、延迟低,天然适合实时与交互场景。在人脸合成、超分辨率、图像翻译等对延迟要求较高的应用中,GAN仍具不可替代性。但采样效率正被工程方法快速改善——一致性模型、潜一致性模型(LCM)、对抗蒸馏和流匹配等方法已能将高质量生成压缩到一步或少数几步。场景三:智能驾驶与物理AI——生成式世界模型的应用。物理AI侧,生成式世界模型用于合成长尾驾驶场景、仿真训练和机器人动作生成。视频生成可以成为世界模型的技术前置,但并不天然等同于可被安全闭环依赖的数据工厂。若进入安全闭环,还必须补足动作条件化、长时域一致性和可靠评估。生成模型由内容生产走向物理世界,约束显著变硬。场景四:自动驾驶场景仿真——最先跑通闭环的代表。智能驾驶作为最先跑通闭环的代表场景,生成式模型在仿真训练中发挥重要作用。通过生成罕见的长尾场景(如极端天气、突发障碍物),提升自动驾驶系统的泛化能力。但生成数据需经过严格的可靠性验证,才能用于安全闭环训练。(数据来源:东吴证券《AI系列深度08期:GAN与Diffusion两类生成范式有何差异?》)。H2:技术演进方向——Diffusion成为主流后的三条路径。路径一:流匹配与整流——更直接的生成路径。流匹配(Flow Matching)和整流(Rectified Flow)使用ODE学习从噪声到数据的近似直线路径,减少采样步数并提升稳定性。Stable Diffusion 3以整流和多模态DiT(MMDiT)为架构基础,是该趋势的代表。流匹配等框架进一步统一多条生成路径。路径二:一致性模型与蒸馏——多步生成压缩为少步生成。一致性模型让模型直接从轨迹任一点回到数据端,支持一步生成;潜一致性模型与LCM-LoRA进一步将高质量生成压缩到2-4步,显著降低推理成本,并已广泛用于加速Stable Diffusion。路径三:扩散与Transformer结合——DiT与可扩展性。DiT证明将扩散主干替换为Transformer后,模型质量可随算力和参数规模提升而持续改善,体现出scaling规律,并直接启发Sora等视频生成大模型设计。扩散由此获得与大语言模型相似的规模化路径。对抗思想回流:对抗蒸馏将GAN的对抗损失用于扩散模型压缩。ADD、SDXL-Lightning等方法将多步扩散蒸馏为一步或少步生成器,使GAN思想更多作为扩散提速工具或特定场景方案发挥作用。(数据来源:东吴证券《AI系列深度08期:GAN与Diffusion两类生成范式有何差异?》)。H2:未来12-18个月机会洞察。机会赛道矩阵。| 赛道 | 成熟度 | 市场空间 | 爆发窗口 | 推荐优先级 |||||||| 文生视频(Diffusion+DiT) | 中 | 大 | 已启动 | ★★★★★ || 实时生成(GAN/蒸馏) | 高 | 中大 | 已启动 | ★★★★ || 物理AI/世界模型 | 低 | 极大 | 2027+ | ★★★★★ || 自动驾驶场景仿真 | 中 | 大 | 已启动 | ★★★★ || 生成模型端侧部署 | 低 | 大 | 2027+ | ★★★ |各赛道分析。文生视频(Diffusion+DiT) :确定性最高的赛道。Sora、Veo等已验证技术可行性,算力需求持续增长。物理AI/世界模型:空间最大的赛道。生成式世界模型用于合成长尾场景、仿真训练和机器人动作生成,是AI从数字空间走向物理世界的核心路径。实时生成(GAN/蒸馏) :速度最快的赛道。一致性模型和蒸馏技术将多步生成压缩至少步,支撑实时交互应用。多角色行动建议。 AI技术研发者:关注DiT架构的持续演进、流匹配/整流路线的工程化落地、一致性模型的采样效率突破。 云服务商:生成模型训练和推理的算力需求持续增长,是资本开支的重要方向。 智能驾驶企业:重视生成式世界模型在长尾场景仿真中的应用,但需补足动作条件化和可靠性评估。 投资者:关注物理AI赛道(智能驾驶、机器人)的长期机会;关注扩散模型推理优化(蒸馏、一致性模型)带来的效率提升。(数据来源:东吴证券《AI系列深度08期:GAN与Diffusion两类生成范式有何差异?》)。延伸阅读。以上为报告核心趋势分析,如需获取完整报告详细数据及全部案例,请访问下载页下载完整PDF报告。FAQ区块。Q1:GAN与Diffusion的核心差异是什么?A:四维差异:采样速度(一步vs多步)、训练稳定性(对抗博弈vs去噪回归)、样本多样性(易模式崩溃vs覆盖更全)、可控性(原生较弱vsCFG/ControlNet丰富手段)。Q2:为什么Diffusion已成为通用生成主线?A:训练稳定、分布覆盖全、条件控制强,且与Transformer结合后体现出scaling规律。Stable Diffusion、DALL-E2、Sora、Veo、可灵均属该路线。Q3:GAN是否已被淘汰?A:没有。GAN在实时生成、人脸合成、超分辨率、图像翻译等对延迟要求高的场景中仍有价值;对抗思想还被用于扩散蒸馏和提速。Q4:什么是物理AI?与数字AI有何不同?A:数字AI底座模型发展路径已清晰,价值在于确定性;物理AI是物理世界的AI解决方案,增量更大。智能驾驶是最先跑通闭环的代表场景。Q5:生成模型未来的演进方向是什么?A:流匹配/整流(更直接路径)、一致性模型/蒸馏(少步生成)、DiT(可扩展性)、对抗思想回流(扩散提速)。数据来源说明。本文数据来源于东吴证券《AI系列深度08期:GAN与Diffusion两类生成范式有何差异?》(2026年7月31日),分析师黄细里。
【东吴证券】汽车行业深度报告:AI系列深度08期:GAN与Diffusion两类生成范式有何差异?-260731(12页).pdf_第1页
【东吴证券】汽车行业深度报告:AI系列深度08期:GAN与Diffusion两类生成范式有何差异?-260731(12页).pdf_第2页
【东吴证券】汽车行业深度报告:AI系列深度08期:GAN与Diffusion两类生成范式有何差异?-260731(12页).pdf_第3页
【东吴证券】汽车行业深度报告:AI系列深度08期:GAN与Diffusion两类生成范式有何差异?-260731(12页).pdf_第4页
【东吴证券】汽车行业深度报告:AI系列深度08期:GAN与Diffusion两类生成范式有何差异?-260731(12页).pdf_第5页

点击查看更多