东北证券发布AI视频生成行业深度报告,系统梳理从GAN/VAE早期探索到DiT架构大一统的完整技术演进路径。2025年AI视频生成技术进入全面成熟阶段,分辨率从64×64跃升至4K,视频时长从3秒扩展至分钟级以上,物理真实感大幅提升。中国团队在全球竞争中表现突出,字节即梦、快手可灵、阿里巴巴等已形成与国际巨头分庭抗礼的格局。AI视频生成正从“单点内容生成工具”向“全链路创作系统”升级,推动传媒行业大规模工业化应用。
从GAN到DiT:AI视频生成技术的四次范式跃迁
AI视频生成经历了四个清晰的发展阶段,每次技术革命都源于图像生成技术的先验突破。第一阶段(2016-2020)是GAN/VAE主导的早期探索,证明了AI生成视频的可能性,但生成的视频分辨率极低(64×64)、时长仅3-5秒,存在严重模糊和时间不一致问题。GAN通过生成器和判别器的对抗博弈来提升生成质量,但训练不稳定、模式崩溃等缺陷在视频领域更加严重。
第二阶段(2020-2023)是扩散模型与Transformer的技术突破期。扩散模型通过“逐步加噪、逆向去噪”彻底解决了GAN训练不稳定的痛点,生成质量显著提升,视频分辨率达到1280×768,时长扩展至10-15秒。视觉Transformer(ViT)将图像切分为token序列,用标准Transformer处理,实现了视觉任务的“大模型化”。这一阶段Runway Gen-2、Pika 1.0等产品开始商业化尝试。
第三阶段(2023-2024)是DiT(扩散Transformer)架构的统一时期。DiT用ViT替换了传统扩散模型的U-Net主干,证明Transformer在生成领域远优于U-Net,且严格遵循大模型缩放定律。2024年OpenAI Sora的发布是里程碑事件,生成时长突破60秒,物理真实感大幅提升,DiT架构成为行业事实标准。
第四阶段(2025至今)是技术成熟期,视频生成开始向理解物理规律、实时交互和多模态融合的“世界模型”演进。生成速度提升至接近实时,最长时长突破5分钟,音视频联合生成成为标配。
AI视频生成模型的核心组件与技术架构
一个完整的AI视频生成模型由多个模块协同工作。文本编码器(如CLIP或T5)负责理解文字指令;图像/视频编码器将视觉数据压缩到潜空间(Latent Space);生成骨干网络(DiT为核心)在潜空间中进行“创作”;图像/视频解码器将潜空间表示还原为像素画面。
评估方面,自动化指标包括FVD(量化生成视频与真实视频的分布距离)和CLIPSIM(评估视频与文本描述的相关性)。新指标如WCS开始关注时空一致性。人工MOS评分则是评估画质、运动自然度和图文一致性的金标准。当前主流模型已支持1080p-4K分辨率,生成可用率超过90%,大幅降低了创作成本。
中国团队领跑全球,头部阵营格局确立
截至2026年6月,AI视频生成领域国际头部玩家仅剩Google一家,OpenAI已逐步关停Sora的C端服务,Runway自2025年12月发布Gen-4.5后已半年未更新。与之相反,中国团队竞争激烈,模型保持高频更新,性能不断提高。
综合Artificial Analysis、LMArena、SuperCLUE三家榜单,第一梯队包括:Google(Gemini Omni Flash,2026年5月发布,将视频、图像、音乐及交互生成与理解能力融合进单一模型框架)、字节即梦(Seedance2.0,综合能力最强,依托剪映实现“生成-编辑-发布”全链路闭环)、快手可灵(Kling3.0,视频时长和物理真实感顶尖,国际化推进快)、阿里巴巴(HappyHorse-1.0,2026年4月杀入第一梯队,深度绑定电商生态)、生数科技(Vidu Q3,原创U-ViT架构带来极致生成效率)、爱诗科技(PixVerse V6,创意短视频及社交领域优势明显)。
表1:AI视频生成头部厂商对比| 厂商 | 最新模型 | 发布时间 | 核心优势 |
|---|
| Google | Gemini Omni Flash | 2026.5 | 多模态统一框架 |
| 字节即梦 | Seedance 2.0 | 2026.3 | 剪映生态闭环 |
| 快手可灵 | Kling 3.0 | 2026.2 | 视频时长+物理真实感 |
| 阿里巴巴 | HappyHorse 1.0 | 2026.4 | 电商场景深度绑定 |
视频生成技术的未来方向
随着技术成熟,AI视频生成将从“单点内容生成工具”向“全链路创作系统”升级。全流程自动化方面,从剧本创作、分镜设计到成片输出的端到端AI化,有望实现“输入灵感,输出电影”的终极创作模式。实时交互式生成将支持游戏、VR/AR等实时应用场景。3D立体视频生成将直接生成双目立体视频和VR内容。通用世界模型将进化为能够理解和模拟真实世界的通用AI,具备推理、规划和决策能力,为机器人等物理AI应用场景提供智能支持。