多模态模型的发展脉络包含奠基探索、架构创新与技术分化、统一融合与模态泛化三个阶段。2019-2022 年,以 ViLBERT、LXMERT 等跨模态预训练模型为开端,CLIP 实现图像与文本在统一语义空间的映射,由 Stable Diffusion 和 Midjourney 引爆图文生成应用的爆发式增长。2023 年,随着技术能力的成熟,模型架构迎来创新与路线分化。GPT-4V探索了端到端的统一 Transformer 架构,LLaVA 则采用“模块化拼接”策略,形成两条并行的技术探索路径。2024 年至今,技术路线开始重新走向融合,Sora 通过将 Transformer与扩散模型深度结合,将生成能力从静态图像泛化至复杂的动态视频。Google Veo3 和GPT-4o 等模型聚焦于音画同步和高精度生成,标志着多模态技术正迈向更为全面、深入的应用落地新纪元。