问题的潜力。 多模态大模型深度融合理解和生成能力,原生多模态架构逐渐 走向成熟。上半年发布的OpenAI-o3 模型和 Gemini 2.5 Pro 模型可以 将语言大模型的深度思考能力成功迁移至多模态模型,使其具备复 杂视觉任务的深度推理能力。GPT-Image-1和Gemini 2.0 flash 模型 通过原生多模态架构融合自回归模型及扩散模型,支持长上下文的 Gemini-2.5-flash-image-preview(nano banana)和文生视频模型 Sora 2, 进一步提升视觉生成的内容质量与适配性。 语言及多模态模型的能力演进源自模型的运行机制、基础架构、 训练方法三个维度的关键突破。 在运行机制上,短期来看Scaling难以带来质的改变,精细化机