返回顶部
返回首页 会员充值 我的足迹 返回上一页
跳转三个皮匠报告小程序
具身智能
情绪经济
商业航天
十五五
银发经济

AI多模态技术趋势

2025年3月最后一周,全球AI多模态技术迎来密集突破。东方证券人工智能动态跟踪报告显示,OpenAI于3月25日发布GPT-4o原生多模态图像生成功能,整合Sora生图能力,用户描述图像后1分钟内生成,在文本集成、多对象绑定、上下文理解等方面明显改进。谷歌同日发布Gemini2.5Pro,以1443分在大模型竞技场ChatbotArena绝对优势登顶,领先第二名39分,同时VisionArena多模态能力也达榜首。阿里发布Qwen2.5-Omni全模态模型并开源7B版本。本文从技术突破、竞争格局、应用前景三个维度解析多模态AI的发展趋势。

OpenAI GPT-4o——原生多模态图像生成的里程碑

3月25日,OpenAI发布GPT-4o原生多模态图像生成功能,取代此前的DALL-E3并整合进Sora。用户只需在ChatGPT中描述图像,GPT-4o便能在一分钟内生成相应图像。核心改进包括:文本集成(将文字精准嵌入图片)、多对象绑定(图片中多个物体的位置、运动及光影关系准确呈现)、上下文理解与风格适应(保持多轮对话中的一致性)。生成图片质量更为真实准确,通过人类反馈强化学习提升准确性。

OpenAI为生成图像添加元数据,方便验证AI来源。该功能存在长图裁剪、非拉丁字符文本不准确等局限,但整体标志着多模态图像生成从“独立工具”向“原生能力”的进化。多模态能力不再需要切换不同工具,而是成为对话交互的自然延伸。

谷歌Gemini2.5Pro——多维度全面登顶

谷歌同日发布Gemini2.5Pro,CEO称其为“谷歌有史以来最智能的AI模型”。在ChatbotArena以1443分绝对优势登顶,领先第二名Grok3达39分,在复杂指令、编程、数学、创意写作、指令等子榜单中均保持明显优势。在VisionArena原生多模态能力也达榜首,图片理解、生成能力明显增强。保留100万token上下文窗口(即将提升至200万),支持文本、音频、图像、视频及完整代码库输入。

技术突破在于强化学习、思维链提示和后训练。推理能力在Humanity's Last Exam基准测试中超越OpenAI o3-mini(high)。实测中逻辑题、数学题、编程任务表现出色。Gemini2.5Pro的全面领先表明谷歌在多模态AI领域已重回领先位置。

中国厂商跟进——阿里Qwen2.5-Omni开源

3月27日,阿里发布Qwen2.5-Omni,7B全模态模型,采用Thinker-Talker双核架构,无缝处理文本、图像、音频、视频,支持实时语音问答交互。Apache 2.0许可,支持开发者免费商用及终端部署。在OmniBench多模态基准测试中达到领先水平,语音生成测评分数4.51(与人类持平)。

Qwen2.5-Omni的开源策略降低了多模态AI的开发门槛,开发者可基于7B参数模型进行二次开发。与GPT-4o和Gemini2.5Pro的闭源路线不同,阿里的开源路线有望吸引更多开发者共建生态。全球AI多模态技术路线呈现“闭源+开源”双轨并行的格局。
表4:本周多模态大模型核心对比
模型发布方核心特点开源情况
GPT-4o图像生成OpenAI原生多模态,1分钟生成,文本精准嵌入闭源
Gemini2.5Pro谷歌ChatbotArena 1443分,多模态榜首闭源
Qwen2.5-Omni阿里7B全模态,Apache 2.0许可开源

投资建议——关注多模态AI核心标的

多模态AI进入密集突破期,建议关注产业链核心受益标的:快手-W(01024,买入),可灵图生视频全球第一,多模态视频生成技术领先;阿里巴巴-W(09988,买入),Qwen2.5-Omni开源全模态模型,通义系列为全球最大开源模型族群;腾讯控股(00700,买入),微信AI搜索接入混元T1,卡位最佳社交应用场景。多模态AI从技术突破走向应用落地,具备场景和数据优势的企业有望率先受益。
点击阅读报告原文: 【东方证券】人工智能动态跟踪2025年3月第3期:阿里发布多款大模型,AI产业链持续景气-250331(26页)
相关报告