电子行业:世界模型探索空间智能AI复杂场景落地可期-250305(16页).pdf
1、 世界模型探索空间智能,AI 复杂场景落地可期 Table_ReportDate2025 年 3 月 5 日 请阅读最后一页免责声明及信息披露 2 证券研究报告 行业研究 行业专题研究(普通)电子电子 投资评级投资评级 看好看好 上次评级上次评级 看好看好 莫文宇 电子行业首席分析师 执业编号:S1500522090001 邮 箱: 杨宇轩 电子行业分析师 执业编号:S1500525010001 邮箱: 世界模型探索空间智能,世界模型探索空间智能,AIAI 复杂场景落地可复杂场景落地可期期 Table_ReportDate 2025 年 3 月 5 日 本期内容提要本期内容提要:Table_S
2、ummary 世界模型研究进展迅速,应用端机遇与挑战并存。世界模型研究进展迅速,应用端机遇与挑战并存。长期以来,科学界一直渴望开发一个统一的模型,该模型可以复制其世界的基本动态,以追求通用人工智能(AGI)。世界模型尚无统一的定义,英伟达官网的定义为:“世界模型是理解现实世界动态(包括其物理和空间属性)的生成式 AI 模型。它们使用文本、图像、视频和运动等输入数据来生成视频。通过学习,它们能够理解现实世界环境的物理特性,从而对运动、应力以及感官数据中的空间关系等动态进行表示和预测。”Sora发布之后,世界模型获得了更为广泛的关注。从功能方面看,在许多用例中,Sora 确实具备一定的理解和预测世
3、界的能力,且其生成的视频在大部分时候也能有良好的一致性。但也有人认为 Sora 仅是像素层面的生成,这会导致一些无法解释的现象,这表明 Sora 并未理解物理世界。从技术架构看,Sora 是一种基于扩散的视频生成模型。但是无论如何,Sora 的结果表明,扩展视频生成模型是构建物理世界通用模拟器的一条有前景的途径。应用层面看,随着视觉生成模型和多模态大应用层面看,随着视觉生成模型和多模态大模型的进展,世界模型在自动驾驶领域受到了广泛的关注。模型的进展,世界模型在自动驾驶领域受到了广泛的关注。使用基于扩散的视频生成模型作为世界模型可以部分解决信息丢失和建模效率低下的问题,近年来已有相关的研究在不断
4、进行。机器人领域的应用机器人领域的应用也也是主要方向之一,世界模型让机器人在现实中处理通用任务展示出是主要方向之一,世界模型让机器人在现实中处理通用任务展示出巨大前景。巨大前景。传统的机器人关键组件会被建模,机器人在执行任务时无需理解世界。而当机器人被部署在新的场景中时,机器人可能会手足无措,因此,世界模型对物理世界的理解和预测能力是机器人智能化的关键利器,LLMs 和世界模型被认为是实现通用人工智能(AGI)的可能途径之一,它们可以成为机器理解世界基本规律的起点。目前目前AI 发展迅速,大模型正快速学习如何理解物理世界,世界模型也有望发展迅速,大模型正快速学习如何理解物理世界,世界模型也有望
5、迎来快速迭代时期。迎来快速迭代时期。在近期发布的大模型中,o3-mini 可以模拟生成一个小球在四维超立方体内弹射的 Python 代码。而 Grok3 则可以模拟航天器任务,生成的 3D 动画准确描述了飞船、地球、太阳、火星的位置关系。这些成果有可能从底层催动世界模型的进展,让 AI 的智能化进入更高的水平。众多厂商推出世界模型,相关领域已展开角逐。众多厂商推出世界模型,相关领域已展开角逐。英伟达推出英伟达推出 Cosmos,赋能机器人和自动驾驶开发者。赋能机器人和自动驾驶开发者。Cosmos 世界基础模型是一套用于物理感知视频生成的开放式扩散和自回归 Transformer 模型。这些模型
6、已基于 2000 万小时的真实世界人类互动、环境、工业、机器人和驾驶数据,训练了 9,000 万亿个 token。李飞飞创立李飞飞创立 World Labs,探,探索从索从 2D 到到 3D 的路径。的路径。World Labs 是一家空间智能 AI 公司,由在AI 学术领域享有盛誉的李飞飞博士创立。World Labs 致力于构建空间智能大型世界模型(LWM)来感知、生成 3D 世界并与之交互。其目标是将 AI 模型从像素的 2D 平面提升到完整的 3D 世界。World Labs 仅创立了三个月,便吸引了英伟达、AMD 等公司的融资,估值超过 10 亿美元。谷歌旗下谷歌旗下 DeepMin





点击查看更多