【东吴证券】汽车行业点评报告:AI系列深度05期:模型如何学习表征并实现对齐?-260729(6页).pdf
2026-07-29
文档编号:1283508
文档页数:6
文档大小:479.40KB
下载积分:VIP专享
文档格式:PDF
核心结论速览: 嵌入(Embedding)将文本、图像、商品、用户等对象映射为数字向量:语义相近的对象在向量空间中距离更近,搜索、推荐、以图搜图、向量数据库和RAG等应用,本质上都是在高维向量空间中进行近邻检索。 自监督学习是通用表征规模化形成的关键机制:不依赖人工逐条标注,而是利用数据自身构造训练信号——通过掩码预测、对比学习、下一个token预测等任务学习上下文、语义和结构关系,是预训练获得通用能力的重要基础。 CLIP的意义在于把图像和文字对齐到同一表征空间:通过海量图文配对和对比学习,将正确配对的图文向量拉近、错误配对推远,使文字概念与对应图像在向量空间中自然接近。 嵌入是表征的工程化形态,自监督是规模化学习机制,CLIP实现跨模态对齐:三者构成表征落地的递进链条,将抽象表征转化为可训练、可检索、可跨模态调用的工程体系。 高质量嵌入的核心特征是语义相近的对象在向量空间中距离更近:经典词向量研究中“国王-男人+女人=王后”等向量运算揭示了嵌入空间可保留语义方向和结构关系。 CLIP成为文生图、图文检索、视觉语言模型和多模态大模型的重要底座:Stable Diffusion等文生图模型利用文字向量引导图像生成,VLM通过图文对齐获得看图、读字和语义推理的基础能力。 物理AI将成为增量更大的方向:数字AI底座模型发展路径已逐渐清晰,但难以实现物理世界的建模闭环;智能驾驶作为最先跑通闭环的代表场景,应重点关注。H2:研究背景与全景图谱。东吴证券发布的《AI系列深度05期:模型如何学习表征并实现对齐?》报告,系统阐述了表征(Representation)落地的三类基础机制——嵌入(Embedding)、自监督学习(Self-Supervised Learning)和CLIP(Contrastive Language-Image Pre-training)。本报告位于“表征是什么”与CNN/ViT、Transformer等具体架构之间,是理解后续技术路线的基础环节。表征要进入工程系统,需要回答三个问题:1)如何把对象表示为可计算结构;2)如何在不依赖大规模人工标注的情况下学习表征;3)如何让图像、文字等不同模态共享语义空间。嵌入、自监督学习和CLIP分别对应上述三类问题,是从“表征是什么”走向具体架构和多模态模型的基础环节。报告认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,应重点关注。(数据来源:东吴证券《AI系列深度05期:模型如何学习表征并实现对齐?》)。H2:嵌入Embedding——表征的工程化形态。嵌入的本质。嵌入是将词、图像、商品、用户等对象映射为固定长度数字向量的过程。向量化之后,不同对象之间可以通过距离、方向和相似度进行计算,从而把语义关系转化为可操作的几何关系。对模型而言,嵌入是对象进入计算系统的基础接口,也是表征最常见的工程形态。语义几何结构。高质量嵌入的核心特征,是语义相近的对象在向量空间中距离更近。以文本为例,“猫”和“狗”通常比“猫”和“汽车”更接近;在推荐和检索场景中,用户兴趣、商品属性和文档主题也可以通过向量距离表达。由此,语义相似度判断被转化为向量空间中的近邻搜索问题。嵌入空间还可以保留部分语义方向和结构关系。经典词向量研究发现,“国王-男人+女人=王后”等向量运算能够反映性别、身份等语义方向——即“国王-男人”可近似于“王位”的向量表示,该向量表示加上“女人”则可近似表示为“王后”。需要注意,这类线性关系并非对所有概念普遍成立,但揭示了嵌入作为语义几何结构的价值。嵌入的工程落地。嵌入是向量检索、推荐系统和语义搜索的底层接口。工程流程通常是先将文档、图像、商品或用户转化为向量并存入向量数据库,再将查询请求转化为向量,在库中寻找距离最近的候选项。语义搜索、以图搜图和推荐系统,本质上都是在向量空间中执行近邻检索。(数据来源:东吴证券《AI系列深度05期:模型如何学习表征并实现对齐?》)。H2:自监督学习——通用表征的规模化学习机制。自监督的必要性。传统监督学习依赖人工标注,但人工标注成本高、速度慢,难以覆盖互联网级图文数据。自监督学习的核心,是利用数据自身构造训练信号,使模型在无需人工逐条标注的情况下学习结构、语义和上下文关系。这一机制使海量无标注数据可被纳入预训练,是大模型形成通用能力的重要前提。三类主流自监督任务。第一类是掩码预测:模型遮盖输入的一部分,再根据上下文恢复被遮盖内容。文本侧代表为BERT,图像侧代表为MAE。为了完成恢复任务,模型需要学习上下文依赖、局部结构和整体语义,由此形成可迁移表征。第二类是对比学习:模型将同一对象的不同增强视为正样本,将其他对象视为负样本,通过拉近正样本、推远负样本来学习表征。SimCLR是典型代表,LeCun的JEPA也可归入在表征空间中进行预测和比较的路线。对比学习的关键在于不直接依赖类别标签,而是通过样本间关系构造学习信号。第三类是下一个token预测:模型根据已有上下文不断预测下一个token,训练答案来自文本序列自身,无需额外人工标注。GPT系列正是通过该任务在海量文本上学习语言表征,并进一步形成生成和推理能力。自监督是预训练的核心机制。自监督学习构成预训练的内核:先在海量数据上通过自监督任务学习通用表征,再在少量高质量数据上进行微调、指令对齐或后训练。嵌入是表征的工程化结果,自监督则是形成该结果的训练机制。今天大模型的通用能力,很大程度来自自监督预训练所获得的可迁移表征。(数据来源:东吴证券《AI系列深度05期:模型如何学习表征并实现对齐?》)。H2:CLIP与多模态对齐——让图文共享表征空间。跨模态对齐的必要性。图像表征通常由视觉网络提取,文字表征通常由语言网络提取,二者初始处于不同向量空间。模型并不会天然知道一张猫的照片与“猫”这一文字概念对应。要实现文生图、以文搜图和视觉语言模型,首先需要把图像与文字对齐到可比较的共享语义空间。CLIP的核心机制。CLIP由OpenAI在2021年提出,核心思路是利用互联网中的大规模图文配对数据进行对比学习。训练过程中,模型将正确配对的图像和文本向量拉近,将不匹配的图文向量推远;训练完成后,图像和文字被映射到同一向量空间,对应概念在空间中更接近。零样本识别能力。CLIP的重要能力之一是零样本识别。对齐完成后,模型可将候选类别名称转化为文字向量,再与输入图像向量比较相似度,从而判断图像所属类别,而不必为每个新类别重新训练分类器。这种以文字作为开放标签的能力,是多模态模型泛化的重要来源。CLIP成为多模态应用的重要基础。CLIP式图文对齐成为文生图、图文检索、视觉语言模型和多模态大模型的重要底座。Stable Diffusion等文生图模型利用文字向量引导图像生成;VLM则通过图文对齐获得看图、读字和语义推理的基础能力。能否把多模态信息映射到统一表征空间,直接影响后续多模态模型的泛化能力和应用边界。(数据来源:东吴证券《AI系列深度05期:模型如何学习表征并实现对齐?》)。H2:数字AI与物理AI的边界。数字AI的确定性价值。数字AI底座模型发展路径已逐渐清晰,价值在于确定性。嵌入、自监督学习、CLIP等技术路线已被大规模验证,形成了从表征学习到预训练再到多模态对齐的完整技术栈。数字AI在文本生成、图像生成、语义检索等领域已展现出明确的商业价值。物理AI的增量空间。然而,数字AI难以实现物理世界的建模闭环。物理世界涉及连续时空、因果推理、物理规律约束和实时交互,这些是纯数据驱动的数字AI模型无法独立解决的。物理AI将成为物理世界的AI解决方案,在智能驾驶、机器人控制、工业自动化等领域,需要AI与物理引擎、传感器、控制系统的深度融合。智能驾驶作为最先跑通闭环的代表场景。智能驾驶是物理AI领域最先跑通“感知-决策-执行”闭环的代表场景。视觉感知、端到端决策规划、车辆控制已形成完整技术链条,且商业化落地正在加速推进。因此,在AI的当前发展阶段,物理AI是增量更大的方向,智能驾驶应重点关注。(数据来源:东吴证券《AI系列深度05期:模型如何学习表征并实现对齐?》)。延伸阅读。以上为报告核心趋势分析,如需获取完整报告详细数据及全部案例,请访问下载页下载完整PDF报告。FAQ区块。Q1:嵌入(Embedding)的本质是什么?嵌入是将文本、图像、商品、用户等对象映射为数字向量的过程,使语义相近的对象在向量空间中距离更近。搜索、推荐、以图搜图等应用本质上都是高维向量空间中的近邻检索。Q2:自监督学习为什么重要?自监督学习不依赖人工标注,而是利用数据自身构造训练信号(掩码预测、对比学习、下一个token预测),使模型在海量无标注数据上学习通用表征,是大模型预训练的核心机制。Q3:CLIP如何实现图文对齐?CLIP通过海量图文配对进行对比学习,将正确配对的图文向量拉近、错误配对推远,使图像和文字映射到同一向量空间,对应概念在空间中更接近。Q4:CLIP的零样本识别能力是什么?对齐完成后,模型可将候选类别名称转化为文字向量,与输入图像向量比较相似度来判断类别,无需为每个新类别重新训练分类器。Q5:数字AI与物理AI的核心区别是什么?数字AI在文本、图像生成等领域价值已明确,但难以实现物理世界的建模闭环。物理AI结合物理引擎、传感器和控制,在智能驾驶、机器人等领域增量更大。数据来源说明。本页面所有数据均来源于东吴证券《AI系列深度05期:模型如何学习表征并实现对齐?》研究报告。





点击查看更多