返回顶部
返回首页 会员充值 我的足迹 返回上一页

【东吴证券】汽车行业深度报告:AI系列深度07期:CNN与ViT两类视觉骨干有何差异?-260730(10页).pdf

2026-07-30
文档编号:1284021
文档页数:10
文档大小:574.18KB
下载积分:VIP专享
文档格式:PDF
核心结论速览: 视觉骨干网络是计算机视觉系统的“表征底座”,决定分类、检测、分割等下游任务的上限。CNN与ViT是过去十余年最重要的两代视觉骨干,分别代表“将图像先验写入结构”和“将关系学习交给数据与规模”两种设计哲学。 视觉架构经历四个演进阶段:手工特征时代(SIFT、HOG)→ CNN崛起(AlexNet、VGG、ResNet)→ ViT登场(2020年)→ 融合时代(Swin、ConvNeXt、CoAtNet)。CNN与ViT正从对立走向相互吸收。 CNN的核心优势来自三项视觉归纳偏置:局部连接(神经元只响应局部区域)、权值共享(同一卷积核在全图复用)、平移等变性(位置平移时特征响应随之平移)。这些结构假设使CNN在数据有限时更高效,也更适合端侧和实时部署。 ViT将图像切分为patch并当作token输入Transformer,第一层自注意力即可实现全局交互。弱先验使其在大数据预训练下上限更高,但对数据、算力和位置编码依赖更强。ViT-H/14在JFT-300M预训练后取得较高ImageNet精度,体现其规模化潜力。 ViT是否真正“强于”CNN仍是核心争议:ConvNeXt证明纯卷积配合现代训练技巧仍可追平部分ViT;MLP-Mixer提示注意力未必是唯一变量。更准确的理解是,视觉架构正从“强先验”与“弱先验”两端走向任务、数据、算力约束下的动态平衡。 产业应用呈现分层格局:多模态大模型和研究前沿普遍采用ViT或类Transformer视觉编码器(CLIP、SigLIP、Qwen-VL);自动驾驶量产系统受车端算力、时延和安全约束,更多采用CNN前端、BEV/Transformer融合和混合骨干。研究前沿偏ViT,车端量产偏混合。 物理AI将成为增量更大的方向:数字AI底座模型发展路径已逐渐清晰,但难以实现物理世界的建模闭环。智能驾驶作为最先跑通闭环的代表场景,应重点关注。H2:研究背景与全景图谱。视觉骨干网络的核心地位。视觉骨干网络是计算机视觉系统中将原始像素转化为高层语义特征的核心模块。图像在计算机中表现为像素矩阵,模型需要将低层数值信号转化为可表达物体、边界、位置和语义关系的特征,再交由分类、检测或分割等下游任务使用。骨干网络的表征质量直接决定下游任务的上限。语义鸿沟的根本挑战。图像识别的根本难点在于语义鸿沟:低层像素变化与高层语义含义之间并不一一对应。同一对象在视角、光照、遮挡、尺度变化下像素差异可能很大,而不同类别对象在局部纹理上又可能相似。视觉模型既需要对平移、缩放、形变和光照变化保持稳定,又需要保留区分类别和实例的关键差异。CNN与ViT之争的本质。CNN与ViT是获得视觉表征的两类架构路径。CNN将局部性、权值共享和平移等变性等视觉先验写入结构;ViT通过自注意力将图像表示为token序列,并依赖数据规模学习空间关系。二者之争本质上解决的是先验、数据和算力如何分工的问题。数据来源:东吴证券研究所《AI系列深度07期:CNN与ViT两类视觉骨干有何差异?》(2026年7月30日)。H2:视觉架构的四个演进阶段。阶段一:手工特征时代(—2012年)。在深度学习兴起前,图像特征主要依赖人工设计的算子。SIFT通过关键点描述子提升对尺度和旋转变化的稳定性,HOG通过方向梯度直方图刻画局部形状并常用于行人检测,再配合SVM等浅层分类器完成识别。2010-2011年ImageNet挑战赛获胜方案多属于这一类。手工特征的主要约束在于依赖专家经验、跨任务迁移能力弱、难以随数据规模扩展。随着ImageNet等大规模数据集出现,人工特征的表达上限迅速暴露。阶段二:CNN崛起(2012—2020年)。AlexNet是CNN成为视觉主流架构的关键转折。2012年,Krizhevsky、Sutskever与Hinton提出的AlexNet在ImageNet上将Top-5错误率显著降低,核心变化在于特征不再由人工设计,而由深度卷积网络从海量图像中自动学习。2014—2020年,CNN沿深度、宽度和结构效率持续演进。VGG通过连续3×3小卷积堆叠提升深度,GoogLeNet/Inception通过多尺度并行模块提升效率,ResNet通过残差连接缓解深层网络训练困难,将网络深度推向百层以上。该阶段CNN在自动驾驶、安防、医疗影像等视觉应用中广泛落地。阶段三:ViT登场(2020—2022年)。2020年,Dosovitskiy等提出Vision Transformer(ViT),将图像切分为固定大小patch并投影为token序列,再输入标准Transformer编码器。在谷歌JFT-300M大规模数据集上预训练后,ViT分类精度超过当时强CNN模型。ViT成功的关键前提是数据规模。若仅在ImageNet-1k等中等规模数据集上从头训练,ViT通常不优于同级别CNN;在ImageNet-21k、JFT-300M等更大规模数据上预训练后,其优势才逐步显现。阶段四:融合时代(2022年至今)。2021年后,Swin Transformer、CoAtNet、ConvNeXt等架构推动CNN与ViT相互吸收。Swin通过局部窗口注意力将复杂度降回线性,ConvNeXt证明纯卷积配合现代训练技巧仍可追平部分ViT。视觉架构正从“强先验”与“弱先验”两端走向动态平衡。| 时代 | 标志性工作 | 表征方式 | 主要局限 ||||||| 手工特征时代(—2012) | SIFT、HOG+SVM | 人工设计的特征算子 | 依赖专家经验、难以规模化 || CNN崛起(2012—2020) | AlexNet、VGG、ResNet | 卷积自动学习局部特征 | 感受野受限、长程依赖偏弱 || ViT登场(2020—2022) | ViT、DeiT | 自注意力建模全局关系 | 数据饥渴、算力开销大 || 融合时代(2022—今) | Swin、ConvNeXt、CoAtNet | 局部性与全局注意力融合 | 设计空间复杂 |数据来源:东吴证券研究所整理。H2:CNN的核心机制与设计先验。卷积、池化与任务头。卷积是CNN的核心运算。卷积核在图像局部区域滑动并进行加权求和,用于检测边缘、颜色、纹理等局部模式。浅层卷积通常捕捉低级视觉特征,深层卷积进一步组合成部件、物体和场景语义。多组卷积核形成多张特征图,记录不同视觉模式在空间位置上的响应强度。池化负责降采样和增强局部稳定性。通过在局部区域内保留最大值或平均值,池化降低特征图分辨率和计算量,同时提高对微小平移的鲁棒性。三项设计先验。1. 局部连接:单个神经元只连接局部区域而非全图,显著降低参数量,使模型优先学习边缘、纹理、角点等局部结构。该假设符合图像中局部像素相关性较强的特征。2. 权值共享:同一个卷积核在整张图上复用同一组参数,一个局部模式的检测器可在不同空间位置生效。相比全连接网络,权值共享是CNN在视觉任务中更高效的关键结构设计。3. 平移等变性:当目标在图像中发生位置平移时,对应特征响应也随之平移,使模型更容易识别位置变化下的同一视觉模式。这三项归纳偏置共同构成CNN在训练前写入模型的视觉先验,也是CNN在中小数据规模下仍具备较好表现的重要原因。数据来源:东吴证券研究所整理。H2:ViT的核心机制与设计。Self-Attention机制。自注意力是Transformer的核心机制。每个输入元素生成Query、Key、Value三个向量,通过Query与所有Key计算相似度获得注意力权重,再按权重汇总Value信息。由此,任意两个元素即使相距较远,也可以在一层中建立直接关系。自注意力与卷积的核心差别在于交互范围和权重生成方式。卷积主要处理局部窗口且参数固定;自注意力从第一层即可进行全局交互,且注意力权重随输入内容动态变化。因此Transformer更擅长捕捉长距离关系,但标准自注意力计算量随token数量呈平方增长。ViT的核心设计。ViT将图像切分为固定大小patch(如16×16),并将每个patch拉平、投影为向量,作为视觉token输入Transformer。一张224×224图像按16×16切分将形成196个patch token,并通常加入用于汇总全图信息的分类token。由于自注意力本身不包含空间顺序信息,ViT需要为每个token加入位置编码以保留位置信息。随后token序列进入标准Transformer编码器,通过多层自注意力和前馈网络形成全局视觉表征。弱先验的红利与代价。ViT对图像结构的专门假设更少,更依赖数据规模学习局部性和空间关系。小数据条件下ViT需要自行学习这些规律,表现往往不及CNN;但在大规模预训练下,弱先验减少了结构约束,使模型能够从数据中学习更灵活的关系。ViT-H/14在JFT-300M预训练后取得较高ImageNet精度,体现其规模化潜力。数据来源:东吴证券研究所整理。H2:CNN与ViT的四组核心分歧。| 对比维度 | CNN | ViT |||||| 感受野 | 逐层扩大,深层才全局 | 第一层即全局 || 归纳偏置 | 自带先验假设(局部特征、权重共享、平移不变性) | 弱先验,数据驱动 || 数据效率 | 小数据集表现更好,训练效果容易提前到达瓶颈 | 对数据量要求高,规模越大性能提升空间越明显 || 计算复杂度 | 随分辨率线性,硬件友好 | 自注意力随分辨率平方增长 || 长程依赖 | 需堆深度,相对困难 | 天然擅长 || 部署成熟度 | 端侧工具链成熟 | 配套工具还在完善,生态不及CNN |感受野差异。CNN的感受野自下而上逐层扩大。浅层神经元主要处理局部区域,随着层数加深和空间降采样,逐步获得更大的全局视野。ViT从第一层自注意力开始即可实现全局交互,每个patch可直接与所有其他patch建立关系。Raghu等在2021年研究中发现,ViT在较浅层即可同时利用局部与全局信息,而CNN浅层更多集中于局部信息。归纳偏置差异。CNN的强归纳偏置提升了样本效率和训练稳定性,使CNN在中小数据集、端侧视觉任务和安全攸关场景中仍具竞争力。ViT的弱先验意味着小数据下样本效率较低,但在大规模数据和算力支撑下更具扩展空间。数据效率差异。在中小数据规模下,CNN通常更具优势。ImageNet-1k从头训练时,CNN与ViT精度接近,部分CNN仍可略优。在大规模预训练条件下,ViT的扩展性更强,能够吸收更多数据、参数和算力,与大模型时代的Scaling Law更为一致。计算复杂度与部署差异。标准自注意力计算量随token数量呈平方增长,处理高分辨率图像时开销较大;卷积计算量随分辨率近似线性增长,算子规则成熟。部署层面,CNN在端侧硬件上的算子支持、量化和加速工具链更成熟;纯ViT部署生态仍在追赶。数据来源:东吴证券研究所整理。H2:核心争议——架构优势与约束边界。ViT更强,还是数据和训练范式贡献更大?关于ViT是否真正强于CNN,核心质疑在于早期优势是否来自更大数据和更现代训练策略。ViT首次超越CNN时依赖JFT-300M等私有超大数据集;ConvNeXt进一步证明,在纯卷积架构中引入现代训练技巧、数据增强、正则化和结构调整后,CNN仍可追平部分ViT表现。因此,早期ViT优势不能完全归因于注意力结构本身,数据规模和训练范式同样是关键变量。支持ViT的一方则强调,自注意力的全局建模能力和可扩展性具有结构性价值,越是在超大规模、多模态场景中越能体现。更审慎的判断是:在同等数据与训练条件下,CNN与ViT精度可能相近,架构选择取决于数据规模、算力条件、部署约束和任务类型。归纳偏置:资产还是约束?数据稀缺时,归纳偏置是资产。工业质检、医疗影像、车载长尾等场景标注数据有限,CNN内置的局部性、权值共享和平移等变性可提升样本效率与稳健性。数据越有限,结构先验带来的训练稳定性和可部署性价值越高。数据和算力充足时,强先验可能成为上限约束。过强的结构假设可能限制模型从数据中学习更灵活的关系。Swin、CoAtNet、ConvNeXt等架构的共同方向,是在保留必要视觉先验与释放数据学习空间之间寻找平衡。视觉骨干并不存在统一最优解,关键在于任务、数据、算力和部署约束的匹配。产业应用的分层格局。 多模态大模型和研究前沿:普遍采用ViT或类Transformer视觉编码器,CLIP、SigLIP、Qwen-VL均沿此方向推进。 自动驾驶量产系统:受车端算力、时延和安全约束,更多采用CNN前端、BEV/Transformer融合和混合骨干。 现实分工:研究前沿偏ViT,车端量产偏混合。物理AI的增量方向。数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环。物理AI将成为物理世界的AI解决方案,在AI的当前发展阶段成为增量更大的方向。智能驾驶作为最先跑通闭环的代表场景,应重点关注。延伸阅读。以上为报告核心趋势分析,如需获取完整报告详细数据及全部案例,请访问下载页下载完整PDF报告。FAQ区块。Q1:CNN和ViT的核心区别是什么?A1:CNN将局部连接、权值共享和平移等变性等视觉先验写入结构,数据效率高、适合端侧部署;ViT通过自注意力将图像表示为token序列,弱先验使其在大数据预训练下上限更高,但对数据和算力要求更高。Q2:视觉架构经历了哪几个演进阶段?A2:四个阶段:手工特征时代(SIFT/HOG)→CNN崛起(AlexNet/VGG/ResNet)→ViT登场(2020年)→融合时代(Swin/ConvNeXt/CoAtNet)。当前CNN与ViT正从对立走向相互吸收。Q3:ViT是否真的比CNN更强?A3:核心争议在于ViT优势是否来自更大数据和更现代训练范式。ConvNeXt证明纯卷积配合现代训练技巧仍可追平部分ViT。更准确的判断是架构选择取决于数据规模、算力条件和部署约束。Q4:产业中CNN和ViT如何分工?A4:多模态大模型和研究前沿普遍采用ViT视觉编码器(CLIP、SigLIP、Qwen-VL);自动驾驶量产系统受车端算力约束,更多采用CNN前端+BEV/Transformer融合的混合骨干。Q5:什么是物理AI?为什么重要?A5:物理AI是物理世界的AI解决方案。数字AI底座模型难以实现物理世界的建模闭环,物理AI将成为增量更大的方向。智能驾驶作为最先跑通闭环的代表场景,应重点关注。数据来源说明。以上内容基于东吴证券研究所《AI系列深度07期:CNN与ViT两类视觉骨干有何差异?》(2026年7月30日)研究报告整理。
【东吴证券】汽车行业深度报告:AI系列深度07期:CNN与ViT两类视觉骨干有何差异?-260730(10页).pdf_第1页
【东吴证券】汽车行业深度报告:AI系列深度07期:CNN与ViT两类视觉骨干有何差异?-260730(10页).pdf_第2页
【东吴证券】汽车行业深度报告:AI系列深度07期:CNN与ViT两类视觉骨干有何差异?-260730(10页).pdf_第3页
【东吴证券】汽车行业深度报告:AI系列深度07期:CNN与ViT两类视觉骨干有何差异?-260730(10页).pdf_第4页
【东吴证券】汽车行业深度报告:AI系列深度07期:CNN与ViT两类视觉骨干有何差异?-260730(10页).pdf_第5页

点击查看更多