报告行业投资评级 - 增持(维持)[1] 报告的核心观点 - 视觉骨干网络是机器视觉系统的核心模块,其作用是把原始像素转化为高层语义特征,并决定分类、检测、分割等下游任务上限[4] - CNN与ViT是过去十余年最重要的两代视觉骨干,二者之争本质上是先验、数据和算力如何分工[4] - 视觉架构正在从“强先验”与“弱先验”两端走向任务、数据、算力约束下的动态平衡[4] - 产业落地呈现分层:研究前沿偏ViT,车端量产偏混合[4] - 智能驾驶作为物理AI最先跑通闭环的代表场景,应重点关注[4] 根据相关目录分别进行总结 1. 视觉骨干网络:机器视觉的表征底座 - 视觉骨干网络是计算机视觉系统中将原始像素转化为高层语义特征的核心模块,其表征质量直接决定下游任务上限[9] - 图像识别的根本难点在于语义鸿沟,视觉模型需要对变化保持稳定,又需保留关键差异[9] - 计算机视觉主流任务通常共享“骨干网络+任务头”的范式,CNN与ViT之争影响的是视觉系统的通用表征底座[10] 2. 视觉架构演进:从手工特征到融合骨干 - 视觉架构大体经历四个阶段:手工特征时代、CNN崛起、ViT登场、融合时代[4][17] - 手工特征时代(-2012)依赖SIFT、HOG等专家设计,主要局限是依赖专家经验、难以规模化[11][17] - CNN崛起(2012—2020)以AlexNet、VGG、ResNet为代表,推动机器自动学习视觉特征,形成产业基础[12][13][17] - ViT登场(2020—2022)将图像切分为patch并作为token输入Transformer,使注意力机制进入视觉,其成功的关键前提是数据规模[14][17] - 融合时代(2022—今)以Swin、ConvNeXt、CoAtNet为代表,推动CNN与ViT相互吸收[4][17] 3. CNN 机制:卷积为何适合图像 - CNN的核心机制包括卷积、池化与任务头[15][16][18] - CNN的优势来自三项视觉归纳偏置:局部连接、权值共享和平移等变性,这些结构假设使模型在数据有限时更高效,也更适合端侧和实时部署[4][19] - 局部连接体现了图像的空间局部性假设,是CNN数据效率较高的重要原因[19] - 权值共享使模型具备跨位置泛化能力,是CNN更高效的关键结构设计[19] - 平移等变性使模型更容易识别位置变化下的同一视觉模式[19] 4. ViT 机制:将图像patch化为token序列 - ViT的核心设计包括patch切分、token化与Transformer编码[21] - ViT将图像切分为固定大小patch并投影为token序列,从而可直接复用Transformer编码器[21] - 由于自注意力本身不包含空间顺序信息,ViT需要为每个token加入位置编码[22] - ViT以自注意力实现第一层全局交互,弱先验、强规模化,在大数据预训练下上限更高,但对数据、算力和位置编码依赖更强[4][22] - ViT-H/14在JFT-300M预训练后取得较高ImageNet精度,体现其规模化潜力[22] 5. CNN 与 ViT:先验、数据与部署的四组分歧 - CNN与ViT的差异主要体现在感受野、归纳偏置、数据效率和部署约束四个维度[23][29] - 感受野:CNN的感受野自下而上逐层扩大;ViT从第一层自注意力开始即可实现全局交互[24][29] - 归纳偏置:CNN具有较强归纳偏置(局部连接、权值共享、平移等变性);ViT视觉先验较弱,主要依靠数据学习[25][29] - 数据效率:在中小数据规模下(如ImageNet-1k),CNN通常更具优势;在大规模预训练条件下(如ImageNet-21k、JFT-300M),ViT的扩展性更强[26][27][29] - 计算复杂度与部署场景:标准自注意力计算量随token数量呈平方增长;卷积计算量随分辨率近似线性增长,且端侧部署生态更成熟[28][29] - 现实分工通常表现为:云端训练、研究前沿和多模态大模型偏向ViT;端侧量产和实时系统更多采用CNN或混合架构[28] 6. 核心争议:架构优势与约束边界 - 核心争议在于ViT是否真正“强于”CNN,还是更多受益于更大数据和现代训练范式[4][29] - ConvNeXt证明纯卷积配合现代训练技巧仍可追平部分ViT,表明早期ViT优势不能完全归因于注意力结构本身[4][29] - 更审慎的判断是:在同等数据与训练条件下,CNN与ViT精度可能相近,架构选择取决于数据规模、算力条件、部署约束和任务类型[30] - 关于归纳偏置:数据稀缺时(如工业质检、医疗影像),归纳偏置是资产;数据和算力充足时,强先验可能成为上限约束[31] - 视觉骨干并不存在统一最优解,关键在于任务、数据、算力和部署约束的匹配[31]
汽车行业深度报告AI系列深度07期:CNN与ViT两类视觉骨干有何差异?
东吴证券·2026-07-30 15:07