深度报告-20260730-东吴证券-汽车行业深度报告_AI系列深度07期_CNN与ViT两类视觉骨干有何差异_10页_551kb
报告摘要
汽车行业深度报告总结
核心内容
本报告聚焦于人工智能在视觉任务中的应用,重点分析了 CNN(卷积神经网络) 与 ViT(Vision Transformer) 两种视觉骨干网络的差异、演进路径以及在产业中的实际应用。报告指出,视觉骨干网络是机器视觉系统中将原始像素转化为高层语义特征的核心模块,其设计哲学和性能表现直接影响下游任务(如图像分类、目标检测、语义分割等)的上限。
主要观点
1. 视觉架构演进历程
- 手工特征时代:依赖专家设计的 SIFT、HOG 等特征,配合 SVM 等浅层模型完成识别。
- CNN 崛起:从 AlexNet 开始,CNN 通过自动学习局部特征成为主流架构,历经 VGG、ResNet 等迭代,逐步形成成熟产业基础。
- ViT 登场:2020 年 Vision Transformer 将注意力机制引入视觉任务,依赖大规模数据和算力实现全局关系建模。
- 融合时代:2022 年后,Swin、CoAtNet、ConvNeXt 等架构推动 CNN 与 ViT 的融合,形成兼顾局部与全局的混合模型。
2. CNN 与 ViT 的核心差异
| 对比维度 | CNN | ViT |
|---|---|---|
| 感受野 | 逐层扩大,深层才具备全局视野 | 第一层即实现全局交互,具备更灵活的长程依赖建模能力 |
| 归纳偏置 | 强先验假设,如局部连接、权值共享、平移等变性,提升样本效率与训练稳定性 | 弱先验,依赖数据和算力学习图像关系,具备更强的扩展性 |
| 数据效率 | 小数据集表现更优,训练效果容易到达瓶颈 | 数据规模越大,性能提升越明显,对小数据表现较弱 |
| 计算复杂度 | 随分辨率线性增长,硬件友好 | 自注意力机制随分辨率平方增长,算力开销大 |
| 长程依赖 | 需要堆叠深度才能建模,相对困难 | 天然擅长建模长程依赖关系 |
| 部署场景 | 端侧部署成熟,适合实时系统和车载应用 | 部署生态仍在完善,更适合云端训练和研究前沿 |
3. 架构争议与发展趋势
- ViT 是否更强:ViT 的优势主要来自大规模数据和现代训练范式,而非注意力结构本身。ConvNeXt 等 CNN 架构在引入现代训练技巧后,已能追平部分 ViT 表现。
- 归纳偏置的作用:在数据稀缺时,CNN 的强先验是优势;在数据充足时,ViT 的弱先验可能带来更高上限。
- 视觉架构的未来:当前视觉骨干网络正从“强先验”与“弱先验”两端走向动态平衡,根据任务、数据、算力和部署约束进行选择。
关键信息
- CNN 优势:结构先验(局部连接、权值共享、平移等变性)使其在中小数据、端侧部署和实时任务中更具竞争力。
- ViT 优势:在大规模预训练下,其全局建模能力和扩展性更优,适合多模态大模型和研究前沿。
- 产业落地分层:研究前沿多采用 ViT 或类 Transformer 架构;而车载、自动驾驶等量产系统则偏向 CNN 或混合架构。
- 未来方向:物理 AI 将成为 AI 在物理世界应用的增量方向,智能驾驶作为最先跑通闭环的场景,值得重点关注。
风险提示
- 技术迭代不及预期:数字 AI 和物理 AI 技术进展可能低于预期。
- 大模型厂商 ARR 增速放缓:若客户增长、续费率或客单价不及预期,可能导致 ARR 增速放缓。
- 云服务商资本开支不及预期:若自由现金流承压或 AI 算力需求投资回报低于预期,云服务商可能减少资本开支。
- 智能驾驶及机器人商业化落地不及预期:产品可靠性、成本下降或用户需求不足可能导致商业化进程放缓。
产业趋势
- 研究前沿:多模态大模型和 AI 研究普遍采用 ViT 或类 Transformer 架构。
- 端侧量产:自动驾驶等系统受算力、时延和安全约束,倾向于采用 CNN 或混合架构。
- 融合架构:如 Swin、ConvNeXt 等模型正在探索 CNN 与 ViT 的结合,以兼顾结构先验与数据驱动的优势。
总结
CNN 与 ViT 代表了视觉骨干网络的两种设计哲学:CNN 强调结构先验,适合中小数据和端侧部署;ViT 弱化先验,依赖数据和算力,适合大规模预训练和复杂任务。二者之争本质上是视觉系统如何在先验、数据和算力之间实现动态平衡。随着技术发展,融合架构将成为主流,而智能驾驶等场景将作为物理 AI 落地的先锋领域,值得关注。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载