深度报告-20260806-东吴证券-汽车行业深度报告_AI系列深度17期_视觉智能为何引入Transformer_16页_921kb
报告摘要
汽车行业深度报告:视觉智能与 Transformer 的演进
核心内容概述
本报告分析了视觉智能从卷积神经网络(CNN)向 Transformer 架构演进的过程,探讨了两者在归纳偏置、结构设计、任务适配等方面的根本差异,并总结了视觉 Transformer 在技术发展中的阶段性成果和未来趋势。同时,报告指出视觉智能尚未形成如语言模型那样的消费级交互入口,仍以“感知性”中间能力为主。最后,报告对数字 AI 和物理 AI 的发展方向进行了展望,并提出了相关风险提示。
主要观点与关键信息
1. 视觉归纳偏置与 CNN 的优势
-
CNN 在 AI1.0 时代成为视觉核心架构,源于其内置的三项视觉归纳偏置:
- 局部连接:仅关注局部邻域,适用于基础视觉模式识别。
- 权重共享:同一卷积核在图像中重复使用,减少参数量。
- 平移等变性:图像平移后特征图同步平移,增强鲁棒性。
-
这些偏置使 CNN 在数据规模有限时仍能高效学习,但也限制了其全局建模能力、任务通用性与开放性。
2. Transformer 进入视觉的关键
- ViT 的提出:确立“图像 patch 即 token”的输入方式,将二维图像转化为一维序列,接入标准 Transformer 架构。
- Transformer 的优势:
- 全局建模能力强,长距离依赖建模效率更高。
- 接口统一,利于跨任务与跨模态迁移。
- 结构可扩展,适配大规模预训练。
- Transformer 的局限:
- 缺乏视觉归纳偏置,依赖位置编码和大规模数据。
- 计算复杂度随分辨率快速上升,尤其在高分辨率图像中。
3. 视觉 Transformer 的发展阶段
本报告将视觉 Transformer 的发展归纳为三个阶段、九个子阶段:
第一阶段:图像被 token 化
- 1.1 注意力视觉化前史(2017–2019):在 CNN 中引入注意力机制,补足长距离依赖。
- 1.2 图像输入 token 化(2020–2021):ViT、DeiT 等模型确立图像 token 化范式。
- 1.3 输出 token/query 化(2020–2021):DETR、SETR 等模型将检测、分割任务改写为序列输出。
第二阶段:可扩展通用骨干
- 2.1 视觉归纳偏置回归(2021–2022):引入金字塔、窗口注意力等机制,适配多尺度任务。
- 2.2 通用视觉骨干形成(2021–2023):Swin、PVT 等模型成为通用骨干,支持检测、分割等任务。
- 2.3 CNN 与 Transformer 融合再平衡(2022–2024):ConvNeXt、InternImage 等模型融合两者优势,实现双向借鉴。
第三阶段:走向视觉基础模型
- 3.1 自监督视觉预训练(2021–2026):DINO、BEiT、MAE 等推动无标签数据训练,提升通用性。
- 3.2 开放词表视觉模型(2021–2026):CLIP、ALIGN 等实现图文对齐,支持零样本识别。
- 3.3 可提示视觉基础模型(2023–2026):SAM、SAM2、SAM3 等实现基于提示的分割与检测,支持开放任务。
4. 视觉与语言任务的发展对比
- 架构跃迁:ViT 确立图像 token 化,与语言模型的 token 化方式一致。
- 规模跃迁:通过大规模预训练,如 ViT 的数亿图像、CLIP 的 4 亿图文对,验证了 Transformer 的规模化潜力。
- 对齐跃迁:主要通过图文对齐实现,依赖语言模型。
- 推理跃迁:尚未在视觉领域展现,仍处于探索阶段。
5. 视觉 Transformer 的角色定位
- Transformer 在视觉任务中更多作为骨干网络组件,而非“核心本体”。
- 与语言任务不同,视觉数据是二维网格,需通过位置编码、窗口注意力等方式补足空间结构。
- 多模态任务中,Transformer 作为视觉编码器,被语言中枢接入,实现视觉与语言的对齐。
技术演进时间轴
- 2017–2019:注意力机制作为 CNN 增强模块,用于建模长距离依赖。
- 2020:ViT 确立图像 token 化范式,纯 Transformer 可胜任图像分类。
- 2020–2021:DETR、SETR 改写检测与分割输出范式,实现端到端处理。
- 2021:Swin、PVT 等形成通用骨干,支持多尺度任务。
- 2022:ConvNeXt 将 ViT 训练经验反哺 CNN,推动融合再平衡。
- 2021–2023:DINOv2、CLIP、SAM 等推动自监督、图文对齐与可提示分割。
- 2025:DINOv3、SAM3 进一步扩展预训练规模与提示能力。
风险提示
- 技术迭代不及预期:Transformer 在视觉任务中的进展可能低于预期。
- 大模型厂商 ARR 增速放缓:模型厂商收入增长可能受限。
- 云服务商资本开支不及预期:AI 算力需求可能未达预期,影响云服务投入。
- 智能驾驶及机器人商业化落地不及预期:产品可靠性、成本或用户需求可能不足。
结论
视觉 Transformer 的发展并非对 CNN 的彻底替代,而是融合与再平衡的过程。其演进路径体现了对视觉任务特点的适应与改进,最终目标是构建可预训练、可迁移、可提示、可与语言对齐的视觉基础模型。尽管在感知能力上取得突破,但视觉智能尚未形成如语言模型那样的“交互式”应用入口,仍需进一步探索。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载