20260807-东吴证券-汽车行业深度报告_AI系列深度18期_生成智能如何引入Transformer_15页_917kb
报告摘要
汽车行业深度报告总结
核心内容
本报告聚焦于生成式视觉技术的发展历程,分析其从早期模型到当前主流范式的演进路径,并探讨 Transformer 在其中的逐步渗透与应用。尽管报告标题为“汽车行业深度报告”,但内容主要围绕生成式视觉技术,尤其是其与 Transformer 架构的结合,对 AI 领域的影响及未来发展方向进行深入分析。
主要观点
- 生成式视觉的本质:学习图像数据的分布规律,并在文本等条件约束下生成新内容。
- 范式迁移:生成式视觉从 GAN 向 Diffusion 模型迁移,后者以更稳定的加噪—去噪机制确立生成主干。
- Transformer 渗透路径:不同于语言领域中 Transformer 对 RNN 的快速替代,其在视觉生成中逐步渗透,从序列生成器、文本条件编码、扩散骨干替换到多模态统一与时空扩展。
- 技术演进阶段:2013—2015年为奠基期;2016—2019年为 GAN 主导期;2020—2021年为 Diffusion 复兴期;2022年为文本驱动图像生成爆发期;2023年至今为视频与多模态扩展期。
- 未来趋势:生成模型将由单图创作向连续时空与多模态交互演进,Transformer 作为统一建模框架,推动生成式视觉进入新阶段。
关键信息
1. 生成式视觉的发展阶段
| 阶段 | 时间 | 主导范式 | 代表成果 | 阶段定位 |
|---|---|---|---|---|
| 1 | 2013—2015 | VAE/GAN/早期Diffusion/自回归 | VAE、GAN、DCGAN | 生成模型开始由深度神经网络端到端训练 |
| 2 | 2016—2019 | 对抗生成 | pix2pix、CycleGAN、StyleGAN | 图像生成第一次实现高真实感 |
| 3 | 2020—2021 | 去噪扩散 | DDPM、DDIM、Score-based SDE | 生成范式从对抗生成转向逐步去噪 |
| 4 | 2022 | 文本驱动图像生成 | DALL·E2、Imagen、Stable Diffusion | 自然语言成为图像生成入口 |
| 5 | 2023至今 | 可控生成、Diffusion Scaling、视频/多模态扩展 | DiT、Sora、Lumiere、Veo | 从单图走向可控视觉基础模型与连续时空生成 |
2. Transformer 在生成式视觉中的渗透环节
| 环节 | 代表模型 | 应用场景 | 替代组件 | 解决问题 |
|---|---|---|---|---|
| 自回归序列生成器 | VQGAN、DALL·E1 | 序列建模 | 卷积或循环式生成网络 | 证明图像可 token 化、可序列建模 |
| 文本条件编码与注入 | CLIP、Imagen、GLIDE、Stable Diffusion | 文本语义编码 | GAN 时代的类别标签条件 | 自然语言成为生成控制接口 |
| 扩散骨干替换 | DiT | 扩散去噪骨干 | U-Net | 视觉生成接入规模化路线 |
| 多模态统一与时空扩展 | Sora、Veo、GPT-4o | 多模态与时空建模 | 单一图像生成网络 | 从单图走向视频与多模态创作系统 |
3. 技术演进与核心结论
- GAN 的局限:训练不稳定、模式崩溃、缺乏显式似然、语义控制弱。
- Diffusion 的优势:训练更稳定、覆盖度好、可控性强,成为生成式视觉的主流范式。
- Transformer 的作用:在生成式视觉中,Transformer 更多作为工程化骨干与语言控制接口,而非范式更替者。
- 未来方向:生成模型将向多模态与时空连续扩展,Transformer 将在其中发挥更大作用。
风险提示
- 技术迭代与产品化落地不及预期。
- 视频与多模态生成的时间一致性与可控性不足。
- 大模型厂商 ARR 增速放缓。
- 云服务商资本开支不及预期。
- 智能驾驶及机器人商业化落地不及预期。
投资建议
- 报告建议“增持”,认为生成式视觉技术发展路径清晰,未来增长潜力较大。
- 强调物理 AI 的发展将成为 AI 领域增量更大的方向,智能驾驶是其中最具代表性的场景。
免责声明
- 本报告仅供东吴证券客户使用,不构成投资建议。
- 报告内容基于公开信息,不保证准确性与完整性。
- 未经授权,不得翻版、复制或发布本报告内容。
- 投资需谨慎,不应将本报告作为唯一决策依据。
附注
- 本报告由东吴证券研究所发布。
- 投资评级基于相对基准表现,非绝对推荐。
- 报告发布日期:2026年08月07日。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载