深度报告-20260731-东吴证券-汽车行业深度报告_AI系列深度08期_GAN与Diffusion两类生成范式有何差异_12页_569kb
报告摘要
汽车行业深度报告总结
核心内容概述
本报告聚焦于生成模型在人工智能领域的发展,特别是 GAN(生成对抗网络)与 Diffusion(扩散模型)两类生成范式的差异及其在图像和视频生成中的应用趋势。报告指出,随着技术演进,扩散模型已成为当前图像和视频生成的主流技术路线,但在某些特定场景下,GAN 仍具备其独特价值。
主要观点
1. 生成模型的核心目标
- 学习数据背后的分布,生成新样本。
- 与判别模型不同,生成模型关注“如何生成”,而非“识别什么”。
2. GAN 与 Diffusion 的对比
| 对比维度 | GAN | Diffusion |
|---|---|---|
| 采样速度 | 一步生成,速度快 | 多步迭代,推理较慢 |
| 训练稳定性 | 对抗博弈,训练不稳定 | 去噪回归,训练更稳定 |
| 样本多样性 | 易模式崩溃,覆盖不全 | 分布覆盖更全,样本多样性好 |
| 可控性 | 原生控制弱,需额外技巧 | 通过 CFG、ControlNet 等实现强可控性 |
3. 生成模型的发展脉络
- VAE:显式概率建模,训练稳定但生成质量有限。
- GAN:通过对抗博弈生成高质量图像,但训练不稳定。
- 自回归生成:逐元素预测,训练稳定但速度慢。
- Diffusion:通过多步去噪生成样本,训练稳定且覆盖全面。
- 流匹配与得分匹配:统一多条生成路径,提升效率和控制能力。
4. Diffusion 成为主流的原因
- 训练更稳定,易于复现。
- 分布覆盖更全,样本多样性更好。
- 可控性强,支持文本引导、局部编辑等。
5. GAN 的现状与价值
- 仍用于实时生成、人脸合成等对延迟敏感的场景。
- 通过一致性模型、蒸馏等技术实现扩散提速。
- GAN 思想在扩散模型中继续发挥作用,如对抗蒸馏。
6. 生成模型在产业中的应用
- 数字 AI:扩散 + Transformer 成为统一技术栈,竞争焦点转向数据、工程化、成本和产品体验。
- 物理 AI:用于自动驾驶仿真、机器人动作生成等,但需解决动作条件化、长时域一致性、可靠评估等问题。
7. 未来演进方向
- 流匹配与整流:更直接的生成路径,减少采样步数。
- 一致性模型与蒸馏:压缩多步生成为少步,提升推理效率。
- DiT(扩散 + Transformer):实现规模化生成,支撑视频和世界模型发展。
关键信息
- 生成模型:从识别世界走向生成世界,是 AI 发展的重要方向。
- GAN:以对抗博弈为核心,适合实时和特定垂类,但训练不稳定、模式崩溃。
- Diffusion:以去噪过程为核心,训练稳定、分布覆盖全面、可控性强,成为通用生成主线。
- DiT:扩散模型与 Transformer 结合,实现高质量、可扩展的生成能力。
- 产业应用:扩散模型在数字 AI 和物理 AI 领域均有应用,但物理 AI 需更严格的闭环验证。
- 风险提示:
- 技术迭代不及预期。
- 大模型厂商 ARR 增速放缓。
- 云服务商资本开支不及预期。
- 智能驾驶及机器人商业化落地不及预期。
投资建议
- 增持(维持):当前数字 AI 底座模型发展路径逐渐清晰,价值在于确定性。
- 物理 AI:作为 AI 在物理世界的应用方向,是未来增量更大的领域,应重点关注。
结论
GAN 与 Diffusion 是生成模型发展的两条重要路线,各有优劣。随着技术演进,Diffusion 成为图像和视频生成的主流,但 GAN 仍在特定场景中发挥作用。未来,生成模型将向更高效、更可控、更可扩展的方向发展,特别是在与 Transformer 结合后,展现出强大的潜力。在产业层面,生成模型正从内容生产走向物理世界的建模,成为 AI 应用于现实场景的重要工具。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载